AI-For-Beginners/translations/sr/lessons/4-ComputerVision/07-ConvNets/CNN_Architectures.md

8.8 KiB
Raw Blame History

Познате CNN архитектуре

VGG-16

VGG-16 је мрежа која је постигла тачност од 92.7% у ImageNet top-5 класификацији 2014. године. Има следећу структуру слојева:

ImageNet слојеви

Као што можете видети, VGG прати традиционалну пирамидалну архитектуру, која је низ слојева за конволуцију и пуловање.

ImageNet пирамида

Слика са Researchgate

ResNet

ResNet је породица модела коју је предложио Microsoft Research 2015. године. Главна идеја ResNet-а је коришћење резидуалних блокова:

Слика из овог рада

Разлог за коришћење идентитетског пролаза је да слој предвиђа разлику између резултата претходног слоја и излаза резидуалног блока - отуда назив резидуални. Ови блокови су много лакши за тренирање, и могуће је конструисати мреже са неколико стотина оваквих блокова (најчешће варијанте су ResNet-52, ResNet-101 и ResNet-152).

Можете замислити ову мрежу као способну да прилагоди своју сложеност датом скупу података. У почетку, када почињете са тренирањем мреже, вредности тежина су мале, и већина сигнала пролази кроз идентитетске слојеве. Како тренирање напредује и тежине постају веће, значај параметара мреже расте, а мрежа се прилагођава како би обезбедила потребну изражајну моћ за правилну класификацију слика за тренирање.

Google Inception

Google Inception архитектура иде корак даље и гради сваки слој мреже као комбинацију неколико различитих путева:

Слика са Researchgate

Овде треба нагласити улогу 1x1 конволуција, јер на први поглед немају смисла. Зашто бисмо пролазили кроз слику са 1x1 филтером? Међутим, треба имати на уму да конволуциони филтери такође раде са неколико дубинских канала (првобитно - RGB боје, у наредним слојевима - канали за различите филтере), а 1x1 конволуција се користи за мешање тих улазних канала заједно користећи различите тежине које се тренирају. Такође се може посматрати као пуловање (смањење димензија) преко димензије канала.

Ево одличног блога на ову тему, као и оригиналног рада.

MobileNet

MobileNet је породица модела смањене величине, погодна за мобилне уређаје. Користите их ако имате ограничене ресурсе и можете жртвовати мало тачности. Главна идеја иза њих је такозвана дубински раздвојена конволуција, која омогућава представљање конволуционих филтера као композицију просторних конволуција и 1x1 конволуције преко дубинских канала. Ово значајно смањује број параметара, чинећи мрежу мањом по величини, а такође и лакшом за тренирање са мање података.

Ево одличног блога о MobileNet-у.

Закључак

У овој јединици сте научили главни концепт иза неуронских мрежа за рачунарски вид - конволуционе мреже. Реалне архитектуре које покрећу класификацију слика, детекцију објеката, па чак и мреже за генерисање слика, све су засноване на CNN-овима, само са више слојева и неким додатним триковима за тренирање.

🚀 Изазов

У пратећим бележницама постоје белешке на дну о томе како постићи већу тачност. Урадите неке експерименте да видите да ли можете постићи већу тачност.

Квиз након предавања

Преглед и самостално учење

Иако се CNN-ови најчешће користе за задатке рачунарског вида, они су генерално добри за извлачење образаца фиксне величине. На пример, ако радимо са звуковима, можда ћемо такође желети да користимо CNN-ове за тражење одређених образаца у аудио сигналу - у том случају филтери би били једнодимензионални (и овај CNN би се звао 1D-CNN). Такође, понекад се користи 3D-CNN за извлачење карактеристика у вишедимензионалном простору, као што су одређени догађаји који се дешавају на видео снимку - CNN може ухватити одређене обрасце промена карактеристика током времена. Урадите преглед и самостално учење о другим задацима који се могу обавити помоћу CNN-ова.

Задатак

У овој лабораторији, ваш задатак је класификација различитих раса мачака и паса. Ове слике су сложеније од MNIST скупа података, имају веће димензије и више од 10 класа.

Одрицање од одговорности:
Овај документ је преведен коришћењем услуге за превођење помоћу вештачке интелигенције Co-op Translator. Иако се трудимо да обезбедимо тачност, молимо вас да имате у виду да аутоматски преводи могу садржати грешке или нетачности. Оригинални документ на његовом изворном језику треба сматрати меродавним извором. За критичне информације препоручује се професионални превод од стране људи. Не преузимамо одговорност за било каква погрешна тумачења или неспоразуме који могу настати услед коришћења овог превода.