|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CNN_Architectures.md | ||
| ConvNetsPyTorch.ipynb | ||
| ConvNetsTF.ipynb | ||
| README.md | ||
README.md
Конволуционе неуронске мреже
Већ смо видели да су неуронске мреже прилично добре у обради слика, па чак и једнослојни перцептрон може са задовољавајућом тачношћу препознати руком писане цифре из MNIST скупа података. Међутим, MNIST скуп података је веома специфичан, јер су све цифре центриране унутар слике, што чини задатак једноставнијим.
Квиз пре предавања
У стварном животу, желимо да будемо у могућности да препознамо објекте на слици без обзира на њихову тачну локацију унутар слике. Рачунарски вид се разликује од опште класификације, јер када покушавамо да пронађемо одређени објекат на слици, скенирамо слику тражећи специфичне шаблоне и њихове комбинације. На пример, када тражимо мачку, прво можемо тражити хоризонталне линије које могу формирати бркове, а затим одређена комбинација бркова може указати да је то заправо слика мачке. Релативна позиција и присуство одређених шаблона су важни, а не њихова тачна позиција на слици.
Да бисмо извукли шаблоне, користићемо концепт конволуционих филтера. Као што знате, слика је представљена 2Д-матрицом или 3Д-тензором са дубином боје. Примена филтера значи да узимамо релативно малу матрицу језгра филтера, и за сваки пиксел у оригиналној слици израчунавамо пондерисани просек са суседним тачкама. Ово можемо замислити као мали прозор који клизи преко целе слике и израчунава просек свих пиксела у складу са тежинама у матрици језгра филтера.
![]() |
![]() |
|---|
Слика: Дмитриј Сошњиков
На пример, ако применимо 3x3 филтере за вертикалне и хоризонталне ивице на цифре из MNIST скупа, можемо добити истакнуте делове (нпр. високе вредности) тамо где постоје вертикалне и хоризонталне ивице у нашој оригиналној слици. Тако ова два филтера могу бити коришћена за "проналажење" ивица. Слично томе, можемо дизајнирати различите филтере за проналажење других ниско-нивоа шаблона:
Слика Leung-Malik филтер банке
Међутим, док можемо ручно дизајнирати филтере за извлачење одређених шаблона, можемо такође дизајнирати мрежу на такав начин да она сама научи шаблоне. Ово је једна од главних идеја иза CNN-а.
Главне идеје иза CNN-а
Начин на који CNN-ови функционишу заснован је на следећим важним идејама:
- Конволуциони филтери могу извлачити шаблоне
- Мрежу можемо дизајнирати тако да се филтери аутоматски тренирају
- Исти приступ можемо користити за проналажење шаблона у високим нивоима карактеристика, а не само у оригиналној слици. Тако екстракција карактеристика у CNN-у функционише на хијерархији карактеристика, почевши од ниско-нивоа комбинација пиксела, па све до високих нивоа комбинација делова слике.
Слика из рада Хислоп-Линча, засновано на њиховом истраживању
✍️ Вежбе: Конволуционе неуронске мреже
Наставимо са истраживањем како конволуционе неуронске мреже функционишу и како можемо постићи тренирање филтера, радећи кроз одговарајуће бележнице:
Пирамидална архитектура
Већина CNN-ова који се користе за обраду слика прати такозвану пирамидалну архитектуру. Први конволуциони слој примењен на оригиналне слике обично има релативно мали број филтера (8-16), који одговарају различитим комбинацијама пиксела, као што су хоризонталне/вертикалне линије или потези. На следећем нивоу смањујемо просторну димензију мреже и повећавамо број филтера, што одговара већем броју могућих комбинација једноставних карактеристика. Са сваким слојем, како се приближавамо финалном класификатору, просторне димензије слике се смањују, а број филтера расте.
Као пример, погледајмо архитектуру VGG-16, мреже која је постигла 92.7% тачности у топ-5 класификацији ImageNet-а 2014. године:
Слика са Researchgate
Најпознатије CNN архитектуре
Наставите са проучавањем најпознатијих CNN архитектура
Одрицање од одговорности:
Овај документ је преведен коришћењем услуге за превођење помоћу вештачке интелигенције Co-op Translator. Иако се трудимо да обезбедимо тачност, молимо вас да имате у виду да аутоматски преводи могу садржати грешке или нетачности. Оригинални документ на његовом изворном језику треба сматрати меродавним извором. За критичне информације препоручује се професионални превод од стране људи. Не преузимамо одговорност за било каква погрешна тумачења или неспоразуме који могу настати услед коришћења овог превода.




