AI-For-Beginners/translations/bg/lessons/4-ComputerVision/07-ConvNets
leestott fee00e62ca 🌐 Update translations via Co-op Translator 2025-08-30 01:17:50 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-30 01:17:50 +00:00
CNN_Architectures.md 🌐 Update translations via Co-op Translator 2025-08-26 01:51:51 +00:00
ConvNetsPyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 01:17:50 +00:00
ConvNetsTF.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 01:17:50 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-26 01:51:51 +00:00

README.md

Конволюционни невронни мрежи

Вече видяхме, че невронните мрежи са доста добри в работата с изображения, и дори еднослоен перцептрон може да разпознава ръкописни цифри от набора данни MNIST с приемлива точност. Въпреки това, MNIST е много специален набор от данни, където всички цифри са центрирани в изображението, което прави задачата по-лесна.

Тест преди лекцията

В реалния живот искаме да можем да разпознаваме обекти на изображение, независимо от тяхното точно местоположение. Компютърното зрение е различно от обикновената класификация, защото когато се опитваме да намерим определен обект в изображението, ние сканираме изображението, търсейки специфични модели и техните комбинации. Например, когато търсим котка, първо може да търсим хоризонтални линии, които могат да формират мустаци, а след това определена комбинация от мустаци може да ни подскаже, че това всъщност е изображение на котка. Относителната позиция и наличието на определени модели са важни, а не тяхното точно местоположение в изображението.

За да извлечем модели, ще използваме понятието за конволюционни филтри. Както знаете, изображението се представя чрез 2D-матрица или 3D-тензор с цветова дълбочина. Прилагането на филтър означава, че вземаме сравнително малка матрица, наречена ядро на филтъра, и за всеки пиксел в оригиналното изображение изчисляваме претегленото средно с околните точки. Можем да си представим това като малък прозорец, който се плъзга по цялото изображение и осреднява всички пиксели според теглата в матрицата на ядрото на филтъра.

Филтър за вертикални ръбове Филтър за хоризонтални ръбове

Изображение от Дмитрий Сошников

Например, ако приложим 3x3 филтри за вертикални и хоризонтални ръбове към цифрите от MNIST, можем да получим акценти (например високи стойности) там, където има вертикални и хоризонтални ръбове в оригиналното изображение. Така тези два филтъра могат да се използват за "търсене" на ръбове. По същия начин можем да проектираме различни филтри, за да търсим други нискоуровневи модели:

Изображение на Leung-Malik Filter Bank

Въпреки това, докато можем ръчно да проектираме филтри за извличане на определени модели, можем също така да проектираме мрежата така, че тя да научава моделите автоматично. Това е една от основните идеи зад CNN.

Основни идеи зад CNN

Работата на CNN се основава на следните важни идеи:

  • Конволюционните филтри могат да извличат модели
  • Можем да проектираме мрежата така, че филтрите да се обучават автоматично
  • Можем да използваме същия подход, за да намираме модели в характеристики на високо ниво, а не само в оригиналното изображение. Така извличането на характеристики в CNN работи на йерархия от характеристики, започвайки от нискоуровневи комбинации от пиксели до по-високо ниво комбинации от части на изображението.

Йерархично извличане на характеристики

Изображение от статия на Hislop-Lynch, базирано на тяхното изследване

✍️ Упражнения: Конволюционни невронни мрежи

Нека продължим да изследваме как работят конволюционните невронни мрежи и как можем да постигнем обучаеми филтри, като преминем през съответните тетрадки:

Пирамидална архитектура

Повечето CNN, използвани за обработка на изображения, следват така наречената пирамидална архитектура. Първият конволюционен слой, приложен към оригиналните изображения, обикновено има сравнително малък брой филтри (8-16), които съответстват на различни комбинации от пиксели, като хоризонтални/вертикални линии или щрихи. На следващото ниво намаляваме пространственото измерение на мрежата и увеличаваме броя на филтрите, което съответства на повече възможни комбинации от прости характеристики. С всеки слой, докато се придвижваме към крайния класификатор, пространствените измерения на изображението намаляват, а броят на филтрите нараства.

Като пример, нека разгледаме архитектурата на VGG-16, мрежа, която постигна 92.7% точност в класификацията на ImageNet в топ-5 през 2014 г.:

Слоеве на ImageNet

Пирамида на ImageNet

Изображение от Researchgate

Най-известни архитектури на CNN

Продължете изучаването на най-известните архитектури на CNN

Отказ от отговорност:
Този документ е преведен с помощта на AI услуга за превод Co-op Translator. Въпреки че се стремим към точност, моля, имайте предвид, че автоматизираните преводи може да съдържат грешки или неточности. Оригиналният документ на неговия роден език трябва да се счита за авторитетен източник. За критична информация се препоръчва професионален човешки превод. Не носим отговорност за недоразумения или погрешни интерпретации, произтичащи от използването на този превод.