AI-For-Beginners/translations/bg/lessons/4-ComputerVision/12-Segmentation/README.md

9.4 KiB
Raw Blame History

Сегментация

Вече научихме за Обектно Разпознаване, което ни позволява да локализираме обекти в изображението чрез предсказване на техните ограничаващи кутии. Въпреки това, за някои задачи не се нуждаем само от ограничаващи кутии, а и от по-прецизна локализация на обектите. Тази задача се нарича сегментация.

Тест преди лекцията

Сегментацията може да се разглежда като класификация на пиксели, при която за всеки пиксел от изображението трябва да предскажем неговия клас (фонът също е един от класовете). Съществуват два основни алгоритъма за сегментация:

  • Семантична сегментация само определя класа на пиксела, без да прави разлика между различни обекти от един и същи клас.
  • Сегментация на обекти разделя класовете на различни екземпляри.

Например, при сегментация на обекти тези овце са различни обекти, но при семантична сегментация всички овце са представени като един клас.

Изображение от тази публикация

Съществуват различни невронни архитектури за сегментация, но всички те имат една и съща структура. По някакъв начин тя е подобна на автоенкодера, за който научихте по-рано, но вместо да реконструираме оригиналното изображение, нашата цел е да реконструираме маска. Следователно, мрежата за сегментация има следните части:

  • Енкодер извлича характеристики от входното изображение.
  • Декодер преобразува тези характеристики в изображение на маска, със същия размер и брой канали, съответстващи на броя на класовете.

Изображение от тази публикация

Особено трябва да споменем функцията на загуба, която се използва за сегментация. При използване на класически автоенкодери трябва да измерим сходството между две изображения и можем да използваме средноквадратична грешка (MSE) за това. При сегментация всеки пиксел в целевото изображение на маската представлява номер на клас (едно-горещо-кодиран по третото измерение), така че трябва да използваме функции на загуба, специфични за класификация - крос-ентропийна загуба, осреднена за всички пиксели. Ако маската е бинарна, се използва бинарна крос-ентропийна загуба (BCE).

Едно-горещото кодиране е начин за кодиране на етикет на клас във вектор с дължина, равна на броя на класовете. Разгледайте тази статия за повече информация за тази техника.

Сегментация за медицински изображения

В този урок ще видим сегментацията в действие, като обучим мрежа да разпознава човешки невуси (известни също като бенки) върху медицински изображения. Ще използваме PH2 База данни с дермоскопски изображения като източник на изображения. Този набор от данни съдържа 200 изображения от три класа: типичен невус, атипичен невус и меланом. Всички изображения също съдържат съответна маска, която очертава невуса.

Тази техника е особено подходяща за този тип медицински изображения, но какви други реални приложения можете да си представите?

navi

Изображение от PH2 База данни

Ще обучим модел да сегментира всеки невус от фона.

✍️ Упражнения: Семантична сегментация

Отворете долупосочените тетрадки, за да научите повече за различни архитектури за семантична сегментация, да практикувате работа с тях и да ги видите в действие.

Тест след лекцията

Заключение

Сегментацията е много мощна техника за класификация на изображения, която надхвърля ограничаващите кутии и достига до класификация на ниво пиксел. Това е техника, използвана в медицинската визуализация, наред с други приложения.

🚀 Предизвикателство

Сегментацията на тяло е само една от обичайните задачи, които можем да изпълняваме с изображения на хора. Други важни задачи включват детекция на скелет и детекция на поза. Изпробвайте библиотеката OpenPose, за да видите как може да се използва детекцията на поза.

Преглед и самостоятелно обучение

Тази статия в Уикипедия предлага добър преглед на различните приложения на тази техника. Научете повече самостоятелно за поддомените на сегментацията на обекти и паноптичната сегментация в тази област на изследване.

Задача

В тази лабораторна работа опитайте сегментация на човешко тяло с помощта на Segmentation Full Body MADS Dataset от Kaggle.

Отказ от отговорност:
Този документ е преведен с помощта на AI услуга за превод Co-op Translator. Въпреки че се стремим към точност, моля, имайте предвид, че автоматичните преводи може да съдържат грешки или неточности. Оригиналният документ на неговия изходен език трябва да се счита за авторитетен източник. За критична информация се препоръчва професионален превод от човек. Не носим отговорност за каквито и да било недоразумения или погрешни интерпретации, произтичащи от използването на този превод.