AI-For-Beginners/translations/ru/lessons/4-ComputerVision/12-Segmentation/README.md

9.5 KiB
Raw Blame History

Сегментация

Ранее мы изучали обнаружение объектов, которое позволяет находить объекты на изображении, предсказывая их ограничивающие рамки. Однако для некоторых задач нам нужны не только рамки, но и более точная локализация объектов. Эта задача называется сегментацией.

Тест перед лекцией

Сегментацию можно рассматривать как классификацию пикселей, где для каждого пикселя изображения необходимо предсказать его класс (фон является одним из классов). Существует два основных алгоритма сегментации:

  • Семантическая сегментация определяет только класс пикселя, не различая отдельные объекты одного и того же класса.
  • Сегментация экземпляров разделяет классы на отдельные экземпляры.

Например, для сегментации экземпляров эти овцы считаются разными объектами, а для семантической сегментации все овцы представлены одним классом.

Изображение из этой статьи

Существуют различные нейронные архитектуры для сегментации, но все они имеют одинаковую структуру. В некотором смысле, она похожа на автокодировщик, о котором вы узнали ранее, но вместо деконструкции исходного изображения наша цель — деконструировать маску. Таким образом, сеть сегментации состоит из следующих частей:

  • Энкодер извлекает признаки из входного изображения.
  • Декодер преобразует эти признаки в маску изображения, с тем же размером и количеством каналов, соответствующим количеству классов.

Изображение из этой публикации

Особое внимание следует уделить функции потерь, используемой для сегментации. При использовании классических автокодировщиков необходимо измерить сходство между двумя изображениями, и для этого можно использовать среднеквадратичную ошибку (MSE). В сегментации каждый пиксель целевой маски изображения представляет номер класса (закодированный в формате one-hot вдоль третьего измерения), поэтому необходимо использовать функции потерь, специфичные для классификации — перекрестную энтропию, усредненную по всем пикселям. Если маска бинарная, используется перекрестная энтропия для бинарных данных (BCE).

One-hot кодирование — это способ преобразования метки класса в вектор длиной, равной количеству классов. Ознакомьтесь с этой статьей о данной технике.

Сегментация в медицинской визуализации

В этом уроке мы увидим сегментацию в действии, обучая сеть распознавать невусы (также известные как родинки) на медицинских изображениях. Мы будем использовать базу данных PH2 дерматоскопических изображений в качестве источника изображений. Этот набор данных содержит 200 изображений трех классов: типичный невус, атипичный невус и меланома. Все изображения также содержат соответствующую маску, которая очерчивает невус.

Этот метод особенно подходит для такого типа медицинской визуализации, но какие еще реальные приложения вы могли бы представить?

navi

Изображение из базы данных PH2

Мы обучим модель сегментировать любой невус от его фона.

✍️ Упражнения: Семантическая сегментация

Откройте ноутбуки ниже, чтобы узнать больше о различных архитектурах семантической сегментации, попрактиковаться с ними и увидеть их в действии.

Тест после лекции

Заключение

Сегментация — это очень мощная техника классификации изображений, которая выходит за рамки ограничивающих рамок и переходит к классификации на уровне пикселей. Она используется в медицинской визуализации и других приложениях.

🚀 Задание

Сегментация тела — это лишь одна из распространенных задач, которые можно выполнять с изображениями людей. Другие важные задачи включают обнаружение скелета и определение позы. Попробуйте библиотеку OpenPose, чтобы увидеть, как можно использовать определение позы.

Обзор и самостоятельное изучение

Эта статья в Википедии предлагает хороший обзор различных приложений данной техники. Узнайте больше самостоятельно о поддомах сегментации экземпляров и паноптической сегментации в этой области исследований.

Задание

В этой лабораторной работе попробуйте сегментацию человеческого тела с использованием Segmentation Full Body MADS Dataset с Kaggle.

Отказ от ответственности:
Этот документ был переведен с использованием сервиса автоматического перевода Co-op Translator. Хотя мы стремимся к точности, пожалуйста, учитывайте, что автоматические переводы могут содержать ошибки или неточности. Оригинальный документ на его родном языке следует считать авторитетным источником. Для получения критически важной информации рекомендуется профессиональный перевод человеком. Мы не несем ответственности за любые недоразумения или неправильные интерпретации, возникающие в результате использования данного перевода.