9.3 KiB
Известные архитектуры CNN
VGG-16
VGG-16 — это сеть, которая достигла 92.7% точности в классификации ImageNet (топ-5) в 2014 году. Она имеет следующую структуру слоев:
Как видно, VGG следует традиционной пирамидальной архитектуре, которая представляет собой последовательность слоев свертки и пуллинга.
Изображение с Researchgate
ResNet
ResNet — это семейство моделей, предложенных Microsoft Research в 2015 году. Основная идея ResNet заключается в использовании остаточных блоков:
Изображение из этой статьи
Причина использования прямого прохода через идентичность заключается в том, чтобы слой предсказывал разницу между результатом предыдущего слоя и выходом остаточного блока — отсюда и название остаточный. Эти блоки гораздо легче обучать, и можно создавать сети с несколькими сотнями таких блоков (наиболее распространенные варианты — ResNet-52, ResNet-101 и ResNet-152).
Эту сеть также можно рассматривать как способную адаптировать свою сложность к набору данных. Изначально, когда вы только начинаете обучение сети, значения весов малы, и большая часть сигнала проходит через идентичные слои. По мере обучения и увеличения весов значимость параметров сети возрастает, и сеть адаптируется, чтобы обеспечить необходимую выразительность для правильной классификации обучающих изображений.
Google Inception
Архитектура Google Inception идет еще дальше и строит каждый слой сети как комбинацию нескольких различных путей:
Изображение с Researchgate
Здесь важно подчеркнуть роль сверток 1x1, так как на первый взгляд они кажутся бессмысленными. Зачем нам нужен фильтр 1x1 для обработки изображения? Однако нужно помнить, что свертки работают также с несколькими каналами глубины (изначально — RGB-цвета, в последующих слоях — каналы для различных фильтров), и свертка 1x1 используется для смешивания этих входных каналов с использованием различных обучаемых весов. Это также можно рассматривать как уменьшение размерности (пуллинг) по измерению каналов.
Вот хороший блог-пост на эту тему и оригинальная статья.
MobileNet
MobileNet — это семейство моделей уменьшенного размера, подходящих для мобильных устройств. Используйте их, если у вас ограничены ресурсы и вы готовы пожертвовать небольшой точностью. Основная идея этих моделей — так называемая глубинно-разделяемая свертка, которая позволяет представлять свертки как композицию пространственных сверток и сверток 1x1 по каналам глубины. Это значительно уменьшает количество параметров, делая сеть компактнее и проще для обучения на меньших объемах данных.
Вот хороший блог-пост о MobileNet.
Заключение
В этом разделе вы узнали основную концепцию нейронных сетей для компьютерного зрения — сверточные сети. Реальные архитектуры, которые используются для классификации изображений, обнаружения объектов и даже генерации изображений, основаны на CNN, только с большим количеством слоев и дополнительными приемами обучения.
🚀 Задание
В сопровождающих ноутбуках есть заметки внизу о том, как добиться большей точности. Проведите эксперименты, чтобы попытаться достичь более высокой точности.
Викторина после лекции
Обзор и самостоятельное изучение
Хотя CNN чаще всего используются для задач компьютерного зрения, они в целом хорошо подходят для извлечения фиксированных шаблонов. Например, если мы работаем со звуками, мы также можем использовать CNN для поиска определенных шаблонов в аудиосигнале — в этом случае фильтры будут одномерными (и такая CNN будет называться 1D-CNN). Также иногда используется 3D-CNN для извлечения признаков в многомерном пространстве, например, для анализа событий, происходящих на видео — CNN может захватывать определенные шаблоны изменения признаков во времени. Проведите обзор и самостоятельное изучение других задач, которые можно решать с помощью CNN.
Задание
В этой лабораторной работе вам предстоит классифицировать различные породы кошек и собак. Эти изображения более сложные, чем набор данных MNIST, имеют более высокие размеры, и классов больше 10.
Отказ от ответственности:
Этот документ был переведен с использованием сервиса автоматического перевода Co-op Translator. Хотя мы стремимся к точности, пожалуйста, учитывайте, что автоматические переводы могут содержать ошибки или неточности. Оригинальный документ на его родном языке следует считать авторитетным источником. Для получения критически важной информации рекомендуется профессиональный перевод человеком. Мы не несем ответственности за любые недоразумения или неправильные интерпретации, возникшие в результате использования данного перевода.

