AI-For-Beginners/translations/ru/lessons/4-ComputerVision/07-ConvNets/CNN_Architectures.md

9.2 KiB
Raw Blame History

Известные архитектуры CNN

VGG-16

VGG-16 — это сеть, которая достигла 92,7% точности в классификации топ-5 на ImageNet в 2014 году. Она имеет следующую структуру слоев:

ImageNet Layers

Как вы можете видеть, VGG следует традиционной пирамидальной архитектуре, которая представляет собой последовательность слоев свертки и подвыборки.

ImageNet Pyramid

Изображение из Researchgate

ResNet

ResNet — это семейство моделей, предложенное Microsoft Research в 2015 году. Основная идея ResNet заключается в использовании остаточных блоков:

Изображение из этой статьи

Причина использования пропуска идентичности заключается в том, чтобы наш слой предсказывал разницу между результатом предыдущего слоя и выходом остаточного блока — отсюда и название остаточный. Эти блоки гораздо легче обучать, и можно строить сети с несколькими сотнями таких блоков (наиболее распространенные варианты — ResNet-52, ResNet-101 и ResNet-152).

Вы также можете рассматривать эту сеть как способ регулировки своей сложности в зависимости от набора данных. Изначально, когда вы начинаете обучение сети, значения весов малы, и большая часть сигнала проходит через слои идентичности. По мере продвижения обучения и увеличения весов значимость параметров сети возрастает, и сеть адаптируется, чтобы обеспечить необходимую выразительную мощь для правильной классификации обучающих изображений.

Google Inception

Архитектура Google Inception продвигает эту идею на шаг дальше и строит каждый слой сети как комбинацию нескольких различных путей:

Изображение из Researchgate

Здесь необходимо подчеркнуть роль сверток 1x1, потому что на первый взгляд они не имеют смысла. Зачем нам проходить через изображение с фильтром 1x1? Однако следует помнить, что свертки также работают с несколькими каналами глубины (изначально - RGB цвета, в последующих слоях - каналы для различных фильтров), и свертка 1x1 используется для смешивания этих входных каналов вместе с использованием различных обучаемых весов. Это также можно рассматривать как уменьшение размерности (пулинг) по канальному измерению.

Вот хорошая статья в блоге на эту тему и оригинальная статья.

MobileNet

MobileNet — это семейство моделей с уменьшенным размером, подходящих для мобильных устройств. Используйте их, если у вас ограничены ресурсы и вы готовы пожертвовать немного точности. Основная идея заключается в так называемой глубинной разделяемой свертке, которая позволяет представлять свертки фильтров как композицию пространственных сверток и сверток 1x1 по каналам глубины. Это значительно уменьшает количество параметров, делая сеть меньшего размера и также упрощая обучение с меньшим объемом данных.

Вот хорошая статья в блоге о MobileNet.

Заключение

В этом разделе вы узнали основную концепцию нейронных сетей компьютерного зрения — свёрточных сетей. Архитектуры реального мира, которые обеспечивают классификацию изображений, обнаружение объектов и даже генерацию изображений, все основаны на CNN, просто с большим количеством слоев и некоторыми дополнительными приемами обучения.

🚀 Задача

В сопроводительных блокнотах есть заметки внизу о том, как достичь большей точности. Проведите несколько экспериментов, чтобы увидеть, сможете ли вы достичь более высокой точности.

Викторина после лекции

Обзор и самостоятельное изучение

Хотя CNN чаще всего используются для задач компьютерного зрения, они также хороши для извлечения фиксированных шаблонов. Например, если мы имеем дело со звуками, мы также можем использовать CNN для поиска некоторых специфических паттернов в аудиосигнале — в этом случае фильтры будут одномерными (и эту CNN будут называть 1D-CNN). Также иногда используется 3D-CNN для извлечения признаков в многомерном пространстве, таких как определенные события, происходящие на видео — CNN может захватывать определенные паттерны изменения признаков во времени. Проведите обзор и самостоятельное изучение других задач, которые можно выполнить с помощью CNN.

Задание

В этой лабораторной работе вам предстоит классифицировать различные породы кошек и собак. Эти изображения более сложные, чем набор данных MNIST, и имеют более высокие размеры, и классов больше 10.

Отказ от ответственности:
Этот документ был переведен с использованием услуг машинного перевода на основе ИИ. Хотя мы стремимся к точности, пожалуйста, имейте в виду, что автоматические переводы могут содержать ошибки или неточности. Оригинальный документ на его родном языке следует считать авторитетным источником. Для критически важной информации рекомендуется профессиональный человеческий перевод. Мы не несем ответственности за любые недоразумения или неправильные интерпретации, возникающие в результате использования этого перевода.