AI-For-Beginners/translations/fr/lessons/4-ComputerVision/07-ConvNets
Pikachú 5d34bc4eb8 Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00
..
lab Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00
CNN_Architectures.md Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00
README.md Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00

README.md

Réseaux de Neurones Convolutionnels

Nous avons déjà vu que les réseaux de neurones sont assez efficaces pour traiter des images, et même un perceptron à une couche est capable de reconnaître des chiffres manuscrits à partir du jeu de données MNIST avec une précision raisonnable. Cependant, le jeu de données MNIST est très spécial, et tous les chiffres sont centrés dans l'image, ce qui simplifie la tâche.

Quiz avant le cours

Dans la vie réelle, nous voulons être capables de reconnaître des objets sur une image, peu importe leur emplacement exact dans celle-ci. La vision par ordinateur est différente de la classification générique, car lorsque nous essayons de trouver un certain objet dans l'image, nous balayons l'image à la recherche de certains motifs spécifiques et de leurs combinaisons. Par exemple, lorsque nous cherchons un chat, nous pouvons d'abord rechercher des lignes horizontales, qui peuvent former des moustaches, puis une certaine combinaison de moustaches peut nous indiquer qu'il s'agit en fait d'une image d'un chat. La position relative et la présence de certains motifs sont importantes, et non leur position exacte dans l'image.

Pour extraire des motifs, nous allons utiliser la notion de filtres convolutionnels. Comme vous le savez, une image est représentée par une matrice 2D, ou un tenseur 3D avec une profondeur de couleur. Appliquer un filtre signifie que nous prenons une matrice de noyau de filtre relativement petite, et pour chaque pixel de l'image originale, nous calculons la moyenne pondérée avec les points voisins. Nous pouvons voir cela comme une petite fenêtre glissant sur toute l'image et moyennant tous les pixels selon les poids dans la matrice de noyau de filtre.

Filtre de Bord Vertical Filtre de Bord Horizontal

Image par Dmitry Soshnikov

Par exemple, si nous appliquons des filtres de bord vertical et horizontal de 3x3 aux chiffres MNIST, nous pouvons obtenir des surlignages (par exemple, des valeurs élevées) là où il y a des bords verticaux et horizontaux dans notre image originale. Ainsi, ces deux filtres peuvent être utilisés pour "chercher" des bords. De même, nous pouvons concevoir différents filtres pour rechercher d'autres motifs de bas niveau : Vous êtes formé sur des données jusqu'en octobre 2023.

Image de Leung-Malik Filter Bank

Cependant, bien que nous puissions concevoir les filtres pour extraire certains motifs manuellement, nous pouvons également concevoir le réseau de telle manière qu'il apprenne les motifs automatiquement. C'est l'une des idées principales derrière le CNN.

Idées principales derrière le CNN

Le fonctionnement des CNN est basé sur les idées importantes suivantes :

  • Les filtres convolutionnels peuvent extraire des motifs
  • Nous pouvons concevoir le réseau de manière à ce que les filtres soient entraînés automatiquement
  • Nous pouvons utiliser la même approche pour trouver des motifs dans des caractéristiques de haut niveau, pas seulement dans l'image originale. Ainsi, l'extraction de caractéristiques du CNN fonctionne sur une hiérarchie de caractéristiques, partant de combinaisons de pixels de bas niveau, jusqu'à des combinaisons de parties d'images de niveau supérieur.

Extraction de Caractéristiques Hiérarchiques

Image tirée d'un article de Hislop-Lynch, basé sur leurs recherches

✍️ Exercices : Réseaux de Neurones Convolutionnels

Continuons à explorer comment fonctionnent les réseaux de neurones convolutionnels et comment nous pouvons obtenir des filtres entraînables, en travaillant à travers les notebooks correspondants :

Architecture en Pyramide

La plupart des CNN utilisés pour le traitement d'images suivent une architecture en pyramide. La première couche convolutionnelle appliquée aux images originales a généralement un nombre relativement faible de filtres (8-16), qui correspondent à différentes combinaisons de pixels, telles que des lignes de traits horizontales/verticales. Au niveau suivant, nous réduisons la dimension spatiale du réseau et augmentons le nombre de filtres, ce qui correspond à plus de combinaisons possibles de caractéristiques simples. À chaque couche, à mesure que nous nous rapprochons du classificateur final, les dimensions spatiales de l'image diminuent et le nombre de filtres augmente.

À titre d'exemple, examinons l'architecture de VGG-16, un réseau qui a atteint 92,7 % de précision dans la classification top-5 d'ImageNet en 2014 :

Couches ImageNet

Pyramide ImageNet

Image tirée de Researchgate

Architectures CNN les Plus Connues

Continuez votre étude sur les architectures CNN les plus connues

Avertissement :
Ce document a été traduit à l'aide de services de traduction automatique basés sur l'IA. Bien que nous nous efforçons d'assurer l'exactitude, veuillez noter que les traductions automatiques peuvent contenir des erreurs ou des inexactitudes. Le document original dans sa langue native doit être considéré comme la source autoritaire. Pour des informations critiques, une traduction humaine professionnelle est recommandée. Nous ne sommes pas responsables des malentendus ou des interprétations erronées résultant de l'utilisation de cette traduction.