|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CNN_Architectures.md | ||
| README.md | ||
README.md
Réseaux de Neurones Convolutionnels
Nous avons déjà constaté que les réseaux de neurones sont assez efficaces pour traiter des images, et même un perceptron à une couche est capable de reconnaître des chiffres manuscrits à partir du jeu de données MNIST avec une précision raisonnable. Cependant, le jeu de données MNIST est très particulier, et tous les chiffres sont centrés dans l'image, ce qui simplifie la tâche.
Quiz pré-conférence
Dans la vie réelle, nous voulons être capables de reconnaître des objets sur une image, peu importe leur emplacement exact dans celle-ci. La vision par ordinateur diffère de la classification générique, car lorsque nous essayons de trouver un certain objet dans l'image, nous scannons l'image à la recherche de certains modèles et de leurs combinaisons. Par exemple, lorsque nous cherchons un chat, nous pouvons d'abord rechercher des lignes horizontales, qui peuvent former des moustaches, et ensuite une certaine combinaison de moustaches peut nous indiquer qu'il s'agit en fait d'une image d'un chat. La position relative et la présence de certains modèles sont importantes, et non leur position exacte dans l'image.
Pour extraire des modèles, nous utiliserons la notion de filtres convolutionnels. Comme vous le savez, une image est représentée par une matrice 2D, ou un tenseur 3D avec une profondeur de couleur. Appliquer un filtre signifie que nous prenons une matrice de noyau de filtre relativement petite, et pour chaque pixel de l'image originale, nous calculons la moyenne pondérée avec les points voisins. Nous pouvons voir cela comme une petite fenêtre glissant sur toute l'image, et moyennant tous les pixels selon les poids dans la matrice du noyau de filtre.
![]() |
![]() |
|---|
Image par Dmitry Soshnikov
Par exemple, si nous appliquons des filtres de bord vertical et horizontal 3x3 aux chiffres MNIST, nous pouvons obtenir des surlignages (par exemple, des valeurs élevées) là où se trouvent des bords verticaux et horizontaux dans notre image originale. Ainsi, ces deux filtres peuvent être utilisés pour "chercher" des bords. De même, nous pouvons concevoir différents filtres pour rechercher d'autres modèles de bas niveau : Vous êtes formé sur des données jusqu'à octobre 2023.
Image de Banque de Filtres Leung-Malik
Cependant, bien que nous puissions concevoir les filtres pour extraire certains modèles manuellement, nous pouvons également concevoir le réseau de manière à ce qu'il apprenne les modèles automatiquement. C'est l'une des idées principales derrière le CNN.
Idées principales derrière le CNN
Le fonctionnement des CNN est basé sur les idées importantes suivantes :
- Les filtres convolutionnels peuvent extraire des modèles
- Nous pouvons concevoir le réseau de manière à ce que les filtres soient entraînés automatiquement
- Nous pouvons utiliser la même approche pour trouver des modèles dans des caractéristiques de haut niveau, et pas seulement dans l'image originale. Ainsi, l'extraction de caractéristiques par CNN fonctionne sur une hiérarchie de caractéristiques, allant des combinaisons de pixels de bas niveau jusqu'aux combinaisons de parties d'image de niveau supérieur.
Image tirée d'un article de Hislop-Lynch, basé sur leur recherche
✍️ Exercices : Réseaux de Neurones Convolutionnels
Continuons à explorer comment fonctionnent les réseaux de neurones convolutionnels et comment nous pouvons obtenir des filtres entraînables, en travaillant à travers les notebooks correspondants :
Architecture Pyramidale
La plupart des CNN utilisés pour le traitement d'images suivent une architecture pyramidale. La première couche convolutionnelle appliquée aux images originales a généralement un nombre relativement faible de filtres (8-16), qui correspondent à différentes combinaisons de pixels, telles que des lignes horizontales/verticales de traits. Au niveau suivant, nous réduisons la dimension spatiale du réseau et augmentons le nombre de filtres, ce qui correspond à plus de combinaisons possibles de caractéristiques simples. À chaque couche, à mesure que nous nous rapprochons du classificateur final, les dimensions spatiales de l'image diminuent et le nombre de filtres augmente.
À titre d'exemple, examinons l'architecture de VGG-16, un réseau qui a atteint 92,7 % de précision dans la classification top-5 d'ImageNet en 2014 :
Image tirée de Researchgate
Architectures CNN les Plus Connues
Continuez votre étude sur les architectures CNN les plus connues
Disclaimer: This document has been translated using machine-based AI translation services. While we strive for accuracy, please be aware that automated translations may contain errors or inaccuracies. The original document in its native language should be considered the authoritative source. For critical information, professional human translation is recommended. We are not liable for any misunderstandings or misinterpretations arising from the use of this translation.




