AI-For-Beginners/translations/sv/lessons/4-ComputerVision/07-ConvNets
leestott 2af29e418c 🌐 Update translations via Co-op Translator 2025-10-03 14:59:12 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-10-03 14:59:12 +00:00
CNN_Architectures.md 🌐 Update translations via Co-op Translator 2025-09-23 09:48:20 +00:00
ConvNetsPyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 18:09:00 +00:00
ConvNetsTF.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 18:09:00 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-09-23 09:48:20 +00:00

README.md

Konvolutionella neurala nÀtverk

Vi har tidigare sett att neurala nÀtverk Àr ganska bra pÄ att hantera bilder, och till och med en enkel lager-perceptron kan kÀnna igen handskrivna siffror frÄn MNIST-datasetet med rimlig noggrannhet. Men MNIST-datasetet Àr vÀldigt speciellt, eftersom alla siffror Àr centrerade i bilden, vilket gör uppgiften enklare.

Quiz före förelÀsningen

I verkligheten vill vi kunna kÀnna igen objekt pÄ en bild oavsett deras exakta position i bilden. Datorseende skiljer sig frÄn generell klassificering, eftersom vi, nÀr vi försöker hitta ett visst objekt pÄ en bild, skannar bilden och letar efter specifika mönster och deras kombinationer. Till exempel, nÀr vi letar efter en katt, kan vi först leta efter horisontella linjer som kan bilda morrhÄr, och sedan kan en viss kombination av morrhÄr indikera att det faktiskt Àr en bild av en katt. Den relativa positionen och förekomsten av vissa mönster Àr viktig, inte deras exakta position i bilden.

För att extrahera mönster kommer vi att anvÀnda begreppet konvolutionella filter. Som du vet representeras en bild av en 2D-matris eller en 3D-tensor med fÀrgdjup. Att applicera ett filter innebÀr att vi tar en relativt liten filterkÀrna-matris, och för varje pixel i den ursprungliga bilden berÀknar vi det viktade medelvÀrdet med angrÀnsande punkter. Vi kan se detta som ett litet fönster som glider över hela bilden och jÀmnar ut alla pixlar enligt vikterna i filterkÀrnan.

Vertikalt kantfilter Horisontellt kantfilter

Bild av Dmitry Soshnikov

Till exempel, om vi applicerar 3x3 vertikala och horisontella kantfilter pÄ MNIST-siffrorna, kan vi fÄ framhöjningar (t.ex. höga vÀrden) dÀr det finns vertikala och horisontella kanter i vÄr ursprungliga bild. SÄledes kan dessa tvÄ filter anvÀndas för att "leta efter" kanter. PÄ samma sÀtt kan vi designa olika filter för att leta efter andra lÄg-nivÄ mönster:

Bild av Leung-Malik Filter Bank

Men Àven om vi kan designa filter för att manuellt extrahera vissa mönster, kan vi ocksÄ designa nÀtverket pÄ ett sÀtt som gör att det lÀr sig mönstren automatiskt. Detta Àr en av huvudidéerna bakom CNN.

Huvudidéer bakom CNN

SÄ hÀr fungerar CNN baserat pÄ följande viktiga idéer:

  • Konvolutionella filter kan extrahera mönster
  • Vi kan designa nĂ€tverket sĂ„ att filtren trĂ€nas automatiskt
  • Vi kan anvĂ€nda samma metod för att hitta mönster i hög-nivĂ„ egenskaper, inte bara i den ursprungliga bilden. SĂ„ledes arbetar CNN med en hierarki av egenskaper, frĂ„n lĂ„g-nivĂ„ pixelkombinationer till högre nivĂ„ kombinationer av bilddelar.

Hierarkisk egenskapsutvinning

Bild frÄn en artikel av Hislop-Lynch, baserad pÄ deras forskning

✍ Övningar: Konvolutionella neurala nĂ€tverk

LÄt oss fortsÀtta utforska hur konvolutionella neurala nÀtverk fungerar och hur vi kan uppnÄ trÀningsbara filter genom att arbeta igenom motsvarande anteckningsböcker:

Pyramidarkitektur

De flesta CNN som anvÀnds för bildbehandling följer en sÄ kallad pyramidarkitektur. Det första konvolutionella lagret som appliceras pÄ de ursprungliga bilderna har vanligtvis ett relativt lÄgt antal filter (8-16), som motsvarar olika pixelkombinationer, sÄsom horisontella/vertikala linjer eller streck. PÄ nÀsta nivÄ minskar vi nÀtverkets spatiala dimension och ökar antalet filter, vilket motsvarar fler möjliga kombinationer av enkla egenskaper. Med varje lager, nÀr vi rör oss mot den slutliga klassificeraren, minskar bildens spatiala dimensioner och antalet filter ökar.

Som exempel, lÄt oss titta pÄ arkitekturen för VGG-16, ett nÀtverk som uppnÄdde 92,7% noggrannhet i ImageNet's topp-5 klassificering Är 2014:

ImageNet-lager

ImageNet-pyramid

Bild frÄn Researchgate

Mest kÀnda CNN-arkitekturer

FortsÀtt din studie om de mest kÀnda CNN-arkitekturerna