AI-For-Beginners/translations/fi/lessons/4-ComputerVision/07-ConvNets/CNN_Architectures.md

5.8 KiB

Tunnetut CNN-arkkitehtuurit

VGG-16

VGG-16 on verkko, joka saavutti 92,7 % tarkkuuden ImageNetin top-5-luokittelussa vuonna 2014. Sen kerrosrakenne on seuraava:

ImageNet Layers

Kuten näet, VGG noudattaa perinteistä pyramidirakennetta, joka koostuu konvoluutio- ja pooling-kerrosten sarjasta.

ImageNet Pyramid

Kuva Researchgate -sivustolta

ResNet

ResNet on Microsoft Researchin vuonna 2015 ehdottama malliperhe. ResNetin pääidea on käyttää residuaalilohkoja:

Kuva tästä artikkelista

Identiteettisiirron käyttö mahdollistaa sen, että kerros ennustaa erotuksen edellisen kerroksen tuloksen ja residuaalilohkon ulostulon välillä - tästä nimi residuaali. Näitä lohkoja on helpompi kouluttaa, ja niiden avulla voidaan rakentaa verkkoja, joissa on satoja tällaisia lohkoja (yleisimmät variantit ovat ResNet-52, ResNet-101 ja ResNet-152).

Tätä verkkoa voi myös ajatella sellaisena, joka mukauttaa monimutkaisuutensa datan mukaan. Aluksi, kun verkkoa aletaan kouluttaa, painot ovat pieniä, ja suurin osa signaalista kulkee identiteettikerrosten läpi. Koulutuksen edetessä ja painojen kasvaessa verkon parametrien merkitys kasvaa, ja verkko mukautuu saavuttaakseen tarvittavan ilmaisukyvyn luokitellakseen koulutuskuvat oikein.

Google Inception

Google Inception -arkkitehtuuri vie tämän idean askeleen pidemmälle ja rakentaa jokaisen verkon kerroksen useiden eri polkujen yhdistelmänä:

Kuva Researchgate -sivustolta

Tässä on tärkeää korostaa 1x1-konvoluutioiden roolia, sillä aluksi ne eivät vaikuta järkeviltä. Miksi käyttäisimme 1x1-suodatinta kuvan läpikäymiseen? On kuitenkin muistettava, että konvoluutiosuodattimet toimivat myös useiden syvyyskanavien kanssa (alun perin - RGB-värit, myöhemmissä kerroksissa - eri suodattimien kanavat), ja 1x1-konvoluutiota käytetään näiden syöttökanavien yhdistämiseen eri koulutettavilla painoilla. Sitä voidaan myös pitää kanavien välisenä alasnäytteistyksenä (pooling).

Tässä on hyvä blogikirjoitus aiheesta ja alkuperäinen artikkeli.

MobileNet

MobileNet on malliperhe, jonka koko on pienennetty, ja se soveltuu mobiililaitteille. Käytä niitä, jos resurssit ovat rajalliset ja voit tinkiä hieman tarkkuudesta. Niiden pääidea on niin sanottu syvyyssuuntainen erilliskonvoluutio, joka mahdollistaa konvoluutiosuodattimien esittämisen tilallisten konvoluutioiden ja syvyyskanavien 1x1-konvoluution yhdistelmänä. Tämä vähentää merkittävästi parametrien määrää, mikä tekee verkosta pienemmän ja helpomman kouluttaa vähemmällä datalla.

Tässä on hyvä blogikirjoitus MobileNetistä.

Yhteenveto

Tässä osiossa opit konvoluutioverkkojen pääperiaatteet, jotka ovat tietokonenäön hermoverkkojen perusta. Reaaliaikaiset arkkitehtuurit, jotka mahdollistavat kuvien luokittelun, objektien tunnistuksen ja jopa kuvien generoinnin, perustuvat kaikki CNN-verkkoihin, mutta niissä on enemmän kerroksia ja joitakin lisäkoulutustemppuja.

🚀 Haaste

Mukana olevissa muistikirjoissa on alareunassa muistiinpanoja siitä, miten saavuttaa parempi tarkkuus. Tee kokeita nähdäksesi, voitko saavuttaa korkeamman tarkkuuden.

Luennon jälkeinen kysely

Kertaus ja itseopiskelu

Vaikka CNN-verkkoja käytetään useimmiten tietokonenäkötehtäviin, ne soveltuvat yleisesti kiinteän kokoisten kuvioiden tunnistamiseen. Esimerkiksi, jos käsittelemme ääniä, voimme käyttää CNN-verkkoja etsimään tiettyjä kuvioita äänisignaalista - tällöin suodattimet olisivat 1-ulotteisia (ja tätä CNN-verkkoa kutsuttaisiin 1D-CNN:ksi). Lisäksi joskus käytetään 3D-CNN-verkkoja piirteiden tunnistamiseen moniulotteisessa tilassa, kuten tiettyjen tapahtumien havaitsemiseen videoilla - CNN voi tunnistaa tiettyjä piirteiden muutoksia ajan kuluessa. Tee kertausta ja itseopiskelua muista tehtävistä, joita CNN-verkkojen avulla voidaan suorittaa.

Tehtävä

Tässä laboratoriossa tehtävänäsi on luokitella eri kissan- ja koirarotuja. Nämä kuvat ovat monimutkaisempia kuin MNIST-datasetti, niiden ulottuvuudet ovat suuremmat, ja luokkia on yli 10.


Vastuuvapauslauseke:
Tämä asiakirja on käännetty käyttämällä tekoälypohjaista käännöspalvelua Co-op Translator. Vaikka pyrimme tarkkuuteen, huomioithan, että automaattiset käännökset voivat sisältää virheitä tai epätarkkuuksia. Alkuperäinen asiakirja sen alkuperäisellä kielellä tulisi pitää ensisijaisena lähteenä. Kriittisen tiedon osalta suositellaan ammattimaista ihmiskäännöstä. Emme ole vastuussa väärinkäsityksistä tai virhetulkinnoista, jotka johtuvat tämän käännöksen käytöstä.