5.8 KiB
Tunnetut CNN-arkkitehtuurit
VGG-16
VGG-16 on verkko, joka saavutti 92,7 % tarkkuuden ImageNetin top-5-luokittelussa vuonna 2014. Sen kerrosrakenne on seuraava:
Kuten näet, VGG noudattaa perinteistä pyramidirakennetta, joka koostuu konvoluutio- ja pooling-kerrosten sarjasta.
Kuva Researchgate -sivustolta
ResNet
ResNet on Microsoft Researchin vuonna 2015 ehdottama malliperhe. ResNetin pääidea on käyttää residuaalilohkoja:
Kuva tästä artikkelista
Identiteettisiirron käyttö mahdollistaa sen, että kerros ennustaa erotuksen edellisen kerroksen tuloksen ja residuaalilohkon ulostulon välillä - tästä nimi residuaali. Näitä lohkoja on helpompi kouluttaa, ja niiden avulla voidaan rakentaa verkkoja, joissa on satoja tällaisia lohkoja (yleisimmät variantit ovat ResNet-52, ResNet-101 ja ResNet-152).
Tätä verkkoa voi myös ajatella sellaisena, joka mukauttaa monimutkaisuutensa datan mukaan. Aluksi, kun verkkoa aletaan kouluttaa, painot ovat pieniä, ja suurin osa signaalista kulkee identiteettikerrosten läpi. Koulutuksen edetessä ja painojen kasvaessa verkon parametrien merkitys kasvaa, ja verkko mukautuu saavuttaakseen tarvittavan ilmaisukyvyn luokitellakseen koulutuskuvat oikein.
Google Inception
Google Inception -arkkitehtuuri vie tämän idean askeleen pidemmälle ja rakentaa jokaisen verkon kerroksen useiden eri polkujen yhdistelmänä:
Kuva Researchgate -sivustolta
Tässä on tärkeää korostaa 1x1-konvoluutioiden roolia, sillä aluksi ne eivät vaikuta järkeviltä. Miksi käyttäisimme 1x1-suodatinta kuvan läpikäymiseen? On kuitenkin muistettava, että konvoluutiosuodattimet toimivat myös useiden syvyyskanavien kanssa (alun perin - RGB-värit, myöhemmissä kerroksissa - eri suodattimien kanavat), ja 1x1-konvoluutiota käytetään näiden syöttökanavien yhdistämiseen eri koulutettavilla painoilla. Sitä voidaan myös pitää kanavien välisenä alasnäytteistyksenä (pooling).
Tässä on hyvä blogikirjoitus aiheesta ja alkuperäinen artikkeli.
MobileNet
MobileNet on malliperhe, jonka koko on pienennetty, ja se soveltuu mobiililaitteille. Käytä niitä, jos resurssit ovat rajalliset ja voit tinkiä hieman tarkkuudesta. Niiden pääidea on niin sanottu syvyyssuuntainen erilliskonvoluutio, joka mahdollistaa konvoluutiosuodattimien esittämisen tilallisten konvoluutioiden ja syvyyskanavien 1x1-konvoluution yhdistelmänä. Tämä vähentää merkittävästi parametrien määrää, mikä tekee verkosta pienemmän ja helpomman kouluttaa vähemmällä datalla.
Tässä on hyvä blogikirjoitus MobileNetistä.
Yhteenveto
Tässä osiossa opit konvoluutioverkkojen pääperiaatteet, jotka ovat tietokonenäön hermoverkkojen perusta. Reaaliaikaiset arkkitehtuurit, jotka mahdollistavat kuvien luokittelun, objektien tunnistuksen ja jopa kuvien generoinnin, perustuvat kaikki CNN-verkkoihin, mutta niissä on enemmän kerroksia ja joitakin lisäkoulutustemppuja.
🚀 Haaste
Mukana olevissa muistikirjoissa on alareunassa muistiinpanoja siitä, miten saavuttaa parempi tarkkuus. Tee kokeita nähdäksesi, voitko saavuttaa korkeamman tarkkuuden.
Luennon jälkeinen kysely
Kertaus ja itseopiskelu
Vaikka CNN-verkkoja käytetään useimmiten tietokonenäkötehtäviin, ne soveltuvat yleisesti kiinteän kokoisten kuvioiden tunnistamiseen. Esimerkiksi, jos käsittelemme ääniä, voimme käyttää CNN-verkkoja etsimään tiettyjä kuvioita äänisignaalista - tällöin suodattimet olisivat 1-ulotteisia (ja tätä CNN-verkkoa kutsuttaisiin 1D-CNN:ksi). Lisäksi joskus käytetään 3D-CNN-verkkoja piirteiden tunnistamiseen moniulotteisessa tilassa, kuten tiettyjen tapahtumien havaitsemiseen videoilla - CNN voi tunnistaa tiettyjä piirteiden muutoksia ajan kuluessa. Tee kertausta ja itseopiskelua muista tehtävistä, joita CNN-verkkojen avulla voidaan suorittaa.
Tehtävä
Tässä laboratoriossa tehtävänäsi on luokitella eri kissan- ja koirarotuja. Nämä kuvat ovat monimutkaisempia kuin MNIST-datasetti, niiden ulottuvuudet ovat suuremmat, ja luokkia on yli 10.
Vastuuvapauslauseke:
Tämä asiakirja on käännetty käyttämällä tekoälypohjaista käännöspalvelua Co-op Translator. Vaikka pyrimme tarkkuuteen, huomioithan, että automaattiset käännökset voivat sisältää virheitä tai epätarkkuuksia. Alkuperäinen asiakirja sen alkuperäisellä kielellä tulisi pitää ensisijaisena lähteenä. Kriittisen tiedon osalta suositellaan ammattimaista ihmiskäännöstä. Emme ole vastuussa väärinkäsityksistä tai virhetulkinnoista, jotka johtuvat tämän käännöksen käytöstä.

