5.7 KiB
Arsitektur CNN Yang Dikenal
VGG-16
VGG-16 adalah jaringan yang mencapai akurasi 92,7% dalam klasifikasi top-5 ImageNet pada tahun 2014. Jaringan ini memiliki struktur lapisan sebagai berikut:
Seperti yang dapat Anda lihat, VGG mengikuti arsitektur piramida tradisional, yang merupakan urutan lapisan konvolusi-pooling.
Gambar dari Researchgate
ResNet
ResNet adalah keluarga model yang diusulkan oleh Microsoft Research pada tahun 2015. Ide utama dari ResNet adalah menggunakan blok residual:
Gambar dari makalah ini
Alasan menggunakan identitas pass-through adalah untuk membuat lapisan kami memprediksi perbedaan antara hasil lapisan sebelumnya dan keluaran blok residual - sehingga dinamakan residual. Blok-blok ini jauh lebih mudah dilatih, dan seseorang dapat membangun jaringan dengan beberapa ratus blok tersebut (varian yang paling umum adalah ResNet-52, ResNet-101, dan ResNet-152).
Anda juga dapat memikirkan jaringan ini sebagai jaringan yang dapat menyesuaikan kompleksitasnya dengan dataset. Awalnya, ketika Anda mulai melatih jaringan, nilai bobot kecil, dan sebagian besar sinyal melewati lapisan identitas pass-through. Seiring berjalannya pelatihan dan bobot menjadi lebih besar, signifikansi parameter jaringan meningkat, dan jaringan menyesuaikan untuk memenuhi kekuatan ekspresif yang diperlukan untuk mengklasifikasikan gambar pelatihan dengan benar.
Google Inception
Arsitektur Google Inception membawa ide ini selangkah lebih jauh, dan membangun setiap lapisan jaringan sebagai kombinasi dari beberapa jalur yang berbeda:
Gambar dari Researchgate
Di sini, kita perlu menekankan peran konvolusi 1x1, karena pada awalnya mereka tidak masuk akal. Mengapa kita perlu menjalankan filter 1x1 melalui gambar? Namun, Anda perlu ingat bahwa filter konvolusi juga bekerja dengan beberapa saluran kedalaman (aslinya - warna RGB, di lapisan berikutnya - saluran untuk filter yang berbeda), dan konvolusi 1x1 digunakan untuk mencampur saluran input tersebut menggunakan bobot yang dapat dilatih. Ini juga dapat dilihat sebagai downsampling (pooling) di atas dimensi saluran.
Berikut adalah posting blog yang bagus tentang subjek ini, dan makalah asli.
MobileNet
MobileNet adalah keluarga model dengan ukuran yang lebih kecil, cocok untuk perangkat mobile. Gunakan mereka jika Anda kekurangan sumber daya, dan dapat mengorbankan sedikit akurasi. Ide utama di balik mereka adalah konvolusi terpisah berdasarkan kedalaman, yang memungkinkan mewakili filter konvolusi dengan komposisi konvolusi spasial dan konvolusi 1x1 di atas saluran kedalaman. Ini secara signifikan mengurangi jumlah parameter, membuat jaringan lebih kecil, dan juga lebih mudah dilatih dengan data yang lebih sedikit.
Berikut adalah posting blog yang bagus tentang MobileNet.
Kesimpulan
Dalam unit ini, Anda telah mempelajari konsep utama di balik jaringan saraf visi komputer - jaringan konvolusi. Arsitektur nyata yang mendukung klasifikasi gambar, deteksi objek, dan bahkan jaringan generasi gambar semuanya didasarkan pada CNN, hanya dengan lebih banyak lapisan dan beberapa trik pelatihan tambahan.
🚀 Tantangan
Dalam buku catatan yang menyertai, ada catatan di bagian bawah tentang bagaimana mendapatkan akurasi yang lebih tinggi. Lakukan beberapa eksperimen untuk melihat apakah Anda dapat mencapai akurasi yang lebih tinggi.
Kuis pasca kuliah
Tinjauan & Studi Mandiri
Meskipun CNN paling sering digunakan untuk tugas Visi Komputer, mereka umumnya baik untuk mengekstrak pola berukuran tetap. Misalnya, jika kita berurusan dengan suara, kita juga mungkin ingin menggunakan CNN untuk mencari pola tertentu dalam sinyal audio - dalam hal ini filter akan 1-dimensi (dan CNN ini akan disebut 1D-CNN). Juga, terkadang 3D-CNN digunakan untuk mengekstrak fitur di ruang multi-dimensi, seperti peristiwa tertentu yang terjadi di video - CNN dapat menangkap pola tertentu dari perubahan fitur seiring waktu. Lakukan beberapa tinjauan dan studi mandiri tentang tugas lain yang dapat dilakukan dengan CNN.
Tugas
Dalam lab ini, Anda ditugaskan untuk mengklasifikasikan berbagai ras kucing dan anjing. Gambar-gambar ini lebih kompleks daripada dataset MNIST dan memiliki dimensi yang lebih tinggi, dan ada lebih dari 10 kelas.
Penafian:
Dokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI berasaskan mesin. Walaupun kami berusaha untuk ketepatan, sila sedar bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidakakuratan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang berkuasa. Untuk maklumat penting, terjemahan manusia profesional adalah disyorkan. Kami tidak bertanggungjawab atas sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.

