AI-For-Beginners/translations/ms/lessons/4-ComputerVision/07-ConvNets
Pikachú 5d34bc4eb8 Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00
..
lab Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00
CNN_Architectures.md Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00
README.md Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00

README.md

Rangkaian Neural Konvolusional

Kita telah melihat sebelumnya bahawa rangkaian neural cukup baik dalam menangani gambar, dan bahkan perceptron satu lapisan mampu mengenali digit tulisan tangan dari dataset MNIST dengan ketepatan yang wajar. Namun, dataset MNIST sangat istimewa, dan semua digit berada di tengah gambar, yang menjadikan tugas ini lebih mudah.

Kuiz Pra-ceramah

Dalam kehidupan sebenar, kita ingin dapat mengenali objek dalam gambar tanpa mengira lokasi tepat mereka dalam gambar. Penglihatan komputer berbeza dari pengelasan umum, kerana apabila kita cuba mencari objek tertentu dalam gambar, kita sedang mengimbas gambar mencari beberapa corak tertentu dan kombinasi mereka. Sebagai contoh, apabila mencari kucing, kita mungkin terlebih dahulu mencari garis mendatar, yang dapat membentuk misai, dan kemudian kombinasi tertentu dari misai dapat memberitahu kita bahawa ini sebenarnya adalah gambar kucing. Posisi relatif dan kehadiran corak tertentu adalah penting, dan bukan posisi tepat mereka dalam gambar.

Untuk mengekstrak corak, kita akan menggunakan konsep penapis konvolusional. Seperti yang anda tahu, gambar diwakili oleh matriks 2D, atau tensor 3D dengan kedalaman warna. Mengaplikasikan penapis bermakna kita mengambil matriks kernel penapis yang relatif kecil, dan untuk setiap piksel dalam gambar asal kita mengira purata tertimbang dengan titik-titik jiran. Kita boleh melihat ini seperti sebuah tingkap kecil yang meluncur ke seluruh gambar, dan merata-rata semua piksel mengikut berat dalam matriks kernel penapis.

Penapis Tepi Menegak Penapis Tepi Mendatar

Imej oleh Dmitry Soshnikov

Sebagai contoh, jika kita mengaplikasikan penapis tepi menegak 3x3 dan penapis tepi mendatar kepada digit MNIST, kita dapat mendapatkan sorotan (contohnya, nilai tinggi) di mana terdapat tepi menegak dan mendatar dalam gambar asal kita. Dengan itu, kedua-dua penapis ini boleh digunakan untuk "mencari" tepi. Begitu juga, kita boleh merancang penapis yang berbeza untuk mencari corak rendah yang lain:

Imej dari Bank Penapis Leung-Malik

Namun, walaupun kita boleh merancang penapis untuk mengekstrak beberapa corak secara manual, kita juga boleh merancang rangkaian dengan cara yang membolehkannya belajar corak secara automatik. Ini adalah salah satu idea utama di sebalik CNN.

Idea Utama di Sebalik CNN

Cara CNN berfungsi adalah berdasarkan idea penting berikut:

  • Penapis konvolusional boleh mengekstrak corak
  • Kita boleh merancang rangkaian dengan cara yang penapis dilatih secara automatik
  • Kita boleh menggunakan pendekatan yang sama untuk mencari corak dalam ciri tahap tinggi, bukan hanya dalam gambar asal. Oleh itu, pengekstrakan ciri CNN berfungsi pada hierarki ciri, bermula dari kombinasi piksel tahap rendah, hingga kombinasi bahagian gambar yang lebih tinggi.

Pengekstrakan Ciri Hierarki

Imej dari kertas oleh Hislop-Lynch, berdasarkan penyelidikan mereka

✍️ Latihan: Rangkaian Neural Konvolusional

Mari kita terus meneroka bagaimana rangkaian neural konvolusional berfungsi, dan bagaimana kita dapat mencapai penapis yang boleh dilatih, dengan mengerjakan buku nota yang berkaitan:

Senibina Piramid

Kebanyakan CNN yang digunakan untuk pemprosesan imej mengikuti senibina piramid yang dipanggil. Lapisan konvolusional pertama yang diterapkan pada gambar asal biasanya mempunyai bilangan penapis yang agak rendah (8-16), yang sepadan dengan kombinasi piksel yang berbeza, seperti garis mendatar/menegak strok. Di peringkat seterusnya, kita mengurangkan dimensi spatial rangkaian, dan meningkatkan bilangan penapis, yang sepadan dengan lebih banyak kombinasi ciri sederhana yang mungkin. Dengan setiap lapisan, apabila kita bergerak ke arah pengklasifikasi akhir, dimensi spatial gambar berkurang, dan bilangan penapis meningkat.

Sebagai contoh, mari kita lihat senibina VGG-16, sebuah rangkaian yang mencapai ketepatan 92.7% dalam pengelasan top-5 ImageNet pada tahun 2014:

Lapisan ImageNet

Piramid ImageNet

Imej dari Researchgate

Senibina CNN Terkenal

Teruskan pembelajaran anda mengenai senibina CNN yang paling terkenal

Penafian: Dokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan berasaskan AI. Walaupun kami berusaha untuk ketepatan, sila ambil perhatian bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang sah. Untuk maklumat yang kritikal, terjemahan manusia yang profesional disyorkan. Kami tidak bertanggungjawab atas sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.