12 KiB
Convolutional Neural Networks
हामीले पहिले देखिसकेका छौं कि न्युरल नेटवर्कहरू छविहरूसँग राम्रोसँग काम गर्न सक्षम छन्, र एक-लेयर पर्सेप्ट्रोनले पनि MNIST डेटासेटबाट हस्तलेखन गरिएको अंकहरू उचित शुद्धतासहित चिन्हित गर्न सक्षम छ। तर, MNIST डेटासेट विशेष छ, र सबै अंकहरू छविको बीचमा केन्द्रित छन्, जसले कार्यलाई सरल बनाउँछ।
Pre-lecture quiz
वास्तविक जीवनमा, हामी छविमा वस्तुहरूको ठ्याक्कै स्थानको पर्वाह नगरी तिनीहरूलाई चिन्हित गर्न सक्षम हुन चाहन्छौं। कम्प्युटर भिजन सामान्य वर्गीकरणभन्दा फरक छ, किनकि जब हामी छविमा कुनै निश्चित वस्तु खोज्ने प्रयास गरिरहेका हुन्छौं, हामी छविलाई स्क्यान गर्दै केही विशेष ढाँचाहरू र तिनीहरूको संयोजन खोजिरहेका हुन्छौं। उदाहरणका लागि, बिरालो खोज्दा, हामी पहिले तेर्सो रेखाहरू खोज्न सक्छौं, जसले जुँगा बनाउन सक्छ, र त्यसपछि जुँगाको निश्चित संयोजनले हामीलाई यो वास्तवमा बिरालोको तस्वीर हो भन्ने बताउन सक्छ। ढाँचाहरूको सापेक्ष स्थिति र उपस्थिति महत्त्वपूर्ण छ, तर तिनीहरूको ठ्याक्कै स्थान महत्त्वपूर्ण छैन।
ढाँचाहरू निकाल्न, हामी कन्भोल्युसनल फिल्टरहरू को अवधारणा प्रयोग गर्नेछौं। तपाईंलाई थाहा छ, छवि 2D-म्याट्रिक्स वा रंग गहिराइ भएको 3D-टेन्सरद्वारा प्रतिनिधित्व गरिन्छ। फिल्टर लागू गर्नुको मतलब हामी सानो फिल्टर कर्नेल म्याट्रिक्स लिन्छौं, र मूल छविको प्रत्येक पिक्सेलको लागि हामी छिमेकी बिन्दुहरूसँग तौलित औसत गणना गर्छौं। हामी यसलाई सानो झ्यालले सम्पूर्ण छविमा स्लाइड गर्दै, र फिल्टर कर्नेल म्याट्रिक्समा तौलहरू अनुसार सबै पिक्सेलहरू औसत गर्दै हेर्न सक्छौं।
![]() |
![]() |
|---|
छवि: दिमित्री सोश्निकोभ
उदाहरणका लागि, यदि हामी MNIST अंकहरूमा 3x3 तेर्सो किनारा र ठाडो किनारा फिल्टरहरू लागू गर्छौं भने, हामी मूल छविमा ठाडो र तेर्सो किनाराहरू भएको ठाउँमा हाइलाइटहरू (जस्तै उच्च मानहरू) प्राप्त गर्न सक्छौं। त्यसैले ती दुई फिल्टरहरू किनाराहरू "खोज्न" प्रयोग गर्न सकिन्छ। यसैगरी, हामी अन्य तल्लो-स्तरका ढाँचाहरू खोज्न विभिन्न फिल्टरहरू डिजाइन गर्न सक्छौं:
Leung-Malik Filter Bank को छवि
तर, हामी ढाँचाहरू निकाल्न फिल्टरहरू म्यानुअली डिजाइन गर्न सक्ने भए पनि, हामी नेटवर्कलाई यसरी डिजाइन गर्न सक्छौं कि यसले ढाँचाहरू स्वतः सिक्छ। यो CNN को पछाडि मुख्य विचारहरू मध्ये एक हो।
CNN को मुख्य विचारहरू
CNN काम गर्ने तरिका निम्न महत्त्वपूर्ण विचारहरूमा आधारित छ:
- कन्भोल्युसनल फिल्टरहरूले ढाँचाहरू निकाल्न सक्छन्
- हामी नेटवर्कलाई यसरी डिजाइन गर्न सक्छौं कि फिल्टरहरू स्वतः प्रशिक्षित हुन्छन्
- हामी उच्च-स्तरका विशेषताहरूमा ढाँचाहरू खोज्न पनि यही दृष्टिकोण प्रयोग गर्न सक्छौं, केवल मूल छविमा मात्र होइन। यसरी CNN विशेषता निकाल्ने काम विशेषताको पदानुक्रममा हुन्छ, तल्लो-स्तरका पिक्सेल संयोजनहरूबाट सुरु गरेर, छविका भागहरूको उच्च-स्तर संयोजनसम्म।
छवि: Hislop-Lynch को पेपर बाट, तिनीहरूको अनुसन्धान मा आधारित
✍️ अभ्यासहरू: कन्भोल्युसनल न्युरल नेटवर्कहरू
आउनुहोस् कन्भोल्युसनल न्युरल नेटवर्कहरू कसरी काम गर्छन् र कसरी हामी प्रशिक्षित गर्न सकिने फिल्टरहरू प्राप्त गर्न सक्छौं भनेर बुझ्न सम्बन्धित नोटबुकहरूमा काम गरौं:
पिरामिड आर्किटेक्चर
छवि प्रशोधनका लागि प्रयोग गरिने अधिकांश CNNहरूले तथाकथित पिरामिड आर्किटेक्चर अनुसरण गर्छन्। मूल छविहरूमा लागू गरिएको पहिलो कन्भोल्युसनल लेयरमा सामान्यतया तुलनात्मक रूपमा कम संख्याका फिल्टरहरू (8-16) हुन्छन्, जसले तेर्सो/ठाडो रेखाहरू जस्ता विभिन्न पिक्सेल संयोजनहरूलाई प्रतिनिधित्व गर्छ। अर्को स्तरमा, हामी नेटवर्कको स्थानिक आयाम घटाउँछौं, र फिल्टरहरूको संख्या बढाउँछौं, जसले साधारण विशेषताहरूको थप सम्भावित संयोजनहरूलाई प्रतिनिधित्व गर्छ। प्रत्येक तहमा, अन्तिम वर्गीकरणतर्फ जाँदा, छविको स्थानिक आयाम घट्छ, र फिल्टरहरूको संख्या बढ्छ।
उदाहरणका लागि, VGG-16 को आर्किटेक्चरलाई हेरौं, जसले 2014 मा ImageNet को शीर्ष-5 वर्गीकरणमा 92.7% शुद्धता प्राप्त गर्यो:
छवि: Researchgate बाट
सबैभन्दा प्रख्यात CNN आर्किटेक्चरहरू
सबैभन्दा प्रख्यात CNN आर्किटेक्चरहरूको अध्ययन जारी राख्नुहोस्
अस्वीकरण:
यो दस्तावेज़ AI अनुवाद सेवा Co-op Translator प्रयोग गरी अनुवाद गरिएको हो। हामी यथासम्भव सटीकता सुनिश्चित गर्न प्रयास गर्छौं, तर कृपया ध्यान दिनुहोस् कि स्वचालित अनुवादहरूमा त्रुटिहरू वा अशुद्धताहरू हुन सक्छन्। यसको मूल भाषामा रहेको मूल दस्तावेज़लाई आधिकारिक स्रोत मानिनुपर्छ। महत्त्वपूर्ण जानकारीका लागि, व्यावसायिक मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न हुने कुनै पनि गलतफहमी वा गलत व्याख्याका लागि हामी जिम्मेवार हुने छैनौं।




