|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CNN_Architectures.md | ||
| README.md | ||
README.md
कन्वोल्यूशनल न्यूरल नेटवर्क्स
हमने पहले देखा है कि न्यूरल नेटवर्क्स छवियों के साथ काम करने में काफी अच्छे होते हैं, और यहां तक कि एक-स्तरीय पर्सेप्ट्रॉन भी MNIST डेटासेट से हस्तलिखित अंकों को उचित सटीकता के साथ पहचानने में सक्षम है। हालाँकि, MNIST डेटासेट बहुत विशेष है, और सभी अंक छवि के अंदर केंद्रित होते हैं, जो कार्य को सरल बनाता है।
पूर्व-व्याख्यान प्रश्नोत्तरी
वास्तविक जीवन में, हम चाहते हैं कि हम छवि पर वस्तुओं को उनकी सटीक स्थिति की परवाह किए बिना पहचान सकें। कंप्यूटर विज़न सामान्य वर्गीकरण से अलग है, क्योंकि जब हम किसी विशेष वस्तु को चित्र में खोजने की कोशिश कर रहे होते हैं, तो हम कुछ विशेष पैटर्न और उनके संयोजनों की खोज में छवि को स्कैन कर रहे होते हैं। उदाहरण के लिए, जब हम बिल्ली की तलाश कर रहे होते हैं, तो हम पहले क्षैतिज रेखाओं की तलाश कर सकते हैं, जो मूंछें बना सकती हैं, और फिर मूंछों का एक विशेष संयोजन हमें बता सकता है कि यह वास्तव में एक बिल्ली की तस्वीर है। पैटर्न की सापेक्ष स्थिति और उपस्थिति महत्वपूर्ण है, और छवि पर उनकी सटीक स्थिति नहीं।
पैटर्न निकालने के लिए, हम कन्वोल्यूशनल फ़िल्टर के विचार का उपयोग करेंगे। जैसा कि आप जानते हैं, एक छवि को 2D-मैट्रिक्स या रंग गहराई के साथ 3D-टेंसर द्वारा दर्शाया जाता है। एक फ़िल्टर लागू करने का मतलब है कि हम अपेक्षाकृत छोटे फ़िल्टर कर्नेल मैट्रिक्स को लेते हैं, और मूल छवि में प्रत्येक पिक्सेल के लिए हम पड़ोसी बिंदुओं के साथ भारित औसत की गणना करते हैं। हम इसे पूरे चित्र पर स्लाइडिंग विंडो के रूप में देख सकते हैं, और फ़िल्टर कर्नेल मैट्रिक्स में वजन के अनुसार सभी पिक्सेल का औसत निकाल सकते हैं।
![]() |
![]() |
|---|
छवि द्वारा डिमित्री सोश्निकोव
उदाहरण के लिए, यदि हम MNIST अंकों पर 3x3 वर्टिकल एज और हॉरिजेंटल एज फ़िल्टर लागू करते हैं, तो हम उन स्थानों पर हाइलाइट्स (जैसे उच्च मान) प्राप्त कर सकते हैं जहाँ हमारी मूल छवि में वर्टिकल और हॉरिजेंटल एज हैं। इस प्रकार, इन दोनों फ़िल्टर का उपयोग "एज खोजने" के लिए किया जा सकता है। इसी तरह, हम अन्य निम्न-स्तरीय पैटर्न की खोज के लिए विभिन्न फ़िल्टर डिज़ाइन कर सकते हैं:
हालांकि, जबकि हम कुछ पैटर्न को मैन्युअल रूप से निकालने के लिए फ़िल्टर डिज़ाइन कर सकते हैं, हम नेटवर्क को इस तरह से डिज़ाइन भी कर सकते हैं कि यह स्वचालित रूप से पैटर्न सीखे। यह CNN के पीछे के मुख्य विचारों में से एक है।
CNN के पीछे के मुख्य विचार
CNNs का कार्य करने का तरीका निम्नलिखित महत्वपूर्ण विचारों पर आधारित है:
- कन्वोल्यूशनल फ़िल्टर पैटर्न निकाल सकते हैं
- हम नेटवर्क को इस तरह से डिज़ाइन कर सकते हैं कि फ़िल्टर स्वचालित रूप से प्रशिक्षित होते हैं
- हम उच्च-स्तरीय विशेषताओं में पैटर्न खोजने के लिए समान दृष्टिकोण का उपयोग कर सकते हैं, न कि केवल मूल छवि में। इस प्रकार, CNN फ़ीचर निष्कर्षण एक विशेषताओं की पदानुक्रम पर काम करता है, जो निम्न-स्तरीय पिक्सेल संयोजनों से शुरू होता है, उच्च स्तर के चित्र भागों के संयोजन तक।
छवि Hislop-Lynch के एक पेपर से, उनके शोध के आधार पर
✍️ व्यायाम: कन्वोल्यूशनल न्यूरल नेटवर्क्स
आइए यह पता लगाना जारी रखें कि कन्वोल्यूशनल न्यूरल नेटवर्क्स कैसे काम करते हैं, और हम कैसे प्रशिक्षित फ़िल्टर प्राप्त कर सकते हैं, संबंधित नोटबुक के माध्यम से काम करके:
पिरामिड आर्किटेक्चर
छवि प्रसंस्करण के लिए उपयोग किए जाने वाले अधिकांश CNNs एक तथाकथित पिरामिड आर्किटेक्चर का पालन करते हैं। मूल छवियों पर लागू पहला कन्वोल्यूशनल लेयर आमतौर पर अपेक्षाकृत कम संख्या में फ़िल्टर (8-16) रखता है, जो विभिन्न पिक्सेल संयोजनों के लिए होते हैं, जैसे कि क्षैतिज/ऊर्ध्वाधर रेखाएँ। अगले स्तर पर, हम नेटवर्क का स्थानिक आयाम कम करते हैं, और फ़िल्टर की संख्या बढ़ाते हैं, जो सरल विशेषताओं के अधिक संभावित संयोजनों के लिए होता है। प्रत्येक स्तर के साथ, जैसे-जैसे हम अंतिम वर्गीकर्ता की ओर बढ़ते हैं, छवि के स्थानिक आयाम घटते हैं, और फ़िल्टर की संख्या बढ़ती है।
उदाहरण के लिए, आइए VGG-16 की आर्किटेक्चर पर एक नज़र डालें, जो 2014 में ImageNet के शीर्ष-5 वर्गीकरण में 92.7% सटीकता प्राप्त करने वाले नेटवर्क है:
छवि Researchgate से
सबसे प्रसिद्ध CNN आर्किटेक्चर
सबसे प्रसिद्ध CNN आर्किटेक्चर के बारे में अपने अध्ययन को जारी रखें
अस्वीकृति:
यह दस्तावेज़ मशीन-आधारित एआई अनुवाद सेवाओं का उपयोग करके अनुवादित किया गया है। जबकि हम सटीकता के लिए प्रयासरत हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या गलतियाँ हो सकती हैं। मूल दस्तावेज़ को उसकी मूल भाषा में प्राधिकृत स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। हम इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए उत्तरदायी नहीं हैं।




