AI-For-Beginners/translations/hi/lessons/4-ComputerVision/07-ConvNets/CNN_Architectures.md

12 KiB

प्रसिद्ध CNN आर्किटेक्चर

VGG-16

VGG-16 एक नेटवर्क है जिसने 2014 में ImageNet के शीर्ष-5 वर्गीकरण में 92.7% सटीकता प्राप्त की। इसका निम्नलिखित लेयर संरचना है:

ImageNet Layers

जैसा कि आप देख सकते हैं, VGG एक पारंपरिक पिरामिड आर्किटेक्चर का पालन करता है, जो संकुचन-पूलिंग लेयर का एक अनुक्रम है।

ImageNet Pyramid

चित्र Researchgate से

ResNet

ResNet एक मॉडल परिवार है जिसे Microsoft Research द्वारा 2015 में प्रस्तावित किया गया था। ResNet का मुख्य विचार अवशिष्ट ब्लॉकों का उपयोग करना है:

चित्र इस पेपर से

पहचान पास-थ्रू का उपयोग करने का कारण यह है कि हमारे लेयर को पिछले लेयर के परिणाम और अवशिष्ट ब्लॉक के आउटपुट के बीच का अंतर भविष्यवाणी करने की आवश्यकता है - इसलिए इसे अवशिष्ट नाम दिया गया है। ये ब्लॉक प्रशिक्षण के लिए बहुत आसान होते हैं, और कोई भी उन ब्लॉकों के साथ कई सैकड़ों नेटवर्क बना सकता है (सबसे सामान्य रूपांतर हैं ResNet-52, ResNet-101 और ResNet-152)।

आप इस नेटवर्क को इस तरह से भी सोच सकते हैं कि यह डेटासेट के लिए अपनी जटिलता को समायोजित करने में सक्षम है। प्रारंभ में, जब आप नेटवर्क को प्रशिक्षित करना शुरू कर रहे होते हैं, तो वेट्स के मान छोटे होते हैं, और अधिकांश संकेत पहचान पास-थ्रू लेयर के माध्यम से जाता है। जैसे-जैसे प्रशिक्षण प्रगति करता है और वेट्स बड़े होते हैं, नेटवर्क के पैरामीटर का महत्व बढ़ता है, और नेटवर्क आवश्यक अभिव्यक्तिशक्ति को समायोजित करता है ताकि प्रशिक्षण छवियों को सही ढंग से वर्गीकृत किया जा सके।

Google Inception

Google Inception आर्किटेक्चर इस विचार को एक कदम आगे बढ़ाता है, और प्रत्येक नेटवर्क लेयर को कई अलग-अलग पथों के संयोजन के रूप में बनाता है:

चित्र Researchgate से

यहां, हमें 1x1 संकुचन की भूमिका पर जोर देना चाहिए, क्योंकि पहले तो इसका कोई अर्थ नहीं होता। हमें 1x1 फ़िल्टर के साथ छवि पर क्यों चलना चाहिए? हालाँकि, आपको याद रखना चाहिए कि संकुचन फ़िल्टर कई गहराई चैनलों के साथ भी काम करते हैं (मूल रूप से - RGB रंग, बाद की परतों में - विभिन्न फ़िल्टर के लिए चैनल), और 1x1 संकुचन का उपयोग उन इनपुट चैनलों को विभिन्न प्रशिक्षनीय वेट्स का उपयोग करके मिलाने के लिए किया जाता है। इसे चैनल आयाम पर डाउनसैंपलिंग (पूलिंग) के रूप में भी देखा जा सकता है।

इस विषय पर एक अच्छा ब्लॉग पोस्ट है, और मूल पेपर है।

MobileNet

MobileNet एक मॉडल परिवार है जिसकी आकार में कमी है, जो मोबाइल उपकरणों के लिए उपयुक्त है। उनका उपयोग करें यदि आपके पास संसाधनों की कमी है, और आप थोड़ी सटीकता का बलिदान कर सकते हैं। उनके पीछे का मुख्य विचार गहराई से पृथक संकुचन है, जो गहराई चैनलों पर स्थानिक संकुचन और 1x1 संकुचन के संयोजन द्वारा संकुचन फ़िल्टरों का प्रतिनिधित्व करने की अनुमति देता है। यह पैरामीटर की संख्या को महत्वपूर्ण रूप से कम करता है, जिससे नेटवर्क का आकार छोटा होता है, और कम डेटा के साथ प्रशिक्षित करना भी आसान होता है।

यहां MobileNet पर एक अच्छा ब्लॉग पोस्ट है।

निष्कर्ष

इस इकाई में, आपने कंप्यूटर दृष्टि न्यूरल नेटवर्क - संकुचन नेटवर्क के पीछे का मुख्य सिद्धांत सीखा है। वास्तविक जीवन की आर्किटेक्चर जो छवि वर्गीकरण, वस्तु पहचान, और यहां तक कि छवि जनरेशन नेटवर्क को शक्ति देती है, सभी CNNs पर आधारित हैं, बस अधिक परतों और कुछ अतिरिक्त प्रशिक्षण तकनीकों के साथ।

🚀 चुनौती

संबद्ध नोटबुक में, अधिक सटीकता प्राप्त करने के बारे में नीचे नोट्स हैं। कुछ प्रयोग करें यह देखने के लिए कि क्या आप उच्च सटीकता प्राप्त कर सकते हैं।

पाठ-व्याख्यान क्विज़

समीक्षा और आत्म अध्ययन

हालांकि CNNs का उपयोग सबसे अधिकतर कंप्यूटर दृष्टि कार्यों के लिए किया जाता है, वे सामान्यतः निश्चित आकार के पैटर्न निकालने के लिए अच्छे होते हैं। उदाहरण के लिए, यदि हम ध्वनियों से निपट रहे हैं, तो हम कुछ विशिष्ट पैटर्नों की खोज के लिए CNNs का उपयोग करना चाह सकते हैं - जिस स्थिति में फ़िल्टर 1-आयामी होंगे (और इस CNN को 1D-CNN कहा जाएगा)। इसके अलावा, कभी-कभी 3D-CNN का उपयोग बहु-आयामी स्थान में विशेषताओं को निकालने के लिए किया जाता है, जैसे कि वीडियो पर कुछ घटनाएं घटित होना - CNN समय के साथ विशेषताओं में परिवर्तन के कुछ पैटर्न को पकड़ सकता है। CNNs के साथ किए जा सकने वाले अन्य कार्यों के बारे में कुछ समीक्षा और आत्म-अध्ययन करें।

असाइनमेंट

इस प्रयोगशाला में, आपको विभिन्न बिल्ली और कुत्ते की नस्लों का वर्गीकरण करने का कार्य सौंपा गया है। ये छवियाँ MNIST डेटासेट की तुलना में अधिक जटिल और उच्च आयाम की हैं, और इनमें 10 से अधिक वर्ग हैं।

अस्वीकृति:
यह दस्तावेज़ मशीन-आधारित एआई अनुवाद सेवाओं का उपयोग करके अनुवादित किया गया है। जबकि हम सटीकता के लिए प्रयासरत हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या असंगतताएँ हो सकती हैं। मूल दस्तावेज़ को उसकी मूल भाषा में अधिकारिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम जिम्मेदार नहीं हैं।