12 KiB
प्रसिद्ध CNN आर्किटेक्चर
VGG-16
VGG-16 एक नेटवर्क है जिसने 2014 में ImageNet के शीर्ष-5 वर्गीकरण में 92.7% सटीकता प्राप्त की। इसका निम्नलिखित लेयर संरचना है:
जैसा कि आप देख सकते हैं, VGG एक पारंपरिक पिरामिड आर्किटेक्चर का पालन करता है, जो संकुचन-पूलिंग लेयर का एक अनुक्रम है।
चित्र Researchgate से
ResNet
ResNet एक मॉडल परिवार है जिसे Microsoft Research द्वारा 2015 में प्रस्तावित किया गया था। ResNet का मुख्य विचार अवशिष्ट ब्लॉकों का उपयोग करना है:
चित्र इस पेपर से
पहचान पास-थ्रू का उपयोग करने का कारण यह है कि हमारे लेयर को पिछले लेयर के परिणाम और अवशिष्ट ब्लॉक के आउटपुट के बीच का अंतर भविष्यवाणी करने की आवश्यकता है - इसलिए इसे अवशिष्ट नाम दिया गया है। ये ब्लॉक प्रशिक्षण के लिए बहुत आसान होते हैं, और कोई भी उन ब्लॉकों के साथ कई सैकड़ों नेटवर्क बना सकता है (सबसे सामान्य रूपांतर हैं ResNet-52, ResNet-101 और ResNet-152)।
आप इस नेटवर्क को इस तरह से भी सोच सकते हैं कि यह डेटासेट के लिए अपनी जटिलता को समायोजित करने में सक्षम है। प्रारंभ में, जब आप नेटवर्क को प्रशिक्षित करना शुरू कर रहे होते हैं, तो वेट्स के मान छोटे होते हैं, और अधिकांश संकेत पहचान पास-थ्रू लेयर के माध्यम से जाता है। जैसे-जैसे प्रशिक्षण प्रगति करता है और वेट्स बड़े होते हैं, नेटवर्क के पैरामीटर का महत्व बढ़ता है, और नेटवर्क आवश्यक अभिव्यक्तिशक्ति को समायोजित करता है ताकि प्रशिक्षण छवियों को सही ढंग से वर्गीकृत किया जा सके।
Google Inception
Google Inception आर्किटेक्चर इस विचार को एक कदम आगे बढ़ाता है, और प्रत्येक नेटवर्क लेयर को कई अलग-अलग पथों के संयोजन के रूप में बनाता है:
चित्र Researchgate से
यहां, हमें 1x1 संकुचन की भूमिका पर जोर देना चाहिए, क्योंकि पहले तो इसका कोई अर्थ नहीं होता। हमें 1x1 फ़िल्टर के साथ छवि पर क्यों चलना चाहिए? हालाँकि, आपको याद रखना चाहिए कि संकुचन फ़िल्टर कई गहराई चैनलों के साथ भी काम करते हैं (मूल रूप से - RGB रंग, बाद की परतों में - विभिन्न फ़िल्टर के लिए चैनल), और 1x1 संकुचन का उपयोग उन इनपुट चैनलों को विभिन्न प्रशिक्षनीय वेट्स का उपयोग करके मिलाने के लिए किया जाता है। इसे चैनल आयाम पर डाउनसैंपलिंग (पूलिंग) के रूप में भी देखा जा सकता है।
इस विषय पर एक अच्छा ब्लॉग पोस्ट है, और मूल पेपर है।
MobileNet
MobileNet एक मॉडल परिवार है जिसकी आकार में कमी है, जो मोबाइल उपकरणों के लिए उपयुक्त है। उनका उपयोग करें यदि आपके पास संसाधनों की कमी है, और आप थोड़ी सटीकता का बलिदान कर सकते हैं। उनके पीछे का मुख्य विचार गहराई से पृथक संकुचन है, जो गहराई चैनलों पर स्थानिक संकुचन और 1x1 संकुचन के संयोजन द्वारा संकुचन फ़िल्टरों का प्रतिनिधित्व करने की अनुमति देता है। यह पैरामीटर की संख्या को महत्वपूर्ण रूप से कम करता है, जिससे नेटवर्क का आकार छोटा होता है, और कम डेटा के साथ प्रशिक्षित करना भी आसान होता है।
यहां MobileNet पर एक अच्छा ब्लॉग पोस्ट है।
निष्कर्ष
इस इकाई में, आपने कंप्यूटर दृष्टि न्यूरल नेटवर्क - संकुचन नेटवर्क के पीछे का मुख्य सिद्धांत सीखा है। वास्तविक जीवन की आर्किटेक्चर जो छवि वर्गीकरण, वस्तु पहचान, और यहां तक कि छवि जनरेशन नेटवर्क को शक्ति देती है, सभी CNNs पर आधारित हैं, बस अधिक परतों और कुछ अतिरिक्त प्रशिक्षण तकनीकों के साथ।
🚀 चुनौती
संबद्ध नोटबुक में, अधिक सटीकता प्राप्त करने के बारे में नीचे नोट्स हैं। कुछ प्रयोग करें यह देखने के लिए कि क्या आप उच्च सटीकता प्राप्त कर सकते हैं।
पाठ-व्याख्यान क्विज़
समीक्षा और आत्म अध्ययन
हालांकि CNNs का उपयोग सबसे अधिकतर कंप्यूटर दृष्टि कार्यों के लिए किया जाता है, वे सामान्यतः निश्चित आकार के पैटर्न निकालने के लिए अच्छे होते हैं। उदाहरण के लिए, यदि हम ध्वनियों से निपट रहे हैं, तो हम कुछ विशिष्ट पैटर्नों की खोज के लिए CNNs का उपयोग करना चाह सकते हैं - जिस स्थिति में फ़िल्टर 1-आयामी होंगे (और इस CNN को 1D-CNN कहा जाएगा)। इसके अलावा, कभी-कभी 3D-CNN का उपयोग बहु-आयामी स्थान में विशेषताओं को निकालने के लिए किया जाता है, जैसे कि वीडियो पर कुछ घटनाएं घटित होना - CNN समय के साथ विशेषताओं में परिवर्तन के कुछ पैटर्न को पकड़ सकता है। CNNs के साथ किए जा सकने वाले अन्य कार्यों के बारे में कुछ समीक्षा और आत्म-अध्ययन करें।
असाइनमेंट
इस प्रयोगशाला में, आपको विभिन्न बिल्ली और कुत्ते की नस्लों का वर्गीकरण करने का कार्य सौंपा गया है। ये छवियाँ MNIST डेटासेट की तुलना में अधिक जटिल और उच्च आयाम की हैं, और इनमें 10 से अधिक वर्ग हैं।
अस्वीकृति:
यह दस्तावेज़ मशीन-आधारित एआई अनुवाद सेवाओं का उपयोग करके अनुवादित किया गया है। जबकि हम सटीकता के लिए प्रयासरत हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या असंगतताएँ हो सकती हैं। मूल दस्तावेज़ को उसकी मूल भाषा में अधिकारिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम जिम्मेदार नहीं हैं।

