20 KiB
ऑब्जेक्ट डिटेक्शन
आतापर्यंत आपण ज्या इमेज क्लासिफिकेशन मॉडेल्सचा अभ्यास केला आहे, ते एका इमेजवर प्रक्रिया करून एक वर्गीकृत परिणाम देतात, जसे की MNIST समस्येमध्ये 'संख्या' वर्ग. परंतु, अनेक वेळा आपल्याला फक्त हे जाणून घ्यायचे नसते की एखाद्या चित्रात वस्तू आहेत, तर आपल्याला त्यांच्या अचूक स्थानाचा अंदाज लावायचा असतो. ऑब्जेक्ट डिटेक्शन याच उद्देशासाठी आहे.
पूर्व-व्याख्यान प्रश्नमंजुषा
चित्र YOLO v2 वेबसाइट वरून
ऑब्जेक्ट डिटेक्शनसाठी साधा दृष्टिकोन
समजा आपल्याला एखाद्या चित्रात मांजर शोधायची आहे, तर ऑब्जेक्ट डिटेक्शनसाठी एक साधा दृष्टिकोन असा असू शकतो:
- चित्राला अनेक टाइल्समध्ये विभागा.
- प्रत्येक टाइलवर इमेज क्लासिफिकेशन चालवा.
- ज्या टाइल्समध्ये पुरेशी उच्च सक्रियता दिसून येते, त्या टाइल्समध्ये संबंधित वस्तू असल्याचे मानले जाऊ शकते.
चित्र व्यायाम नोटबुक मधून
तथापि, हा दृष्टिकोन आदर्श नाही, कारण तो वस्तूच्या बॉक्सचे स्थान अचूकपणे शोधण्यास सक्षम नाही. अधिक अचूक स्थानासाठी, आपल्याला रेग्रेशन वापरून बॉक्सचे समन्वय अंदाज लावावे लागतात - आणि त्यासाठी विशिष्ट डेटासेट्स आवश्यक असतात.
ऑब्जेक्ट डिटेक्शनसाठी रेग्रेशन
हा ब्लॉग पोस्ट आकार शोधण्यासाठी एक चांगली सुरुवात देते.
ऑब्जेक्ट डिटेक्शनसाठी डेटासेट्स
या कार्यासाठी तुम्हाला खालील डेटासेट्स सापडू शकतात:
- PASCAL VOC - 20 वर्ग
- COCO - कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट. 80 वर्ग, बॉक्सेस आणि सेगमेंटेशन मास्क
ऑब्जेक्ट डिटेक्शन मेट्रिक्स
इंटरसेक्शन ओव्हर युनियन
इमेज क्लासिफिकेशनसाठी अल्गोरिदम किती चांगले कार्य करते हे मोजणे सोपे आहे, परंतु ऑब्जेक्ट डिटेक्शनसाठी वर्गाची अचूकता आणि बॉक्सच्या स्थानाची अचूकता दोन्ही मोजणे आवश्यक आहे. यासाठी इंटरसेक्शन ओव्हर युनियन (IoU) वापरले जाते, जे दोन बॉक्सेस (किंवा दोन क्षेत्रे) किती चांगले ओव्हरलॅप होतात हे मोजते.
संकल्पना सोपी आहे - दोन आकृत्यांच्या ओव्हरलॅप क्षेत्राला त्यांच्या युनियन क्षेत्राने विभाजित करतो. दोन समान क्षेत्रांसाठी IoU 1 असेल, तर पूर्णपणे वेगळ्या क्षेत्रांसाठी ते 0 असेल. अन्यथा, ते 0 ते 1 दरम्यान बदलते. आम्ही सामान्यतः फक्त त्या बॉक्सेस विचारात घेतो ज्यांचे IoU विशिष्ट मूल्यापेक्षा जास्त असते.
सरासरी अचूकता (Average Precision)
समजा आपल्याला एखाद्या वर्गातील वस्तू C किती चांगल्या प्रकारे ओळखल्या जातात हे मोजायचे आहे. यासाठी सरासरी अचूकता मेट्रिक्स वापरली जाते, जी खालीलप्रमाणे गणना केली जाते:
- प्रिसिजन-रिकॉल वक्र ओळख थ्रेशोल्ड मूल्यावर (0 ते 1 पर्यंत) अवलंबून अचूकता दर्शवते.
- थ्रेशोल्डनुसार, आपल्याला चित्रात अधिक किंवा कमी वस्तू सापडतील, आणि प्रिसिजन व रिकॉलचे वेगवेगळे मूल्य मिळेल.
- वक्र असे दिसेल:
चित्र NeuroWorkshop मधून
वर्ग C साठी सरासरी अचूकता म्हणजे या वक्राखालील क्षेत्र. अधिक अचूकपणे, रिकॉल अक्ष सामान्यतः 10 भागांमध्ये विभागली जाते, आणि प्रिसिजन सर्व त्या बिंदूंवर सरासरी केली जाते:
AP = {1\over11}\sum_{i=0}^{10}\mbox{Precision}(\mbox{Recall}={i\over10})
AP आणि IoU
आम्ही फक्त त्या ओळखींवर विचार करू, ज्यांचे IoU विशिष्ट मूल्यापेक्षा जास्त आहे. उदाहरणार्थ, PASCAL VOC डेटासेटमध्ये सामान्यतः \mbox{IoU Threshold} = 0.5 मानले जाते, तर COCO मध्ये AP वेगवेगळ्या \mbox{IoU Threshold} मूल्यांसाठी मोजले जाते.
चित्र NeuroWorkshop मधून
सरासरी अचूकता - mAP
ऑब्जेक्ट डिटेक्शनसाठी मुख्य मेट्रिक मीन अॅव्हरेज प्रिसिजन किंवा mAP आहे. हे सर्व वर्गांसाठी सरासरी अचूकतेचे मूल्य आहे, आणि कधीकधी \mbox{IoU Threshold} वर देखील सरासरी केली जाते. अधिक तपशीलवार, mAP कसे गणना करायचे याचे वर्णन या ब्लॉग पोस्टमध्ये केले आहे, आणि इथे कोडसह देखील.
ऑब्जेक्ट डिटेक्शनसाठी विविध दृष्टिकोन
ऑब्जेक्ट डिटेक्शन अल्गोरिदम्सचे दोन मुख्य प्रकार आहेत:
- Region Proposal Networks (R-CNN, Fast R-CNN, Faster R-CNN). मुख्य कल्पना म्हणजे Regions of Interests (ROI) तयार करणे आणि त्यावर CNN चालवणे, जास्तीत जास्त सक्रियता शोधण्यासाठी. हे साध्या दृष्टिकोनासारखे आहे, परंतु ROIs अधिक हुशारीने तयार केले जातात. अशा पद्धतींचा मुख्य तोटा म्हणजे त्या हळू असतात, कारण चित्रावर CNN क्लासिफायरचे अनेक पासेस आवश्यक असतात.
- One-pass (YOLO, SSD, RetinaNet) पद्धती. या आर्किटेक्चरमध्ये वर्ग आणि ROIs एका पासमध्ये अंदाज लावण्यासाठी नेटवर्क डिझाइन केले जाते.
R-CNN: Region-Based CNN
R-CNN Selective Search वापरते ROI क्षेत्रांची संरचना तयार करण्यासाठी, जी नंतर CNN फीचर एक्स्ट्रॅक्टर्स आणि SVM-क्लासिफायर्सद्वारे वस्तूचा वर्ग निश्चित करण्यासाठी आणि बॉक्स समन्वय निश्चित करण्यासाठी रेषीय रेग्रेशनद्वारे प्रक्रिया केली जाते. अधिकृत पेपर
चित्र van de Sande et al. ICCV’11
चित्र या ब्लॉगमधून
F-RCNN - Fast R-CNN
हा दृष्टिकोन R-CNN सारखाच आहे, परंतु क्षेत्रे कॉन्व्होल्यूशन लेयर्स लागू केल्यानंतर निश्चित केली जातात.
चित्र अधिकृत पेपर, arXiv, 2015
Faster R-CNN
या दृष्टिकोनाची मुख्य कल्पना म्हणजे ROIs अंदाज लावण्यासाठी न्यूरल नेटवर्क वापरणे - ज्याला Region Proposal Network म्हणतात. पेपर, 2016
चित्र अधिकृत पेपर
R-FCN: Region-Based Fully Convolutional Network
हा अल्गोरिदम Faster R-CNN पेक्षा अधिक वेगवान आहे. मुख्य कल्पना अशी आहे:
- ResNet-101 वापरून फीचर्स काढणे.
- फीचर्स Position-Sensitive Score Map द्वारे प्रक्रिया केली जातात.
Cवर्गांमधील प्रत्येक वस्तूk\times kक्षेत्रांमध्ये विभागली जाते, आणि वस्तूंचे भाग अंदाज लावण्यासाठी प्रशिक्षण दिले जाते. k\times kक्षेत्रांमधील प्रत्येक भागासाठी सर्व नेटवर्क्स वस्तू वर्गांसाठी मतदान करतात, आणि जास्तीत जास्त मत असलेला वर्ग निवडला जातो.
चित्र अधिकृत पेपर
YOLO - You Only Look Once
YOLO हा रिअलटाइम एक-पास अल्गोरिदम आहे. मुख्य कल्पना अशी आहे:
- चित्र
S\times Sक्षेत्रांमध्ये विभागले जाते. - प्रत्येक क्षेत्रासाठी, CNN
nशक्य वस्तू, बॉक्स समन्वय आणि कॉन्फिडन्स=प्रॉबॅबिलिटी * IoU अंदाज लावते.
चित्र अधिकृत पेपर
इतर अल्गोरिदम्स
- RetinaNet: अधिकृत पेपर
- Torchvision मधील PyTorch अंमलबजावणी
- Keras अंमलबजावणी
- RetinaNet वापरून ऑब्जेक्ट डिटेक्शन Keras Samples मध्ये
- SSD (Single Shot Detector): अधिकृत पेपर
✍️ व्यायाम: ऑब्जेक्ट डिटेक्शन
खालील नोटबुकमध्ये तुमचे शिक्षण सुरू ठेवा:
निष्कर्ष
या धड्यात तुम्ही ऑब्जेक्ट डिटेक्शन साध्य करण्याच्या विविध पद्धतींचा झपाट्याने आढावा घेतला!
🚀 आव्हान
या लेख आणि नोटबुक्स वाचा आणि YOLO स्वतः वापरून पहा:
- YOLO बद्दल चांगला ब्लॉग पोस्ट
- अधिकृत साइट
- YOLO: Keras अंमलबजावणी, स्टेप-बाय-स्टेप नोटबुक
- YOLO v2: Keras अंमलबजावणी, स्टेप-बाय-स्टेप नोटबुक
व्याख्यानानंतर प्रश्नमंजुषा
पुनरावलोकन आणि स्व-अभ्यास
- ऑब्जेक्ट डिटेक्शन निखिल सरदाना यांच्याकडून
- ऑब्जेक्ट डिटेक्शन अल्गोरिदम्सची चांगली तुलना
- ऑब्जेक्ट डिटेक्शनसाठी डीप लर्निंग अल्गोरिदम्सचा आढावा
- ऑब्जेक्ट डिटेक्शन अल्गोरिदम्ससाठी स्टेप-बाय-स्टेप परिचय
- Python मध्ये Faster R-CNN वापरून ऑब्जेक्ट डिटेक्शनची अंमलबजावणी
असाइनमेंट: ऑब्जेक्ट डिटेक्शन
अस्वीकरण:
हा दस्तऐवज AI भाषांतर सेवा Co-op Translator चा वापर करून भाषांतरित करण्यात आला आहे. आम्ही अचूकतेसाठी प्रयत्नशील असलो तरी, कृपया लक्षात घ्या की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेचा अभाव असू शकतो. मूळ भाषेतील मूळ दस्तऐवज हा अधिकृत स्रोत मानला जावा. महत्त्वाच्या माहितीसाठी, व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराचा वापर केल्यामुळे उद्भवलेल्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थासाठी आम्ही जबाबदार राहणार नाही.









