AI-For-Beginners/translations/hu/lessons/4-ComputerVision/11-ObjectDetection
localizeflow[bot] 3c760d21ff chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:29:36 +00:00
..
lab chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:29:36 +00:00
ObjectDetection.ipynb 🌐 Update translations via Co-op Translator 2025-08-29 16:53:37 +00:00
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:29:36 +00:00

README.md

Objektumfelismerés

Az eddig tárgyalt képosztályozási modellek egy képet vettek bemenetként, és egy kategóriát adtak eredményül, például az 'szám' osztályt az MNIST problémában. Azonban sok esetben nem elég, hogy tudjuk, egy kép tárgyakat ábrázol - szeretnénk meghatározni azok pontos helyét is. Ez az objektumfelismerés célja.

Előadás előtti kvíz

Objektumfelismerés

Kép a YOLO v2 weboldaláról

Egy naiv megközelítés az objektumfelismeréshez

Tegyük fel, hogy egy képen szeretnénk megtalálni egy macskát. Egy nagyon egyszerű megközelítés az objektumfelismeréshez a következő lenne:

  1. Felosztjuk a képet több csempére.
  2. Képosztályozást futtatunk minden csempén.
  3. Azok a csempék, amelyeknél elég magas aktivációt kapunk, tartalmazhatják a keresett objektumot.

Naiv objektumfelismerés

Kép az Exercise Notebook-ból

Ez a megközelítés azonban messze nem ideális, mivel az algoritmus csak nagyon pontatlanul tudja meghatározni az objektum körvonalát. A pontosabb helymeghatározáshoz valamilyen regressziót kell futtatnunk, hogy előre jelezzük a körvonalak koordinátáit - ehhez pedig speciális adatállományokra van szükség.

Regresszió az objektumfelismeréshez

Ez a blogbejegyzés remek bevezetést nyújt az alakzatok felismeréséhez.

Adatállományok objektumfelismeréshez

Az alábbi adatállományokkal találkozhatsz ezen a területen:

  • PASCAL VOC - 20 osztály
  • COCO - Közönséges tárgyak kontextusban. 80 osztály, körvonalak és szegmentációs maszkok

COCO

Objektumfelismerési metrikák

Metszet az unióhoz viszonyítva

Míg a képosztályozásnál könnyű mérni az algoritmus teljesítményét, az objektumfelismerésnél nemcsak az osztály helyességét kell mérni, hanem az előre jelzett körvonal helyének pontosságát is. Ehhez az úgynevezett Metszet az unióhoz viszonyítva (IoU) metrikát használjuk, amely azt méri, hogy két doboz (vagy két tetszőleges terület) mennyire fedik egymást.

IoU

2. ábra ebből a kiváló blogbejegyzésből az IoU-ról

Az ötlet egyszerű - elosztjuk a két alakzat metszetének területét az uniójuk területével. Két azonos terület esetén az IoU értéke 1, míg teljesen különálló területeknél 0. Egyébként 0 és 1 között változik. Általában csak azokat a körvonalakat vesszük figyelembe, amelyeknél az IoU egy bizonyos érték felett van.

Átlagos pontosság

Tegyük fel, hogy egy adott C osztályú objektum felismerésének hatékonyságát szeretnénk mérni. Ehhez az Átlagos Pontosság metrikát használjuk, amelyet az alábbiak szerint számítunk ki:

  1. Vegyük a Pontosság-Visszahívás görbét, amely a pontosságot mutatja a detektálási küszöbérték függvényében (0-tól 1-ig).
  2. A küszöbértéktől függően több vagy kevesebb objektumot detektálunk a képen, és különböző pontosság- és visszahívásértékeket kapunk.
  3. A görbe így fog kinézni:

Kép a NeuroWorkshop-ból

Az adott C osztályú objektum Átlagos Pontossága a görbe alatti terület. Pontosabban, a visszahívás tengelyt általában 10 részre osztjuk, és a pontosságot átlagoljuk ezeken a pontokon:


AP = {1\over11}\sum_{i=0}^{10}\mbox{Pontosság}(\mbox{Visszahívás}={i\over10})

AP és IoU

Csak azokat a detektálásokat vesszük figyelembe, amelyeknél az IoU egy bizonyos érték felett van. Például a PASCAL VOC adatállományban általában \mbox{IoU Küszöbérték} = 0.5 az alapértelmezett, míg a COCO esetében az AP-t különböző \mbox{IoU Küszöbérték} értékekre mérik.

Kép a NeuroWorkshop-ból

Átlagos Pontosság Átlaga - mAP

Az objektumfelismerés fő metrikája az Átlagos Pontosság Átlaga, vagy mAP. Ez az Átlagos Pontosság értéke, amelyet az összes objektumosztályra átlagolunk, és néha az \mbox{IoU Küszöbérték} értékére is. Az mAP számításának részleteit ebben a blogbejegyzésben) találod, valamint itt kóddal.

Különböző objektumfelismerési megközelítések

Az objektumfelismerési algoritmusoknak két fő típusa van:

  • Régiójavasló hálózatok (R-CNN, Fast R-CNN, Faster R-CNN). Az alapötlet az, hogy érdekes régiókat (ROI) generálunk, és CNN-t futtatunk rajtuk, keresve a maximális aktivációt. Ez némileg hasonlít a naiv megközelítéshez, azzal a különbséggel, hogy az ROI-kat okosabb módon generáljuk. Az ilyen módszerek egyik fő hátránya, hogy lassúak, mivel sok CNN osztályozót kell futtatni a képen.
  • Egyszeri futtatású (YOLO, SSD, RetinaNet) módszerek. Ezekben az architektúrákban a hálózatot úgy tervezzük, hogy egyszerre jósolja meg az osztályokat és az ROI-kat.

R-CNN: Régióalapú CNN

Az R-CNN a Szelektív Keresést használja, hogy hierarchikus ROI régiókat generáljon, amelyeket aztán CNN jellemzőkivonókon és SVM-osztályozókon futtatunk, hogy meghatározzuk az objektum osztályát, valamint lineáris regresszióval a körvonal koordinátáit. Hivatalos tanulmány

RCNN

Kép van de Sande et al. ICCV11

RCNN-1

Képek ebből a blogból

F-RCNN - Gyors R-CNN

Ez a megközelítés hasonló az R-CNN-hez, de a régiókat a konvolúciós rétegek alkalmazása után határozzuk meg.

FRCNN

Kép a Hivatalos tanulmányból, arXiv, 2015

Gyorsabb R-CNN

Ennek a megközelítésnek az alapötlete, hogy neurális hálózatot használunk az ROI-k előrejelzésére - az úgynevezett Régiójavasló Hálózat. Tanulmány, 2016

FasterRCNN

Kép a hivatalos tanulmányból

R-FCN: Régióalapú Teljesen Konvolúciós Hálózat

Ez az algoritmus még gyorsabb, mint a Gyorsabb R-CNN. Az alapötlet a következő:

  1. Jellemzőket vonunk ki ResNet-101 segítségével.
  2. A jellemzőket Pozíció-Érzékeny Pontszám Térképen dolgozzuk fel. Minden objektumot C osztályból k\times k régiókra osztunk, és az objektumok részeinek előrejelzésére tanítjuk a hálózatot.
  3. Minden részre a k\times k régiókból a hálózatok szavaznak az objektumosztályokra, és a maximális szavazatot kapó osztályt választjuk.

r-fcn kép

Kép a hivatalos tanulmányból

YOLO - You Only Look Once

A YOLO egy valós idejű egyszeri futtatású algoritmus. Az alapötlet a következő:

  • A képet S\times S régiókra osztjuk.
  • Minden régióra CNN előrejelzi n lehetséges objektumot, körvonal koordinátákat és bizalmi szintet=valószínűség * IoU.

YOLO

Kép a hivatalos tanulmányból

Egyéb algoritmusok

✍️ Gyakorlatok: Objektumfelismerés

Folytasd a tanulást az alábbi jegyzetfüzetben:

ObjectDetection.ipynb

Összegzés

Ebben a leckében gyors áttekintést kaptál az objektumfelismerés különböző megközelítéseiről!

🚀 Kihívás

Olvasd el ezeket a cikkeket és jegyzetfüzeteket a YOLO-ról, és próbáld ki őket magad:

Előadás utáni kvíz

Áttekintés és önálló tanulás

Feladat: Objektumfelismerés