|
|
||
|---|---|---|
| .. | ||
| README.md | ||
README.md
Huvuddetektion med Hollywood Heads Dataset
Labuppgift frÄn AI for Beginners Curriculum.
Uppgift
Att rÀkna antalet personer pÄ en videoström frÄn övervakningskameror Àr en viktig uppgift som gör det möjligt att uppskatta antalet besökare i butiker, rusningstider pÄ restauranger, etc. För att lösa denna uppgift behöver vi kunna detektera mÀnskliga huvuden frÄn olika vinklar. För att trÀna en objektidentifieringsmodell att detektera mÀnskliga huvuden kan vi anvÀnda Hollywood Heads Dataset.
Datasetet
Hollywood Heads Dataset innehÄller 369,846 mÀnskliga huvuden annoterade i 224,740 filmrutor frÄn Hollywoodfilmer. Det tillhandahÄlls i [https://host.robots.ox.ac.uk/pascal/VOC/](../../../../../../lessons/4-ComputerVision/11-ObjectDetection/lab/PASCAL VOC)-format, dÀr det för varje bild ocksÄ finns en XML-beskrivningsfil som ser ut sÄ hÀr:
<annotation>
<folder>HollywoodHeads</folder>
<filename>mov_021_149390.jpeg</filename>
<source>
<database>HollywoodHeads 2015 Database</database>
<annotation>HollywoodHeads 2015</annotation>
<image>WILLOW</image>
</source>
<size>
<width>608</width>
<height>320</height>
<depth>3</depth>
</size>
<segmented>0</segmented>
<object>
<name>head</name>
<bndbox>
<xmin>201</xmin>
<ymin>1</ymin>
<xmax>480</xmax>
<ymax>263</ymax>
</bndbox>
<difficult>0</difficult>
</object>
<object>
<name>head</name>
<bndbox>
<xmin>3</xmin>
<ymin>4</ymin>
<xmax>241</xmax>
<ymax>285</ymax>
</bndbox>
<difficult>0</difficult>
</object>
</annotation>
I detta dataset finns det endast en klass av objekt, head, och för varje huvud fÄr du koordinaterna för begrÀnsningsrutan. Du kan analysera XML med Python-bibliotek, eller anvÀnda detta bibliotek för att direkt hantera PASCAL VOC-formatet.
TrÀning av objektidentifiering
Du kan trÀna en objektidentifieringsmodell pÄ nÄgot av följande sÀtt:
- AnvÀnda Azure Custom Vision och dess Python-API för att programmera trÀningen av modellen i molnet. Custom Vision kan inte anvÀnda mer Àn nÄgra hundra bilder för att trÀna modellen, sÄ du kan behöva begrÀnsa datasetet.
- AnvÀnda exemplet frÄn Keras tutorial för att trÀna RetunaNet-modellen.
- AnvÀnda torchvision.models.detection.RetinaNet inbyggd modul i torchvision.
Slutsats
Objektidentifiering Ă€r en uppgift som ofta krĂ€vs inom industrin. Ăven om det finns tjĂ€nster som kan anvĂ€ndas för att utföra objektidentifiering (sĂ„som Azure Custom Vision), Ă€r det viktigt att förstĂ„ hur objektidentifiering fungerar och att kunna trĂ€na sina egna modeller.
Ansvarsfriskrivning:
Detta dokument har översatts med hjĂ€lp av AI-översĂ€ttningstjĂ€nsten Co-op Translator. Ăven om vi strĂ€var efter noggrannhet, bör du vara medveten om att automatiserade översĂ€ttningar kan innehĂ„lla fel eller felaktigheter. Det ursprungliga dokumentet pĂ„ dess ursprungliga sprĂ„k bör betraktas som den auktoritativa kĂ€llan. För kritisk information rekommenderas professionell mĂ€nsklig översĂ€ttning. Vi ansvarar inte för eventuella missförstĂ„nd eller feltolkningar som uppstĂ„r vid anvĂ€ndning av denna översĂ€ttning.