AI-For-Beginners/translations/sv/lessons/4-ComputerVision/11-ObjectDetection/lab
leestott 68b3c9c9e7 🌐 Update translations via Co-op Translator 2025-08-28 18:09:00 +00:00
..
README.md 🌐 Update translations via Co-op Translator 2025-08-28 18:09:00 +00:00

README.md

Huvuddetektion med Hollywood Heads Dataset

Labuppgift frÄn AI for Beginners Curriculum.

Uppgift

Att rÀkna antalet personer pÄ en videoström frÄn övervakningskameror Àr en viktig uppgift som gör det möjligt att uppskatta antalet besökare i butiker, rusningstider pÄ restauranger, etc. För att lösa denna uppgift behöver vi kunna detektera mÀnskliga huvuden frÄn olika vinklar. För att trÀna en objektidentifieringsmodell att detektera mÀnskliga huvuden kan vi anvÀnda Hollywood Heads Dataset.

Datasetet

Hollywood Heads Dataset innehÄller 369,846 mÀnskliga huvuden annoterade i 224,740 filmrutor frÄn Hollywoodfilmer. Det tillhandahÄlls i [https://host.robots.ox.ac.uk/pascal/VOC/](../../../../../../lessons/4-ComputerVision/11-ObjectDetection/lab/PASCAL VOC)-format, dÀr det för varje bild ocksÄ finns en XML-beskrivningsfil som ser ut sÄ hÀr:

<annotation>
	<folder>HollywoodHeads</folder>
	<filename>mov_021_149390.jpeg</filename>
	<source>
		<database>HollywoodHeads 2015 Database</database>
		<annotation>HollywoodHeads 2015</annotation>
		<image>WILLOW</image>
	</source>
	<size>
		<width>608</width>
		<height>320</height>
		<depth>3</depth>
	</size>
	<segmented>0</segmented>
	<object>
		<name>head</name>
		<bndbox>
			<xmin>201</xmin>
			<ymin>1</ymin>
			<xmax>480</xmax>
			<ymax>263</ymax>
		</bndbox>
		<difficult>0</difficult>
	</object>
	<object>
		<name>head</name>
		<bndbox>
			<xmin>3</xmin>
			<ymin>4</ymin>
			<xmax>241</xmax>
			<ymax>285</ymax>
		</bndbox>
		<difficult>0</difficult>
	</object>
</annotation>

I detta dataset finns det endast en klass av objekt, head, och för varje huvud fÄr du koordinaterna för begrÀnsningsrutan. Du kan analysera XML med Python-bibliotek, eller anvÀnda detta bibliotek för att direkt hantera PASCAL VOC-formatet.

TrÀning av objektidentifiering

Du kan trÀna en objektidentifieringsmodell pÄ nÄgot av följande sÀtt:

  • AnvĂ€nda Azure Custom Vision och dess Python-API för att programmera trĂ€ningen av modellen i molnet. Custom Vision kan inte anvĂ€nda mer Ă€n nĂ„gra hundra bilder för att trĂ€na modellen, sĂ„ du kan behöva begrĂ€nsa datasetet.
  • AnvĂ€nda exemplet frĂ„n Keras tutorial för att trĂ€na RetunaNet-modellen.
  • AnvĂ€nda torchvision.models.detection.RetinaNet inbyggd modul i torchvision.

Slutsats

Objektidentifiering Ă€r en uppgift som ofta krĂ€vs inom industrin. Även om det finns tjĂ€nster som kan anvĂ€ndas för att utföra objektidentifiering (sĂ„som Azure Custom Vision), Ă€r det viktigt att förstĂ„ hur objektidentifiering fungerar och att kunna trĂ€na sina egna modeller.


Ansvarsfriskrivning:
Detta dokument har översatts med hjĂ€lp av AI-översĂ€ttningstjĂ€nsten Co-op Translator. Även om vi strĂ€var efter noggrannhet, bör du vara medveten om att automatiserade översĂ€ttningar kan innehĂ„lla fel eller felaktigheter. Det ursprungliga dokumentet pĂ„ dess ursprungliga sprĂ„k bör betraktas som den auktoritativa kĂ€llan. För kritisk information rekommenderas professionell mĂ€nsklig översĂ€ttning. Vi ansvarar inte för eventuella missförstĂ„nd eller feltolkningar som uppstĂ„r vid anvĂ€ndning av denna översĂ€ttning.