AI-For-Beginners/translations/ja/lessons/4-ComputerVision/11-ObjectDetection
leestott 3ac667ea23 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-24 22:28:16 +00:00
ObjectDetection.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-24 22:28:16 +00:00

README.md

オブジェクト検出

これまで扱ってきた画像分類モデルは、画像を入力として受け取り、MNIST問題における「数字」クラスのようなカテゴリカルな結果を出力していました。しかし、多くの場合、画像に物体が写っていることを知るだけでなく、その正確な位置を特定したいと考えます。それがまさにオブジェクト検出の目的です。

事前クイズ

オブジェクト検出

画像出典: YOLO v2 ウェブサイト

オブジェクト検出の単純なアプローチ

例えば、画像内の猫を見つけたいと仮定します。非常に単純なオブジェクト検出のアプローチは以下のようになります:

  1. 画像を複数のタイルに分割する
  2. 各タイルに対して画像分類を実行する
  3. 十分に高い活性化を示したタイルを、対象の物体を含むとみなす

単純なオブジェクト検出

画像出典: 演習ノートブック

しかし、この方法は理想的とは言えません。なぜなら、アルゴリズムが物体の境界ボックスを非常に不正確にしか特定できないからです。より正確な位置を特定するには、境界ボックスの座標を予測するための回帰を実行する必要があります。そのためには、特定のデータセットが必要です。

オブジェクト検出のための回帰

このブログ記事では、形状検出についての優しい導入が紹介されています。

オブジェクト検出のためのデータセット

このタスクに関連する以下のデータセットに出会うかもしれません:

  • PASCAL VOC - 20クラス
  • COCO - コンテキスト内の一般的な物体。80クラス、境界ボックスとセグメンテーションマスクを含む

COCO

オブジェクト検出の評価指標

Intersection over Union (IoU)

画像分類ではアルゴリズムの性能を測定するのは簡単ですが、オブジェクト検出ではクラスの正確性だけでなく、推定された境界ボックスの位置の精度も測定する必要があります。そのために使用されるのが、Intersection over Union (IoU) と呼ばれる指標です。これは、2つのボックスまたは任意の2つの領域がどれだけ重なっているかを測定します。

IoU

図2 出典: この優れたIoUに関するブログ記事

アイデアはシンプルです。2つの図形の交差部分の面積を、2つの図形の合計面積で割ります。2つの領域が完全に一致している場合、IoUは1になります。一方、完全に分離している場合は0になります。それ以外の場合は0から1の間で変動します。通常、IoUが一定値を超える境界ボックスのみを考慮します。

平均精度 (Average Precision)

特定のクラス C の物体がどれだけ正確に認識されているかを測定したいとします。そのために、平均精度 (Average Precision) 指標を使用します。計算方法は以下の通りです:

  1. 検出閾値0から1までに応じた精度-再現率曲線を考慮します。
  2. 閾値に応じて、画像内で検出される物体の数や精度・再現率の値が変わります。
  3. 曲線は以下のようになります:

画像出典: NeuroWorkshop

クラス C の平均精度は、この曲線の下の面積です。より正確には、再現率軸を通常10分割し、精度をその各点で平均化します


AP = {1\over11}\sum_{i=0}^{10}\mbox{Precision}(\mbox{Recall}={i\over10})

APとIoU

IoUが一定値を超える検出のみを考慮します。例えば、PASCAL VOCデータセットでは通常 \mbox{IoU Threshold} = 0.5 が仮定されます。一方、COCOでは異なる値の \mbox{IoU Threshold} に対してAPが測定されます。

画像出典: NeuroWorkshop

平均平均精度 - mAP

オブジェクト検出の主要な評価指標は平均平均精度 (Mean Average Precision, mAP) と呼ばれます。これは、すべての物体クラスにわたる平均精度の値であり、時には \mbox{IoU Threshold} にもわたって平均化されます。mAP の計算プロセスについては、このブログ記事こちらのコードサンプル付きの記事で詳しく説明されています。

オブジェクト検出のさまざまなアプローチ

オブジェクト検出アルゴリズムには、大きく分けて2つのクラスがあります

  • 領域提案ネットワーク (Region Proposal Networks) (R-CNN, Fast R-CNN, Faster R-CNN)。主なアイデアは、関心領域 (ROI) を生成し、それに対してCNNを実行して最大活性化を探すことです。この方法は単純なアプローチに似ていますが、ROIがより賢く生成される点が異なります。この方法の主な欠点は、画像に対してCNN分類器を何度も実行する必要があるため、遅いことです。
  • ワンパス (YOLO, SSD, RetinaNet) メソッド。これらのアーキテクチャでは、クラスとROIの両方を1回のパスで予測するようにネットワークを設計します。

R-CNN: 領域ベースのCNN

R-CNN は、Selective Search を使用してROI領域の階層構造を生成します。これらの領域はCNN特徴抽出器とSVM分類器を通じて物体クラスを決定し、線形回帰を使用して境界ボックスの座標を決定します。公式論文

RCNN

画像出典: van de Sande et al. ICCV11

RCNN-1

画像出典: このブログ

F-RCNN - Fast R-CNN

このアプローチはR-CNNに似ていますが、領域は畳み込み層が適用された後に定義されます。

FRCNN

画像出典: 公式論文, arXiv, 2015

Faster R-CNN

このアプローチの主なアイデアは、ROIを予測するためにニューラルネットワークを使用することです。これを領域提案ネットワーク (Region Proposal Network) と呼びます。論文, 2016

FasterRCNN

画像出典: 公式論文

R-FCN: 領域ベースの完全畳み込みネットワーク

このアルゴリズムはFaster R-CNNよりもさらに高速です。主なアイデアは以下の通りです

  1. ResNet-101を使用して特徴を抽出する
  2. 特徴を位置感知スコアマップで処理する。クラス C の各物体は k\times k の領域に分割され、物体の部分を予測するように学習する
  3. k\times k の各領域の部分について、すべてのネットワークが物体クラスに投票し、最大票を得た物体クラスが選択される

r-fcn image

画像出典: 公式論文

YOLO - You Only Look Once

YOLOはリアルタイムのワンパスアルゴリズムです。主なアイデアは以下の通りです

  • 画像を S\times S の領域に分割する
  • 各領域について、CNNn 個の可能な物体、境界ボックスの座標、信頼度=確率 * IoU を予測する

YOLO

画像出典: 公式論文

その他のアルゴリズム

✍️ 演習: オブジェクト検出

以下のノートブックで学習を続けてください:

ObjectDetection.ipynb

結論

このレッスンでは、オブジェクト検出を実現するさまざまな方法について駆け足で学びました!

🚀 チャレンジ

以下の記事やートブックを読み、YOLOを試してみてください

事後クイズ

復習と自己学習

課題: オブジェクト検出

免責事項:
この文書は、AI翻訳サービス Co-op Translator を使用して翻訳されています。正確性を期すよう努めておりますが、自動翻訳には誤りや不正確な部分が含まれる可能性があります。元の言語で記載された原文が正式な情報源と見なされるべきです。重要な情報については、専門の人間による翻訳を推奨します。本翻訳の使用に起因する誤解や誤認について、当方は一切の責任を負いません。