AI-For-Beginners/translations/ja/lessons/4-ComputerVision/11-ObjectDetection
Pikachú 5d34bc4eb8 Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00
..
lab Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00
README.md Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00

README.md

物体検出

これまで扱ってきた画像分類モデルは、画像を入力としてクラス「数字」のようなカテゴリ結果を出力しました。しかし、多くの場合、単に画像に物体が描かれていることを知るだけでなく、それらの正確な位置を特定できるようにしたいのです。これがまさに物体検出の目的です。

プレ講義クイズ

物体検出

画像出典:YOLO v2 ウェブサイト

物体検出へのナイーブなアプローチ

もし、画像の中に猫を見つけたいと仮定すると、非常にナイーブな物体検出のアプローチは以下のようになります。

  1. 画像をいくつかのタイルに分割する
  2. 各タイルに対して画像分類を実行する
  3. 十分に高い活性化を示すタイルは、問題の物体を含むと見なされます。

ナイーブな物体検出

画像出典:演習ノートブック

しかし、このアプローチは理想から遠く、アルゴリズムが物体のバウンディングボックスを非常に不正確に特定することしかできません。より正確な位置を得るためには、バウンディングボックスの座標を予測するための何らかの回帰を実行する必要があり、そのためには特定のデータセットが必要です。

物体検出のための回帰

このブログ記事は、形状検出の優れた入門を提供しています。

物体検出のためのデータセット

このタスクに関連するデータセットには以下のものがあります。

  • PASCAL VOC - 20クラス
  • COCO - 文脈における一般的な物体。80クラス、バウンディングボックスおよびセグメンテーションマスク

COCO

物体検出のメトリクス

IoUIntersection over Union

画像分類の場合、アルゴリズムのパフォーマンスを測定するのは簡単ですが、物体検出ではクラスの正確さと推測されたバウンディングボックスの位置の精度の両方を測定する必要があります。後者には、いわゆる**IoUIntersection over Union**を使用し、2つのボックスまたは2つの任意の領域がどれだけ重なっているかを測定します。

IoU

図2この優れたIoUに関するブログ記事から

アイデアはシンプルです - 2つの図形の交差部分の面積を、その和の面積で割ります。2つの同一の領域では、IoUは1になり、完全に離れた領域では0になります。それ以外の場合は0から1の間で変動します。通常、IoUが特定の値を超えるバウンディングボックスのみを考慮します。

平均精度

特定の物体クラスCがどれだけ認識されているかを測定したいとしましょう。それを測定するために、平均精度メトリクスを使用します。これは以下のように計算されます。

  1. 精度-再現率曲線が、検出しきい値0から1までに依存する精度を示すことを考慮します。
  2. しきい値に応じて、画像内で検出される物体の数が増減し、精度と再現率の異なる値が得られます。
  3. 曲線はこのようになります:

画像出典:NeuroWorkshop

与えられたクラスCの平均精度は、この曲線の下の面積です。より正確には、再現率軸は通常10部分に分けられ、精度はすべてのポイントで平均されます


AP = {1\over11}\sum_{i=0}^{10}\mbox{Precision}(\mbox{Recall}={i\over10})

APとIoU

IoUが特定の値を超える検出のみを考慮します。たとえば、PASCAL VOCデータセットでは通常\mbox{IoU Threshold} = 0.5が想定されており、COCOでは異なる\mbox{IoU Threshold}の値でAPが測定されます。

画像出典:NeuroWorkshop

平均平均精度 - mAP

物体検出の主なメトリクスは平均平均精度、またはmAPと呼ばれています。これは、すべての物体クラスにわたる平均精度の値であり、時には\mbox{IoU Threshold}にわたっても平均されます。より詳細には、mAPを計算するプロセスはこのブログ記事で説明されており、こちらにはコードサンプルがあります

異なる物体検出アプローチ

物体検出アルゴリズムには大きく分けて2つのクラスがあります。

  • 領域提案ネットワークR-CNN、Fast R-CNN、Faster R-CNN。主なアイデアは、関心領域ROIを生成し、それらの上でCNNを実行して最大の活性化を探すことです。これはナイーブなアプローチに少し似ていますが、ROIはより巧妙な方法で生成されます。このような方法の主な欠点の1つは、画像上でCNN分類器を多くのパスで実行する必要があるため遅いことです。
  • 一回のパスYOLO、SSD、RetinaNetメソッド。これらのアーキテクチャでは、ネットワークを設計して、クラスとROIの両方を一度のパスで予測します。

R-CNN: 領域ベースのCNN

R-CNNは、Selective Searchを使用してROI領域の階層構造を生成し、それをCNN特徴抽出器とSVM分類器に通して物体クラスを特定し、線形回帰を使用してバウンディングボックスの座標を決定します。公式論文

RCNN

画像出典van de Sande et al. ICCV11

RCNN-1

画像出典:このブログ

F-RCNN - Fast R-CNN

このアプローチはR-CNNに似ていますが、領域は畳み込み層が適用された後に定義されます。

FRCNN

画像出典:公式論文arXiv、2015年

Faster R-CNN

このアプローチの主なアイデアは、ニューラルネットワークを使用してROIを予測することです - いわゆる領域提案ネットワーク論文、2016年

FasterRCNN

画像出典:公式論文

R-FCN: 領域ベースの完全畳み込みネットワーク

このアルゴリズムはFaster R-CNNよりもさらに高速です。主なアイデアは次の通りです。

  1. ResNet-101を使用して特徴を抽出します
  2. 特徴は位置感受性スコアマップによって処理されます。Cクラスの各物体はk\times k領域に分割され、物体の部分を予測するように訓練されます。
  3. k\times k領域の各部分について、すべてのネットワークが物体クラスに投票し、最大の投票を得た物体クラスが選択されます。

r-fcn image

画像出典:公式論文

YOLO - You Only Look Once

YOLOはリアルタイムの一回のパスアルゴリズムです。主なアイデアは次の通りです。

  • 画像をS\times S領域に分割します
  • 各領域に対して、CNNn個の可能な物体、バウンディングボックスの座標、および信頼度=確率 * IoUを予測します。

YOLO

画像は公式論文からのものです。

その他のアルゴリズム

✍️ 演習: 物体検出

以下のノートブックで学習を続けましょう:

ObjectDetection.ipynb

結論

このレッスンでは、物体検出が達成できるさまざまな方法を駆け足で紹介しました!

🚀 チャレンジ

これらのYOLOに関する記事やートブックを読んで、自分で試してみてください。

講義後のクイズ

レビュー & 自習

課題: 物体検出

免責事項:
この文書は、機械ベースのAI翻訳サービスを使用して翻訳されました。正確性を追求していますが、自動翻訳にはエラーや不正確さが含まれる可能性があることをご理解ください。原文はその言語での権威ある情報源と見なされるべきです。重要な情報については、専門の人間翻訳を推奨します。この翻訳の使用に起因する誤解や誤解釈については、当社は責任を負いません。