AI-For-Beginners/translations/zh/lessons/4-ComputerVision/11-ObjectDetection
leestott 0a7f88c514 🌐 Update translations via Co-op Translator 2025-08-24 22:28:16 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-24 22:28:16 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-24 22:28:16 +00:00

README.md

目标检测

我们之前讨论的图像分类模型通常会接收一张图片并输出一个类别结果,例如在 MNIST 问题中输出类别“数字”。然而,在许多情况下,我们不仅仅想知道图片中是否有物体——我们还希望能够确定它们的具体位置。这正是目标检测的核心所在。

课前测验

目标检测

图片来源:YOLO v2 网站

一种简单的目标检测方法

假设我们想在一张图片中找到一只猫,一种非常简单的目标检测方法可能是:

  1. 将图片分割成多个小块。
  2. 对每个小块进行图像分类。
  3. 对于分类结果激活值足够高的小块,可以认为其中包含目标物体。

简单目标检测

图片来源:练习笔记本

然而,这种方法远非理想,因为它只能非常粗略地定位物体的边界框。为了更精确地定位,我们需要进行某种回归来预测边界框的坐标——这需要特定的数据集。

用回归进行目标检测

这篇博客文章对目标检测中的形状识别进行了很好的入门介绍。

目标检测数据集

在进行目标检测任务时,你可能会遇到以下数据集:

  • PASCAL VOC - 包含 20 个类别
  • COCO - 常见物体上下文数据集。包含 80 个类别,边界框和分割掩码

COCO

目标检测评估指标

交并比IoU

对于图像分类来说,评估算法性能相对简单;但对于目标检测,我们需要同时评估类别的正确性以及预测边界框位置的精确性。后者通常使用交并比IoU来衡量即评估两个框或任意两个区域的重叠程度。

IoU

图片来源:这篇关于 IoU 的优秀博客文章

其思想很简单——将两个图形的交集面积除以它们的并集面积。对于两个完全相同的区域IoU 值为 1对于完全不相交的区域IoU 值为 0。其他情况下IoU 值介于 0 到 1 之间。通常我们只考虑 IoU 超过某个阈值的边界框。

平均精度AP

假设我们想评估某个类别 C 的识别效果。为此,我们使用平均精度AP指标其计算方法如下

  1. 考虑精度-召回曲线,该曲线显示检测阈值(从 0 到 1变化时的准确性。
  2. 根据阈值,我们会检测到图片中的更多或更少的物体,并得到不同的精度和召回值。
  3. 曲线如下所示:

图片来源:NeuroWorkshop

某类别 C 的平均精度是该曲线下的面积。更具体地说,召回轴通常分为 10 个部分,精度在这些点上取平均值:


AP = {1\over11}\sum_{i=0}^{10}\mbox{Precision}(\mbox{Recall}={i\over10})

AP 和 IoU

我们只考虑 IoU 超过某个阈值的检测。例如,在 PASCAL VOC 数据集中通常假设 \mbox{IoU Threshold} = 0.5,而在 COCO 数据集中AP 是针对不同的 \mbox{IoU Threshold} 值计算的。

图片来源:NeuroWorkshop

平均平均精度mAP

目标检测的主要评估指标是平均平均精度mAP。它是所有类别的平均精度值有时也包括不同的 \mbox{IoU Threshold}。关于mAP的详细计算过程可以参考 这篇博客文章,以及这里的代码示例

不同的目标检测方法

目标检测算法主要分为两大类:

  • 区域提议网络R-CNN、Fast R-CNN、Faster R-CNN。其核心思想是生成兴趣区域ROI并对其运行 CNN寻找最大激活值。这种方法与简单方法类似但 ROI 的生成方式更为智能。此类方法的主要缺点是速度较慢,因为需要对图像进行多次 CNN 分类。
  • 单次检测YOLO、SSD、RetinaNet方法。这些架构设计为在一次网络运行中同时预测类别和 ROI。

R-CNN基于区域的 CNN

R-CNN 使用选择性搜索生成 ROI 区域的层次结构,然后通过 CNN 特征提取器和 SVM 分类器确定物体类别,并通过线性回归确定边界框坐标。官方论文

RCNN

图片来源van de Sande 等人 ICCV11

RCNN-1

图片来源:这篇博客

F-RCNN - 快速 R-CNN

这种方法与 R-CNN 类似,但区域是在应用卷积层之后定义的。

FRCNN

图片来源:官方论文arXiv2015

Faster R-CNN

这种方法的核心思想是使用神经网络预测 ROI即所谓的区域提议网络论文2016

FasterRCNN

图片来源:官方论文

R-FCN基于区域的全卷积网络

这种算法比 Faster R-CNN 更快。其核心思想如下:

  1. 使用 ResNet-101 提取特征。
  2. 特征通过位置敏感得分图处理。每个类别 C 的物体被划分为 k\times k 区域,并训练预测物体的各部分。
  3. 对于 k\times k 区域的每个部分,所有网络对物体类别进行投票,选择得票最多的类别。

r-fcn image

图片来源:官方论文

YOLO - 你只需看一次

YOLO 是一种实时单次检测算法。其核心思想如下:

  • 将图像划分为 S\times S 区域。
  • 对每个区域,CNN 预测 n 个可能的物体、边界框坐标和置信度=概率 * IoU。

YOLO

图片来源:官方论文

其他算法

✍️ 练习:目标检测

通过以下笔记本继续学习:

ObjectDetection.ipynb

总结

在本课中,你快速了解了实现目标检测的各种方法!

🚀 挑战

阅读以下关于 YOLO 的文章和笔记本,并尝试自己动手实践:

课后测验

复习与自学

作业:目标检测

免责声明
本文档使用AI翻译服务 Co-op Translator 进行翻译。尽管我们努力确保翻译的准确性,但请注意,自动翻译可能包含错误或不准确之处。应以原文档的原始语言版本为权威来源。对于关键信息,建议使用专业人工翻译。我们对因使用此翻译而引起的任何误解或误读不承担责任。