物体検出 - YOLO・SSD・R-CNN系の進化

物体検出の2系統 (R-CNN系の2段階検出、YOLO/SSDの1段階検出)、評価指標 (mAP/IoU)、新しいDETR、自動運転や医療画像への応用までG検定観点で整理。

『物体検出』は画像内の複数の物体を『どこに』『何が』あるかを同時に推定するタスクです。G検定では各手法の特徴と歴史的進化が問われます。

雷門 あかり(普段) 雷門 あかり

物体検出って自動運転でよく聞くやつだよね?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

そう。
物体検出(Object Detection) は『画像内のどこに何があるか』をバウンディングボックス(矩形枠) で囲んで分類するタスク。
自動運転・防犯カメラ・医療画像で必須ね。

白銀 エマ(普段) 白銀 エマ

画像分類との違いは『複数の物体』と『位置情報も同時に推定する』という点ね。
1枚の画像から人・車・標識を同時に検出できる必要があるの。

紫藤 ゆら(普段) 紫藤 ゆら

代表的な手法にはどんなものがあるんですかぁ?

六角 いずみ 先生(普段) 六角 いずみ 先生

歴史的には大きく2系統。
①2段階検出(Two-stage: R-CNN系)、②1段階検出(One-stage: YOLOSSD) よ。

白銀 エマ(普段) 白銀 エマ

R-CNN系の進化: R-CNN(2014, Selective Searchで領域提案+CNN) → Fast R-CNN(2015, ROI Pooling で高速化) → Faster R-CNN(2015, Region Proposal Network 統合)。
精度は高いが速度は遅め。

雷門 あかり(笑い) 雷門 あかり

YOLOってリアルタイムで動くやつで有名だよね?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

そう。
YOLO(You Only Look Once, 2016〜) は画像を一度だけ見るという名の通り、画像をグリッドに分割し各セルで物体を予測する1段階手法。
リアルタイム性が最大の特徴で、自動運転や監視カメラで採用されているわ。

白銀 エマ(普段) 白銀 エマ

YOLOはバージョンが進化中 (v1〜v8〜)。
各世代でアーキテクチャや精度が改善されているの。
SSD(Single Shot MultiBox Detector, 2016) もYOLOと並ぶ1段階手法。
複数スケールでの検出に強い。

紫藤 ゆら(普段) 紫藤 ゆら

もっと新しい手法もあるんですかぁ?

六角 いずみ 先生(普段) 六角 いずみ 先生

ええ、DETR(Detection Transformer, 2020) はTransformerを物体検出に適用して、NMS(Non-Maximum Suppression) などの後処理を不要にした画期的な手法なのよ。

白銀 エマ(普段) 白銀 エマ

評価指標はmAP(mean Average Precision) が標準。
IoU(Intersection over Union) で予測ボックスと正解ボックスの重なり具合を測定し、閾値以上を正解扱いするわ。

雷門 あかり(笑い) 雷門 あかり

G検定ではどこが出やすいの?

六角 いずみ 先生(普段) 六角 いずみ 先生

頻出ポイント: ①YOLOは1段階・高速、②R-CNN系は2段階・高精度、③mAP/IoU の意味、④バウンディングボックスの概念、⑤NMS で重複検出を除去。

紫藤 ゆら(笑顔) 紫藤 ゆら

YOLOとR-CNNの違いを覚えました!

雷門 あかり(笑い) 雷門 あかり

応用先と特徴をセットで覚えるんだね!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

応用先 (自動運転・医療・小売・農業) と性能要件 (リアルタイムなら1段階、高精度なら2段階) のマッピングも問われるわよ。

確認クイズ

リアルタイム性が要求される自動運転車の物体検出に最も適した手法はどれか。

  1. Faster R-CNN (2段階検出・高精度)
  2. YOLO (1段階検出・高速)
  3. PCA (主成分分析)
  4. Word2Vec (単語埋め込み)
こたえを見る

正解: 2. YOLO (1段階検出・高速)

YOLO (You Only Look Once) は1段階検出 (One-stage) でリアルタイム処理が可能なため、自動運転や監視カメラに適しています。Faster R-CNN は高精度だが速度が遅め。PCAは次元削減 (画像処理ではない)、Word2Vecは自然言語処理の手法。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。