『物体検出』は画像内の複数の物体を『どこに』『何が』あるかを同時に推定するタスクです。G検定では各手法の特徴と歴史的進化が問われます。
物体検出って自動運転でよく聞くやつだよね?
そう。
物体検出(Object Detection) は『画像内のどこに何があるか』をバウンディングボックス(矩形枠) で囲んで分類するタスク。
自動運転・防犯カメラ・医療画像で必須ね。
画像分類との違いは『複数の物体』と『位置情報も同時に推定する』という点ね。
1枚の画像から人・車・標識を同時に検出できる必要があるの。
代表的な手法にはどんなものがあるんですかぁ?
歴史的には大きく2系統。
①2段階検出(Two-stage: R-CNN系)、②1段階検出(One-stage: YOLOSSD) よ。
R-CNN系の進化: R-CNN(2014, Selective Searchで領域提案+CNN) → Fast R-CNN(2015, ROI Pooling で高速化) → Faster R-CNN(2015, Region Proposal Network 統合)。
精度は高いが速度は遅め。
YOLOってリアルタイムで動くやつで有名だよね?
そう。
YOLO(You Only Look Once, 2016〜) は画像を一度だけ見るという名の通り、画像をグリッドに分割し各セルで物体を予測する1段階手法。
リアルタイム性が最大の特徴で、自動運転や監視カメラで採用されているわ。
YOLOはバージョンが進化中 (v1〜v8〜)。
各世代でアーキテクチャや精度が改善されているの。
SSD(Single Shot MultiBox Detector, 2016) もYOLOと並ぶ1段階手法。
複数スケールでの検出に強い。
もっと新しい手法もあるんですかぁ?
ええ、DETR(Detection Transformer, 2020) はTransformerを物体検出に適用して、NMS(Non-Maximum Suppression) などの後処理を不要にした画期的な手法なのよ。
評価指標はmAP(mean Average Precision) が標準。
IoU(Intersection over Union) で予測ボックスと正解ボックスの重なり具合を測定し、閾値以上を正解扱いするわ。
G検定ではどこが出やすいの?
頻出ポイント: ①YOLOは1段階・高速、②R-CNN系は2段階・高精度、③mAP/IoU の意味、④バウンディングボックスの概念、⑤NMS で重複検出を除去。
YOLOとR-CNNの違いを覚えました!
応用先と特徴をセットで覚えるんだね!
応用先 (自動運転・医療・小売・農業) と性能要件 (リアルタイムなら1段階、高精度なら2段階) のマッピングも問われるわよ。
確認クイズ
リアルタイム性が要求される自動運転車の物体検出に最も適した手法はどれか。
- Faster R-CNN (2段階検出・高精度)
- YOLO (1段階検出・高速)
- PCA (主成分分析)
- Word2Vec (単語埋め込み)
こたえを見る
正解: 2. YOLO (1段階検出・高速)
YOLO (You Only Look Once) は1段階検出 (One-stage) でリアルタイム処理が可能なため、自動運転や監視カメラに適しています。Faster R-CNN は高精度だが速度が遅め。PCAは次元削減 (画像処理ではない)、Word2Vecは自然言語処理の手法。