コンピュータビジョンの古典的タスク『物体検出・セグメンテーション・姿勢推定』を整理。G検定では代表モデル名が問われます。
画像認識って、分類するだけじゃないの?
もっと細かく分けられるわ。
画像分類、物体検出、セマンティックセグメンテーション、インスタンスセグメンテーション、姿勢推定などね。
物体検出(Object Detection) は、画像内のどこに何があるかをバウンディングボックスで示すタスク。
代表モデルはR-CNN系列 (R-CNN→Fast R-CNN→Faster R-CNN→Mask R-CNN) とYOLOシリーズよ。
YOLOって名前、聞いたことあります!
YOLO(You Only Look Once) は2015年にレッドモン等が提案した1段階検出器。
速度重視でリアルタイム推論が可能。
現在はYOLOv8やYOLOv9まで進化しているわ。
2020年のDETR(DEtection TRansformer, Facebook) はTransformerベースの物体検出で、従来の手法を一新したの。
検出までTransformer化してるんだ!
セマンティックセグメンテーションは画素単位でクラスを分類。
代表モデルはFCN(2015)、U-Net(2015)、DeepLab(Google)、Segment Anything Model(SAM, Meta 2023) など。
U-Netは医療画像のセグメンテーションで有名。
エンコーダ・デコーダ構造にスキップ接続を加えた設計よ。
Ronnebergerが2015年に提案したわ。
医療の現場でも使われてるんですねぇ♪
インスタンスセグメンテーションは、同じクラスでも個別のオブジェクトを区別する。
Mask R-CNN(Facebook 2017) が代表例ね。
最新のSAM(Segment Anything Model, Meta 2023) は驚異的。
クリックだけで任意のオブジェクトを瞬時に切り抜けるわ。
11Mの画像と1Bのマスクで学習した巨大モデルよ。
SAM、プロの画像編集をみんなのものにしちゃいそうだね!
姿勢推定は人体のキーポイント (関節) を検出するタスク。
OpenPoseやMediaPipe(Google) が有名。
スポーツ解析やリハビリに活用されているわ。
超解像(Super Resolution) は低解像度画像を高解像度化する技術。
SRGAN、Real-ESRGAN、Waifu2x(アニメ画像向け) などが有名。
画像系AIの応用って、めっちゃ広いんだね!
G検定では『画像分類/物体検出/セグメンテーション/姿勢推定の違い』『YOLO・R-CNN・Mask R-CNN・U-Net・SAM』『超解像』をしっかり押さえてね!
確認クイズ
Metaが2023年に発表した、クリックで任意のオブジェクトを切り抜けるセグメンテーションモデルはどれか。
- U-Net
- Mask R-CNN
- SAM (Segment Anything Model)
- DeepLab
こたえを見る
正解: 3. SAM (Segment Anything Model)
SAM (Segment Anything Model)は2023年にMetaが発表したセグメンテーション基盤モデルで、11M画像と1Bマスクで学習。クリック1つで任意オブジェクトを切り抜けます。U-Net、Mask R-CNN、DeepLabも代表的なセグメンテーションモデルですが、SAMほど汎用的ではありません。