『セマンティックセグメンテーション』は画像をピクセル単位で分類する高度なタスク。医療画像・自動運転で重要視され、G検定でも頻出です。
セグメンテーションって何を分けるの?
セマンティックセグメンテーション(Semantic Segmentation) は、画像のすべてのピクセルに対してクラスラベルを割り当てるタスク。
物体検出より細かく、輪郭まで正確に推定するの。
物体検出 (バウンディングボックス) との違いは『形状の精度』。
例えば自動運転で『道路と歩道の境界線』を厳密に把握する必要があるなら、セマンティックセグメンテーションが必須ね。
ピクセル一つ一つにラベルを付けるんですかぁ!?
そう。
出力は入力画像と同じサイズで、各ピクセルが「道路・車・人・空」などのクラスに分類されるの。
代表的なアーキテクチャはFCN(Fully Convolutional Network, 2015) とU-Net(2015)。
両者ともエンコーダ・デコーダ構造を持つわ。
U-Net、医療で使われるって聞いたことある!
その通り。
U-Netは医療画像 (細胞・腫瘍のセグメンテーション) のために開発されたの。
U字型のネットワーク構造で、スキップ接続(Skip Connection) で詳細情報を保持する設計が特徴よ。
スキップ接続はエンコーダ側の特徴マップをデコーダ側へ直接伝える経路。
プーリングで失われがちな細かい位置情報を補い、輪郭の精度を高めるの。
インスタンスセグメンテーションとは何が違うんですかぁ?
いい質問!
セマンティックセグメンテーションは『同じクラスの物体を区別しない』(例: 人A・人B両方とも『人』)。
インスタンスセグメンテーションは『同じクラスでも個体を区別』する。
Mask R-CNNが代表的な手法ね。
さらにパノプティックセグメンテーション(Panoptic Segmentation) は両者の統合。
前景物体は個体識別、背景はセマンティックという混合方式よ。
ねぇ、これって実際どこで使われてるの?
①医療画像 (腫瘍検出・臓器分割)、②自動運転 (路面・歩道・車線の認識)、③衛星画像 (土地利用分類)、④ロボティクス (把持対象の輪郭認識) など、形状の精度が求められる分野では必須なのよ。
評価指標はIoU(Intersection over Union) やDice係数が標準。
両者ともピクセル単位の重なりの精度を表すわ。
よっしゃ!
U-NetとMask R-CNNの違い、しっかり覚えるよ!
G検定では『FCN・U-Netはセマンティック』『Mask R-CNNはインスタンス』『U-Netは医療画像で有名』『スキップ接続が特徴』を押さえてね。
確認クイズ
医療画像のセマンティックセグメンテーション (細胞・腫瘍の領域抽出) で最も多く採用されているアーキテクチャはどれか。
- VGG-16
- U-Net
- ResNet
- BERT
こたえを見る
正解: 2. U-Net
U-Net は2015年に医療画像のセグメンテーション用に開発されたアーキテクチャで、U字型・スキップ接続を持つ。VGG-16・ResNet は画像分類、BERT は自然言語処理。