CNNは歴代モデルの系譜を知ることで本質が掴めます。G検定では各モデルの登場年・特徴・性能ブレイクスルーが問われます。
有名なCNNモデルを時代順に教えて!
原点はLeNet(1998, ヤン・ルカン)。
5層の小さなCNNで、MNISTの手書き数字を高精度で認識したわ。
飛躍はAlexNet(2012, ヒントン等)。
ImageNetで2位を大きく引き離して優勝。
ReLU、ドロップアウト、GPU学習を初導入したの。
第三次AIブームの象徴ね。
AlexNetが今のディープラーニングの幕開けだったんですねぇ♪
2014年のVGG(Oxford) は、3x3の小さいフィルタを深く重ねる設計。
層数16-19のシンプルな構造で、依然として特徴抽出器として使われているわ。
同年のGoogLeNet(Inception) は、異なるサイズのフィルタを並列に使うInceptionモジュールを導入。
パラメータを削減しつつ表現力を高めたの。
1x1畳み込みによる次元削減も特徴的ね。
2014年って画像認識の当たり年だったんだね!
2015年のResNet(He等) が革命的。
残差接続(スキップ接続) を導入して152層以上の超深層を学習可能にし、ILSVRC優勝。
残差学習の考え方は今でも広く使われているわ。
続くDenseNet(2017) は層間を全て接続する密な設計。
MobileNet(2017) はモバイル向けに軽量化した深さ方向分離畳み込みを提案したの。
わぁ、スマホでも動くAIってすごいですぅ!
2019年のEfficientNet(Google) は、深さ・幅・解像度のバランスを複合スケーリングで最適化した設計。
少パラメータで高精度を実現したわ。
そして2020年、画像認識にもTransformerが進出!
ViT(Vision Transformer, Google) は画像をパッチに分割してTransformerで処理。
CNNを上回る性能を示したの。
えー、Transformerって自然言語だけじゃなかったんだ!
今やCNNとTransformerは融合が進んでいて、Swin TransformerやConvNeXtみたいに、お互いの良いところを取り入れた設計が主流なのよ。
G検定の出題ポイントは『LeNet→AlexNet→VGG→GoogLeNet→ResNet→EfficientNet→ViT』の流れと各モデルの特徴ね。
特に『AlexNet (2012) でブレイク』『ResNet (2015) の残差接続』『ViT (2020) でTransformer画像進出』は頻出よ!
確認クイズ
2015年に登場し、残差接続 (スキップ接続) を導入することで152層以上の超深層学習を可能にしたCNNモデルはどれか。
- VGG
- ResNet
- AlexNet
- EfficientNet
こたえを見る
正解: 2. ResNet
ResNet (Residual Network)は2015年にHe等が提案したCNNで、残差接続により勾配消失問題を解決し、152層以上のネットワーク学習を可能にしました。ILSVRC 2015優勝。