CNN主要モデル - LeNet・AlexNet・ResNet・ViTまで

CNN歴代モデルを時代順に整理。LeNet → AlexNet → VGG → GoogLeNet → ResNet → EfficientNet → ViT の進化を追いかけます。

CNNは歴代モデルの系譜を知ることで本質が掴めます。G検定では各モデルの登場年・特徴・性能ブレイクスルーが問われます。

雷門 あかり(笑い) 雷門 あかり

有名なCNNモデルを時代順に教えて!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

原点はLeNet(1998, ヤン・ルカン)。
5層の小さなCNNで、MNISTの手書き数字を高精度で認識したわ。

白銀 エマ(普段) 白銀 エマ

飛躍はAlexNet(2012, ヒントン等)。
ImageNetで2位を大きく引き離して優勝。
ReLU、ドロップアウト、GPU学習を初導入したの。
第三次AIブームの象徴ね。

紫藤 ゆら(笑顔) 紫藤 ゆら

AlexNetが今のディープラーニングの幕開けだったんですねぇ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

2014年のVGG(Oxford) は、3x3の小さいフィルタを深く重ねる設計。
層数16-19のシンプルな構造で、依然として特徴抽出器として使われているわ。

白銀 エマ(普段) 白銀 エマ

同年のGoogLeNet(Inception) は、異なるサイズのフィルタを並列に使うInceptionモジュールを導入。
パラメータを削減しつつ表現力を高めたの。
1x1畳み込みによる次元削減も特徴的ね。

雷門 あかり(笑い) 雷門 あかり

2014年って画像認識の当たり年だったんだね!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

2015年のResNet(He等) が革命的。
残差接続(スキップ接続) を導入して152層以上の超深層を学習可能にし、ILSVRC優勝。
残差学習の考え方は今でも広く使われているわ。

白銀 エマ(普段) 白銀 エマ

続くDenseNet(2017) は層間を全て接続する密な設計。
MobileNet(2017) はモバイル向けに軽量化した深さ方向分離畳み込みを提案したの。

紫藤 ゆら(びっくり) 紫藤 ゆら

わぁ、スマホでも動くAIってすごいですぅ!

六角 いずみ 先生(普段) 六角 いずみ 先生

2019年のEfficientNet(Google) は、深さ・幅・解像度のバランスを複合スケーリングで最適化した設計。
少パラメータで高精度を実現したわ。

白銀 エマ(普段) 白銀 エマ

そして2020年、画像認識にもTransformerが進出!
ViT(Vision Transformer, Google) は画像をパッチに分割してTransformerで処理。
CNNを上回る性能を示したの。

雷門 あかり(びっくり) 雷門 あかり

えー、Transformerって自然言語だけじゃなかったんだ!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

今やCNNとTransformerは融合が進んでいて、Swin TransformerやConvNeXtみたいに、お互いの良いところを取り入れた設計が主流なのよ。

白銀 エマ(普段) 白銀 エマ

G検定の出題ポイントは『LeNet→AlexNet→VGG→GoogLeNet→ResNet→EfficientNet→ViT』の流れと各モデルの特徴ね。

六角 いずみ 先生(普段) 六角 いずみ 先生

特に『AlexNet (2012) でブレイク』『ResNet (2015) の残差接続』『ViT (2020) でTransformer画像進出』は頻出よ!

確認クイズ

2015年に登場し、残差接続 (スキップ接続) を導入することで152層以上の超深層学習を可能にしたCNNモデルはどれか。

  1. VGG
  2. ResNet
  3. AlexNet
  4. EfficientNet
こたえを見る

正解: 2. ResNet

ResNet (Residual Network)は2015年にHe等が提案したCNNで、残差接続により勾配消失問題を解決し、152層以上のネットワーク学習を可能にしました。ILSVRC 2015優勝。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。