Transformer - 現代AIの土台となったアーキテクチャ

2017年のTransformer革命を徹底解説。Self-Attention・Multi-Head Attention・位置エンコーディング・並列化の利点からLLMへの影響まで。

『Transformer』は2017年の論文『Attention Is All You Need』で提案された、現代AIの土台。G検定の最重要トピックのひとつです。

雷門 あかり(普段) 雷門 あかり

Transformerってどういう意味なの?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

Transformerは、2017年にGoogleのヴァスワニ等が発表した画期的なアーキテクチャ。
論文タイトル『Attention Is All You Need』が示すように、Self-Attention機構だけで系列処理を行うの。

白銀 エマ(普段) 白銀 エマ

RNN/LSTMの最大の弱点は並列化できないこと。
時系列順に1つずつ処理するので、GPUを活かしきれなかった。
Transformerは全位置を並列処理できる画期的設計ね。

紫藤 ゆら(普段) 紫藤 ゆら

並列化できると、何がいいんですかぁ?

六角 いずみ 先生(普段) 六角 いずみ 先生

学習速度が劇的に速くなる。
RNNで数週間かかっていた学習が数日で終わり、結果として大規模モデルの実現が可能になったの。

白銀 エマ(普段) 白銀 エマ

Transformerの中核がSelf-Attention(自己注意機構)。
文中の各単語が、同じ文中のすべての単語との関連を計算するの。
長距離依存を一発で捉えられるわ。

雷門 あかり(笑い) 雷門 あかり

同じ文の中で注目し合うってことだね!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

さらにMulti-Head Attention(複数ヘッド) で、異なる観点からの注目を並列に計算する。
意味的な関係、構文的な関係、などを同時に捉えられるのよ。

白銀 エマ(普段) 白銀 エマ

他の重要な要素は位置エンコーディング(Positional Encoding)。
Attentionだけでは順序情報が失われるので、位置を表すベクトルを入力に加えるの。

紫藤 ゆら(笑顔) 紫藤 ゆら

順序をちゃんと教えてあげるんですねぇ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

TransformerもEncoder-Decoder構造で、各ブロックがMulti-Head Attention + Feed-Forward Network + Layer Normalization + 残差接続で構成されるわ。

白銀 エマ(普段) 白銀 エマ

Transformerは自然言語処理を完全に変えただけでなく、画像 (ViT)、音声、動画、タンパク質構造予測 (AlphaFold) まで応用領域を拡大しているの。

雷門 あかり(びっくり) 雷門 あかり

どこまで行くのTransformer!

六角 いずみ 先生(普段) 六角 いずみ 先生

生成AIの核心技術よ。
BERT、GPT、T5、BARTなどのLLMはすべてTransformerベースで作られているわ。

雷門 あかり(笑い) 雷門 あかり

21世紀のAIを支える基盤技術なんだね!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『Transformer (2017, Attention Is All You Need)』『Self-Attention』『Multi-Head Attention』『位置エンコーディング』『並列化の利点』を必ず押さえて!

確認クイズ

Transformerアーキテクチャの中核となる機構はどれか。

  1. Convolution (畳み込み)
  2. Self-Attention (自己注意機構)
  3. Recurrence (再帰)
  4. Pooling (プーリング)
こたえを見る

正解: 2. Self-Attention (自己注意機構)

Self-Attention (自己注意機構)はTransformerの中核で、文中の各単語が同じ文中の全単語との関連を計算します。2017年の論文『Attention Is All You Need』が示した通り、Attentionのみで系列処理を実現しています。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。