『Transformer』は2017年の論文『Attention Is All You Need』で提案された、現代AIの土台。G検定の最重要トピックのひとつです。
Transformerってどういう意味なの?
Transformerは、2017年にGoogleのヴァスワニ等が発表した画期的なアーキテクチャ。
論文タイトル『Attention Is All You Need』が示すように、Self-Attention機構だけで系列処理を行うの。
RNN/LSTMの最大の弱点は並列化できないこと。
時系列順に1つずつ処理するので、GPUを活かしきれなかった。
Transformerは全位置を並列処理できる画期的設計ね。
並列化できると、何がいいんですかぁ?
学習速度が劇的に速くなる。
RNNで数週間かかっていた学習が数日で終わり、結果として大規模モデルの実現が可能になったの。
Transformerの中核がSelf-Attention(自己注意機構)。
文中の各単語が、同じ文中のすべての単語との関連を計算するの。
長距離依存を一発で捉えられるわ。
同じ文の中で注目し合うってことだね!
さらにMulti-Head Attention(複数ヘッド) で、異なる観点からの注目を並列に計算する。
意味的な関係、構文的な関係、などを同時に捉えられるのよ。
他の重要な要素は位置エンコーディング(Positional Encoding)。
Attentionだけでは順序情報が失われるので、位置を表すベクトルを入力に加えるの。
順序をちゃんと教えてあげるんですねぇ♪
TransformerもEncoder-Decoder構造で、各ブロックがMulti-Head Attention + Feed-Forward Network + Layer Normalization + 残差接続で構成されるわ。
Transformerは自然言語処理を完全に変えただけでなく、画像 (ViT)、音声、動画、タンパク質構造予測 (AlphaFold) まで応用領域を拡大しているの。
どこまで行くのTransformer!
生成AIの核心技術よ。
BERT、GPT、T5、BARTなどのLLMはすべてTransformerベースで作られているわ。
21世紀のAIを支える基盤技術なんだね!
G検定では『Transformer (2017, Attention Is All You Need)』『Self-Attention』『Multi-Head Attention』『位置エンコーディング』『並列化の利点』を必ず押さえて!
確認クイズ
Transformerアーキテクチャの中核となる機構はどれか。
- Convolution (畳み込み)
- Self-Attention (自己注意機構)
- Recurrence (再帰)
- Pooling (プーリング)
こたえを見る
正解: 2. Self-Attention (自己注意機構)
Self-Attention (自己注意機構)はTransformerの中核で、文中の各単語が同じ文中の全単語との関連を計算します。2017年の論文『Attention Is All You Need』が示した通り、Attentionのみで系列処理を実現しています。