『BERT』は自然言語処理に革命を起こしたGoogleの事前学習モデル。G検定でも頻出のLLM祖先の一つです。
BERTって名前、なんかかわいいね!
BERT(Bidirectional Encoder Representations from Transformers) は、2018年にGoogleが発表した事前学習言語モデル。
『セサミストリート』のキャラ名からとったそうよ。
BERTの革新は双方向のコンテキスト学習。
従来のLMは左から右 (または右から左) の一方向だったけど、BERTは両方向の文脈を同時に使うの。
両方向から見るなんてすごいですぅ〜!
BERTの学習手法は2つ。
Masked Language Model(MLM) は文中の単語をランダムにマスクして予測させる。
Next Sentence Prediction(NSP) は2文が連続するかを判定させるの。
MLMは穴埋め問題をAIに解かせる形で、双方向の文脈を学習できる巧妙な手法。
自己教師あり学習なのでラベル付きデータが不要という利点もあるわ。
ラベルなしでこんなに賢くなれるんだ!
BERTはTransformerのエンコーダ部分のみ使う設計で、GLUEやSQuADなど多くのNLPベンチマークで当時の最高性能を達成したわ。
BERTの公開後、RoBERTa(Meta)、ALBERT、DistilBERT(軽量化)、DeBERTaなど多くの派生モデルが登場。
日本語版の日本語BERTもあるのよ。
みんなBERTをベースに作ったんですねぇ♪
BERTの使い方はファインチューニング。
事前学習済みのBERTを特定タスク (分類、質問応答、NERなど) にチューニングすることで、高精度モデルが少ないデータで得られるわ。
BERTと対照的なのがGPTシリーズ。
GPTはTransformerのデコーダのみ使い、左から右への自己回帰生成を行うの。
BERTは理解、GPTは生成に強い、と棲み分けがあるわ。
BERTとGPTで得意なことが違うんだね!
G検定では『BERT (Google, 2018)』『MLM・NSP』『双方向Transformer』『エンコーダのみ使用』『ファインチューニング』を押さえて!
確認クイズ
BERTの事前学習で、文中の単語をランダムにマスクして予測させるタスクはどれか。
- Next Sentence Prediction (NSP)
- Masked Language Model (MLM)
- Causal Language Model (CLM)
- Token Classification
こたえを見る
正解: 2. Masked Language Model (MLM)
Masked Language Model (MLM)はBERTの主要な事前学習タスクで、文中の単語をランダムにマスクして予測させることで双方向の文脈を学習します。NSPはもう一つの事前学習タスク (2文の連続性判定)、CLMはGPTのタスクです。