BERT - 双方向Transformerによる言語理解

BERTの革新的な双方向事前学習と、MLM・NSPの仕組み、派生モデル、GPTとの違いまでG検定観点で整理します。

『BERT』は自然言語処理に革命を起こしたGoogleの事前学習モデル。G検定でも頻出のLLM祖先の一つです。

雷門 あかり(笑い) 雷門 あかり

BERTって名前、なんかかわいいね!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

BERT(Bidirectional Encoder Representations from Transformers) は、2018年にGoogleが発表した事前学習言語モデル。
『セサミストリート』のキャラ名からとったそうよ。

白銀 エマ(普段) 白銀 エマ

BERTの革新は双方向のコンテキスト学習。
従来のLMは左から右 (または右から左) の一方向だったけど、BERTは両方向の文脈を同時に使うの。

紫藤 ゆら(びっくり) 紫藤 ゆら

両方向から見るなんてすごいですぅ〜!

六角 いずみ 先生(普段) 六角 いずみ 先生

BERTの学習手法は2つ。
Masked Language Model(MLM) は文中の単語をランダムにマスクして予測させる。
Next Sentence Prediction(NSP) は2文が連続するかを判定させるの。

白銀 エマ(普段) 白銀 エマ

MLMは穴埋め問題をAIに解かせる形で、双方向の文脈を学習できる巧妙な手法。
自己教師あり学習なのでラベル付きデータが不要という利点もあるわ。

雷門 あかり(びっくり) 雷門 あかり

ラベルなしでこんなに賢くなれるんだ!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

BERTはTransformerのエンコーダ部分のみ使う設計で、GLUEやSQuADなど多くのNLPベンチマークで当時の最高性能を達成したわ。

白銀 エマ(普段) 白銀 エマ

BERTの公開後、RoBERTa(Meta)、ALBERT、DistilBERT(軽量化)、DeBERTaなど多くの派生モデルが登場。
日本語版の日本語BERTもあるのよ。

紫藤 ゆら(笑顔) 紫藤 ゆら

みんなBERTをベースに作ったんですねぇ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

BERTの使い方はファインチューニング。
事前学習済みのBERTを特定タスク (分類、質問応答、NERなど) にチューニングすることで、高精度モデルが少ないデータで得られるわ。

白銀 エマ(普段) 白銀 エマ

BERTと対照的なのがGPTシリーズ。
GPTはTransformerのデコーダのみ使い、左から右への自己回帰生成を行うの。
BERTは理解、GPTは生成に強い、と棲み分けがあるわ。

雷門 あかり(笑い) 雷門 あかり

BERTとGPTで得意なことが違うんだね!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『BERT (Google, 2018)』『MLM・NSP』『双方向Transformer』『エンコーダのみ使用』『ファインチューニング』を押さえて!

確認クイズ

BERTの事前学習で、文中の単語をランダムにマスクして予測させるタスクはどれか。

  1. Next Sentence Prediction (NSP)
  2. Masked Language Model (MLM)
  3. Causal Language Model (CLM)
  4. Token Classification
こたえを見る

正解: 2. Masked Language Model (MLM)

Masked Language Model (MLM)はBERTの主要な事前学習タスクで、文中の単語をランダムにマスクして予測させることで双方向の文脈を学習します。NSPはもう一つの事前学習タスク (2文の連続性判定)、CLMはGPTのタスクです。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。