事前学習→SFT→RLHF/DPO - ChatGPTの学習パイプライン

LLMの学習を3段階で解説。事前学習・SFT・RLHF、そしてその簡素化版であるDPOの違いをG検定観点で整理します。

『ChatGPT』の学習の裏側を知ると、現代LLMの仕組みが見えてきます。事前学習→SFT→RLHFのパイプラインを押さえましょう。

雷門 あかり(笑い) 雷門 あかり

ChatGPTってどうやって作られてるの?
気になる!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

3段階のパイプラインよ。
事前学習→SFT→RLHF/DPOね。
それぞれ目的が違うの。

白銀 エマ(普段) 白銀 エマ

まず事前学習(Pre-training)。
インターネット全体の数兆トークンのテキストでNext Token Predictionを学ぶ。
この段階では『次の単語予測マシン』であって、指示に従うとは限らないの。

紫藤 ゆら(びっくり) 紫藤 ゆら

えぇっ、ゆら、ここまでで完成だと思ってました〜!

六角 いずみ 先生(普段) 六角 いずみ 先生

事前学習後のモデルはベースモデルと呼ばれる。
賢いけど、『質問に答える』『指示を守る』といったチャット形式の応答はできないの。

白銀 エマ(普段) 白銀 エマ

次のSFT(Supervised Fine-Tuning, 教師あり微調整) で、人間が書いた模範応答のデータセットで学習。
これで『指示→応答』のフォーマットを覚えるわ。

雷門 あかり(笑い) 雷門 あかり

なるほど、お手本を見せて真似させるんだね!

六角 いずみ 先生(普段) 六角 いずみ 先生

最後にRLHF(Reinforcement Learning from Human Feedback, 人間のフィードバックからの強化学習)。
これが決定的なステップよ。

白銀 エマ(普段) 白銀 エマ

RLHFは3ステップ: 1) SFTで学習、2) 同じプロンプトへの複数応答を人間が順位付けして報酬モデルを学習、3) PPOなどの強化学習で、報酬モデルのスコアが高い応答を出すようにチューニング。

紫藤 ゆら(笑顔) 紫藤 ゆら

人間が点数をつけて学習させるんですねぇ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

RLHFがChatGPTの特徴的な『丁寧・有用・無害』な応答を生み出した鍵なの。
ただし計算コストが膨大で実装が難しい課題があるわ。

白銀 エマ(普段) 白銀 エマ

そこで2023年に登場したのがDPO(Direct Preference Optimization, 直接選好最適化)。
スタンフォード大等が提案した手法で、報酬モデルなしで直接選好ペアからファインチューニングできるの。

雷門 あかり(びっくり) 雷門 あかり

へぇ〜、DPOの方がラクってことか!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

DPOはRLHFと同等の性能で、実装が格段にシンプル。
MistralやLLaMA-3などが採用し始めているわ。

白銀 エマ(普段) 白銀 エマ

最近はConstitutional AI(Anthropic) のように、AIの自己批判でフィードバックを生成する手法も登場。
RLAIF(AIフィードバックからの強化学習) という派生もあるわ。

雷門 あかり(笑い) 雷門 あかり

学習のやり方もどんどん進化してるんだね!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『事前学習→SFT→RLHF』『報酬モデル』『DPO』『PPO』『Constitutional AI』をしっかり押さえておいてね!

確認クイズ

ChatGPTの特徴的な『有用で無害な応答』を実現する学習ステップとして最も代表的な手法はどれか。

  1. GAN
  2. RLHF (人間のフィードバックからの強化学習)
  3. k-means
  4. バッチ正規化
こたえを見る

正解: 2. RLHF (人間のフィードバックからの強化学習)

RLHF (Reinforcement Learning from Human Feedback)はChatGPTの特徴的な応答品質を実現する鍵となる技術です。人間の選好データから報酬モデルを学習し、PPOなどのRLアルゴリズムでチューニングします。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。