DQN と 方策勾配法 - AlphaGoの背後にある技術

Q学習の深層学習版DQN、方策を直接最適化する方策勾配法、そしてAlphaGoとChatGPTのRLHFに繋がる系譜を整理します。

深層学習と強化学習の融合『DQN』と、もうひとつの柱『方策勾配法』。AlphaGoの背後にある技術をまとめて理解しましょう。

雷門 あかり(笑い) 雷門 あかり

DQNって名前、なんか強そう!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

DQN(Deep Q-Network) は、Q学習のQ値推定を深層ニューラルネットで行う手法よ。
2013年にDeepMind社が発表し、Atari 2600のゲームで人間を超える性能を示したの。

白銀 エマ(普段) 白銀 エマ

DQNの革新は、画像入力みたいに状態が膨大な問題でも強化学習ができるようになったこと。
従来のQ学習はテーブル管理だから限界があったのよね。

紫藤 ゆら(普段) 紫藤 ゆら

Atariって昔のゲーム機ですよねぇ?
そこで何をしたんですかぁ?

六角 いずみ 先生(普段) 六角 いずみ 先生

画面の画像を入力とし、ゲームをプレイして報酬 (スコア) を最大化する。
Breakout、Pong、スペースインベーダーなど49種のゲームで学習したのよ。

白銀 エマ(普段) 白銀 エマ

DQNの工夫は2つ: 経験リプレイ(Experience Replay) でデータを再利用、ターゲットネットワークで学習を安定化。
どちらもG検定頻出よ。

雷門 あかり(笑い) 雷門 あかり

その2つの工夫で強くなったんだね!

六角 いずみ 先生(普段) 六角 いずみ 先生

並行して進化したのが方策勾配法(Policy Gradient)。
Q値ではなく方策π (状態→行動) を直接ニューラルネットでモデル化して、勾配上昇で最適化するの。

白銀 エマ(普段) 白銀 エマ

代表はREINFORCEアルゴリズム (1992)。
報酬を重みにして方策を更新するシンプルな方法ね。
そこからActor-Critic、A3C、PPOと進化していくわ。

紫藤 ゆら(しょんぼり) 紫藤 ゆら

うぅ〜ん…いっぱいあって覚えきれなさそうですぅ…

六角 いずみ 先生(笑顔) 六角 いずみ 先生

一番重要なのはPPO(Proximal Policy Optimization)。
2017年にOpenAIが発表し、今もChatGPTのRLHFで使われているわ。

白銀 エマ(普段) 白銀 エマ

AlphaGo (2016) は強化学習とモンテカルロ木探索を組み合わせたAlphaGo Zero(2017) で、人間の棋譜なしに自己対戦のみで最強になったわ。
ディープマインドの金字塔ね。

雷門 あかり(びっくり) 雷門 あかり

自分で強くなっていくなんて、すごい話だね!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『DQN=Q学習+DNN』『経験リプレイ』『ターゲットネットワーク』『方策勾配法・PPO・A3C』『AlphaGo (Zero)』を押さえて!

確認クイズ

DQN (Deep Q-Network) が学習を安定化するために採用した工夫として最も適切なものはどれか。

  1. ドロップアウト
  2. 経験リプレイとターゲットネットワーク
  3. バッチ正規化
  4. カーネルトリック
こたえを見る

正解: 2. 経験リプレイとターゲットネットワーク

DQNは経験リプレイ (過去データの再利用) とターゲットネットワーク (目標の固定) で学習を安定化しました。ドロップアウトとバッチ正規化は一般的なNN技術、カーネルトリックはSVM用です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。