強化学習の基礎 - Q学習とマルコフ決定過程

強化学習の基盤であるマルコフ決定過程 (MDP)、Q学習の更新式、ε-greedy方策をG検定頻出の観点で整理します。

強化学習は試行錯誤から行動を学ぶAI。AlphaGoや自動運転の基盤です。マルコフ決定過程 (MDP) とQ学習を押さえましょう。

雷門 あかり(笑い) 雷門 あかり

強化学習って、ゲームAIでよく聞く言葉だよね?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

そう。
強化学習(Reinforcement Learning) は、エージェントが環境と相互作用し、報酬を最大化する行動を試行錯誤で学ぶ手法ね。

白銀 エマ(普段) 白銀 エマ

基盤となる数理モデルがマルコフ決定過程(MDP: Markov Decision Process)。
状態、行動、報酬、遷移確率の4要素で定義されるわ。

紫藤 ゆら(普段) 紫藤 ゆら

マルコフって、トランプゲームの名前みたいですぅ?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

違うわよ。
ロシアの数学者アンドレイ・マルコフから来ているの。
『マルコフ性』= 次の状態は現在の状態のみに依存し、過去には依存しない、という性質よ。

白銀 エマ(普段) 白銀 エマ

強化学習の目標は最適方策(Optimal Policy) π* を見つけること。
方策πは『状態sでどう行動するか』の関数ね。

雷門 あかり(普段) 雷門 あかり

じゃあ、Q学習って何?

六角 いずみ 先生(普段) 六角 いずみ 先生

Q学習(Q-Learning) は、各『状態×行動』ペアにQ値(行動価値) を与え、試行錯誤で更新していく手法。
ワトキンスが1989年に提案したわ。

白銀 エマ(普段) 白銀 エマ

更新式は Q(s,a) ← Q(s,a) + α[r + γmaxQ(s',a') - Q(s,a)]。
αが学習率、γが割引率。
未来の報酬を割り引いて現在の価値に反映するの。

紫藤 ゆら(しょんぼり) 紫藤 ゆら

うぅ〜ん…数式がいっぱいですぅ…

六角 いずみ 先生(普段) 六角 いずみ 先生

でも考え方はシンプル。
『現在の行動価値を、実際に得た報酬+将来の最大価値で修正する』だけよ。
将来を少し割り引くのは現実的判断ね。

白銀 エマ(普段) 白銀 エマ

探索と活用のバランスも重要。
ε-greedy方策は、確率εでランダム行動し、1-εで最適行動を取る定番手法よ。

雷門 あかり(笑い) 雷門 あかり

ずっと同じ行動だと、新しい発見がないもんね!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

Q学習はテーブル形式で各状態×行動を記録するから、状態空間が大きいと扱えない。
これを解決したのが次のDQN(Deep Q-Network) よ。

雷門 あかり(笑い) 雷門 あかり

深層学習と組み合わせて進化していくんだね!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『MDP=状態・行動・報酬・遷移確率』『Q学習・Q値』『ε-greedy』『割引率γ』を押さえて!

確認クイズ

強化学習の基盤となる数理モデルで、『状態・行動・報酬・遷移確率』の4要素で定義されるものはどれか。

  1. ベイジアンネットワーク
  2. マルコフ決定過程 (MDP)
  3. ニューラルネットワーク
  4. 決定木
こたえを見る

正解: 2. マルコフ決定過程 (MDP)

マルコフ決定過程 (MDP)が強化学習の基盤です。状態・行動・報酬・遷移確率で環境を記述し、マルコフ性 (次状態は現状態のみに依存) を仮定します。ベイジアンネットワークは確率的グラフィカルモデルです。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。