強化学習は試行錯誤から行動を学ぶAI。AlphaGoや自動運転の基盤です。マルコフ決定過程 (MDP) とQ学習を押さえましょう。
強化学習って、ゲームAIでよく聞く言葉だよね?
そう。
強化学習(Reinforcement Learning) は、エージェントが環境と相互作用し、報酬を最大化する行動を試行錯誤で学ぶ手法ね。
基盤となる数理モデルがマルコフ決定過程(MDP: Markov Decision Process)。
状態、行動、報酬、遷移確率の4要素で定義されるわ。
マルコフって、トランプゲームの名前みたいですぅ?
違うわよ。
ロシアの数学者アンドレイ・マルコフから来ているの。
『マルコフ性』= 次の状態は現在の状態のみに依存し、過去には依存しない、という性質よ。
強化学習の目標は最適方策(Optimal Policy) π* を見つけること。
方策πは『状態sでどう行動するか』の関数ね。
じゃあ、Q学習って何?
Q学習(Q-Learning) は、各『状態×行動』ペアにQ値(行動価値) を与え、試行錯誤で更新していく手法。
ワトキンスが1989年に提案したわ。
更新式は Q(s,a) ← Q(s,a) + α[r + γmaxQ(s',a') - Q(s,a)]。
αが学習率、γが割引率。
未来の報酬を割り引いて現在の価値に反映するの。
うぅ〜ん…数式がいっぱいですぅ…
でも考え方はシンプル。
『現在の行動価値を、実際に得た報酬+将来の最大価値で修正する』だけよ。
将来を少し割り引くのは現実的判断ね。
探索と活用のバランスも重要。
ε-greedy方策は、確率εでランダム行動し、1-εで最適行動を取る定番手法よ。
ずっと同じ行動だと、新しい発見がないもんね!
Q学習はテーブル形式で各状態×行動を記録するから、状態空間が大きいと扱えない。
これを解決したのが次のDQN(Deep Q-Network) よ。
深層学習と組み合わせて進化していくんだね!
G検定では『MDP=状態・行動・報酬・遷移確率』『Q学習・Q値』『ε-greedy』『割引率γ』を押さえて!
確認クイズ
強化学習の基盤となる数理モデルで、『状態・行動・報酬・遷移確率』の4要素で定義されるものはどれか。
- ベイジアンネットワーク
- マルコフ決定過程 (MDP)
- ニューラルネットワーク
- 決定木
こたえを見る
正解: 2. マルコフ決定過程 (MDP)
マルコフ決定過程 (MDP)が強化学習の基盤です。状態・行動・報酬・遷移確率で環境を記述し、マルコフ性 (次状態は現状態のみに依存) を仮定します。ベイジアンネットワークは確率的グラフィカルモデルです。