強化学習の実世界応用はG検定で頻出。AlphaGo・AlphaFold・自動運転・ロボティクスを押さえましょう。
強化学習って、ゲーム以外にも使われてるの?
応用は広いわよ。
最も有名なのはAlphaGo(DeepMind, 2016) ね。
囲碁世界チャンピオンイ・セドルに4-1で勝利した歴史的AIよ。
AlphaGoはモンテカルロ木探索(MCTS) と深層学習を組み合わせ、人間の棋譜+自己対戦で学習。
2017年のAlphaGo Zeroは人間の棋譜なしで自己対戦のみから学び、AlphaGoを上回ったわ。
自分同士で対戦して強くなっちゃうんですかぁ?
AlphaZero(2017) は囲碁・将棋・チェスすべてで最強を達成。
特定ゲームに特化した事前知識なしで汎用的に学べる設計ね。
別の金字塔がAlphaFold(DeepMind 2021)。
タンパク質の3次元構造を予測するAIで、生物学・創薬に革命を起こしたわ。
AlphaFold 2はCASP14で圧勝、AlphaFold 3(2024) はRNAや低分子にも対応したの。
タンパク質の構造まで解けちゃうって、AIすごすぎじゃん!
この業績でハサビスとジャンパーが2024年のノーベル化学賞を受賞したのよ。
AIが科学の最高峰で認められた瞬間ね。
自動運転でも強化学習は不可欠。
Waymo、Tesla Autopilot、Cruiseなどの自動運転システムは、シミュレーション環境で膨大な強化学習を行っているわ。
AIが運転のしかたを学んでいくんですねぇ♪
ロボティクスでも模倣学習や強化学習が進展。
Boston DynamicsのAtlas、Tesla のOptimus、Figure AIのFigure 01などヒューマノイドロボットが現実化してきているわ。
ゲーム分野ではStarCraft IIのAlphaStar (DeepMind 2019)、Dota 2のOpenAI Five (2019) など、複雑なリアルタイム戦略ゲームでも人間を超えるAIが実現したわ。
じゃあ今のRLHFも、この流れの延長線上ってこと?
その通りよ。
ChatGPTの学習にもPPOという強化学習アルゴリズムが使われているの。
強化学習は生成AIの中心技術でもあるのよ。
G検定では『AlphaGo (2016)・AlphaGo Zero (2017)・AlphaZero・AlphaFold (2021, ノーベル化学賞 2024)』『自動運転・ロボティクス』をしっかり押さえておいてね!
確認クイズ
DeepMindが開発し、タンパク質の3次元構造予測で生物学に革命を起こし、2024年にノーベル化学賞を受賞する業績となったAIはどれか。
- AlphaGo
- AlphaFold
- AlphaStar
- AlphaZero
こたえを見る
正解: 2. AlphaFold
AlphaFoldはDeepMindが開発したタンパク質構造予測AIで、2021年のAlphaFold 2がCASP14で圧勝。この業績でハサビスとジャンパーが2024年ノーベル化学賞を受賞しました。AlphaGo・AlphaStar・AlphaZeroはいずれもゲームAIです。