強化学習の応用 - AlphaGo・AlphaFold・自動運転

強化学習の実世界応用を整理。AlphaGo・AlphaFold・自動運転・ロボティクス・ゲームAIまでG検定頻出事項を押さえます。

強化学習の実世界応用はG検定で頻出。AlphaGo・AlphaFold・自動運転・ロボティクスを押さえましょう。

雷門 あかり(笑い) 雷門 あかり

強化学習って、ゲーム以外にも使われてるの?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

応用は広いわよ。
最も有名なのはAlphaGo(DeepMind, 2016) ね。
囲碁世界チャンピオンイ・セドルに4-1で勝利した歴史的AIよ。

白銀 エマ(普段) 白銀 エマ

AlphaGoはモンテカルロ木探索(MCTS) と深層学習を組み合わせ、人間の棋譜+自己対戦で学習。
2017年のAlphaGo Zeroは人間の棋譜なしで自己対戦のみから学び、AlphaGoを上回ったわ。

紫藤 ゆら(びっくり) 紫藤 ゆら

自分同士で対戦して強くなっちゃうんですかぁ?

六角 いずみ 先生(普段) 六角 いずみ 先生

AlphaZero(2017) は囲碁・将棋・チェスすべてで最強を達成。
特定ゲームに特化した事前知識なしで汎用的に学べる設計ね。

白銀 エマ(普段) 白銀 エマ

別の金字塔がAlphaFold(DeepMind 2021)。
タンパク質の3次元構造を予測するAIで、生物学・創薬に革命を起こしたわ。
AlphaFold 2はCASP14で圧勝、AlphaFold 3(2024) はRNAや低分子にも対応したの。

雷門 あかり(びっくり) 雷門 あかり

タンパク質の構造まで解けちゃうって、AIすごすぎじゃん!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

この業績でハサビスとジャンパーが2024年のノーベル化学賞を受賞したのよ。
AIが科学の最高峰で認められた瞬間ね。

白銀 エマ(普段) 白銀 エマ

自動運転でも強化学習は不可欠。
Waymo、Tesla Autopilot、Cruiseなどの自動運転システムは、シミュレーション環境で膨大な強化学習を行っているわ。

紫藤 ゆら(笑顔) 紫藤 ゆら

AIが運転のしかたを学んでいくんですねぇ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

ロボティクスでも模倣学習や強化学習が進展。
Boston DynamicsのAtlas、Tesla のOptimus、Figure AIのFigure 01などヒューマノイドロボットが現実化してきているわ。

白銀 エマ(普段) 白銀 エマ

ゲーム分野ではStarCraft IIのAlphaStar (DeepMind 2019)、Dota 2のOpenAI Five (2019) など、複雑なリアルタイム戦略ゲームでも人間を超えるAIが実現したわ。

雷門 あかり(笑い) 雷門 あかり

じゃあ今のRLHFも、この流れの延長線上ってこと?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

その通りよ。
ChatGPTの学習にもPPOという強化学習アルゴリズムが使われているの。
強化学習は生成AIの中心技術でもあるのよ。

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『AlphaGo (2016)・AlphaGo Zero (2017)・AlphaZero・AlphaFold (2021, ノーベル化学賞 2024)』『自動運転・ロボティクス』をしっかり押さえておいてね!

確認クイズ

DeepMindが開発し、タンパク質の3次元構造予測で生物学に革命を起こし、2024年にノーベル化学賞を受賞する業績となったAIはどれか。

  1. AlphaGo
  2. AlphaFold
  3. AlphaStar
  4. AlphaZero
こたえを見る

正解: 2. AlphaFold

AlphaFoldはDeepMindが開発したタンパク質構造予測AIで、2021年のAlphaFold 2がCASP14で圧勝。この業績でハサビスとジャンパーが2024年ノーベル化学賞を受賞しました。AlphaGo・AlphaStar・AlphaZeroはいずれもゲームAIです。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。