最適化手法 - SGD・Momentum・AdaGrad・RMSprop・Adam

ディープラーニングの最適化手法の進化系譜を、SGDからAdamまで整理。学習率スケジューリングも解説。

最適化手法はニューラルネットの学習の肝。SGDから始まる進化系譜を押さえると、論文を読む力もつきます。

雷門 あかり(普段) 雷門 あかり

学習率の話があったけど、最適化手法って他に何があるの?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

最も基本がSGD(Stochastic Gradient Descent, 確率的勾配降下法)。
全データから1つランダムに選んで勾配を計算して更新を繰り返すの。
速いけど振動しやすいわ。

白銀 エマ(普段) 白銀 エマ

実務ではミニバッチSGD(例: 32, 64, 128サンプル) が主流。
計算効率と勾配の安定性のバランスが良いの。

紫藤 ゆら(笑顔) 紫藤 ゆら

1つずつより、まとめて使った方がいいんですねぇ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

SGDに慣性を加えたのがMomentum(モメンタム)。
過去の勾配を加重平均して慣性を作り、振動を抑えながら速く収束するわ。

白銀 エマ(普段) 白銀 エマ

次にAdaGrad(2011)。
各パラメータごとに過去の勾配の二乗和を蓄積し、よく更新されたパラメータの学習率を下げる適応的学習率手法ね。

雷門 あかり(びっくり) 雷門 あかり

パラメータごとに違うんだ!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

AdaGradの弱点は学習率が単調減少すること。
これを改善したのがRMSprop。
指数移動平均で過去を忘れていくの。
ヒントンが講義で紹介したわ。

白銀 エマ(普段) 白銀 エマ

そして現在の定番がAdam(Adaptive Moment Estimation, 2014)。
MomentumとRMSpropを組み合わせた手法で、多くのタスクで良好に動作するの。

紫藤 ゆら(笑顔) 紫藤 ゆら

Adamが人気なんですねぇ〜♪

六角 いずみ 先生(普段) 六角 いずみ 先生

Adamの派生でAdamWも有名。
weight decay (重み減衰) の扱いを改善した版で、Transformerの学習でよく使われるわ。

雷門 あかり(普段) 雷門 あかり

じゃあAdam一択でいいの?

白銀 エマ(普段) 白銀 エマ

必ずしもそうではなくて、近年は『SGD+Momentum + 適切な学習率スケジュール』が汎化性能で勝ることも知られてきたの。
タスク次第で選び分けるわ。

六角 いずみ 先生(普段) 六角 いずみ 先生

学習率スケジュールも重要。
学習率減衰(Learning Rate Decay)、ウォームアップ、コサインアニーリングなどが使われるわ。

雷門 あかり(笑い) 雷門 あかり

最適化って、ほんと奥が深いんだなぁ…

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『SGD・Momentum・AdaGrad・RMSprop・Adam』の系譜をしっかり押さえてね!

確認クイズ

Momentum と RMSprop を組み合わせ、現代のディープラーニングで最も広く使われる最適化手法はどれか。

  1. SGD
  2. Adam
  3. AdaGrad
  4. Newton法
こたえを見る

正解: 2. Adam

Adam (Adaptive Moment Estimation)は2014年に提案された、Momentum (1次モーメント) と RMSprop (2次モーメント) を組み合わせた最適化手法で、現在のディープラーニングの定番です。

紫藤ゆらが美術室で水彩画を楽しむ様子

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。