正則化 - L1/L2・ドロップアウト・早期終了

ディープラーニングの正則化手法を、L1/L2からドロップアウト、早期終了まで整理。過学習を防ぐ実用テクニックを押さえます。

過学習を防ぐ『正則化』はDLの必須技術。L1/L2正則化とドロップアウトの違いを押さえましょう。

雷門 あかり(普段) 雷門 あかり

過学習って、訓練データを覚えすぎちゃう現象のことだよね?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

そう。
過学習(Overfitting) を防ぐ技術が正則化(Regularization)。
いくつか手法があるわ。

白銀 エマ(普段) 白銀 エマ

まずL1正則化(Lasso) とL2正則化(Ridge)。
損失関数にパラメータのノルムを加えて、過度に大きな重みを罰するの。

紫藤 ゆら(普段) 紫藤 ゆら

L1とL2って、どう違うんですかぁ?

六角 いずみ 先生(普段) 六角 いずみ 先生

L1はパラメータの絶対値の和、L2は二乗和。
L1は多くのパラメータをゼロに押しつぶすスパース性を生み出し、L2は全体的に小さく保つ効果があるわ。

白銀 エマ(普段) 白銀 エマ

L1は特徴量選択の効果があるので、不要な特徴量を自動で除外したい時に便利。
L2はweight decay(重み減衰) と呼ばれ、DLで広く使われるの。

雷門 あかり(笑い) 雷門 あかり

へぇ〜、役割が全然違うんだね!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

DL専用の強力な手法がドロップアウト(Dropout)。
学習時にニューロンをランダムに無効化する技術で、2014年にヒントンらが提案したわ。

白銀 エマ(普段) 白銀 エマ

確率p (例えば0.5) でニューロンを『ドロップ』することで、ネットワークが一部のニューロンに依存しすぎるのを防ぐ。
アンサンブル学習の効果に似ているわ。

紫藤 ゆら(笑顔) 紫藤 ゆら

ランダムにお休みさせちゃうんですかぁ?
おもしろ〜い♪

六角 いずみ 先生(普段) 六角 いずみ 先生

重要なのは推論時にはドロップアウトを使わないこと。
代わりに全ニューロンの出力をスケーリングするのよ。

白銀 エマ(普段) 白銀 エマ

他の正則化には早期終了(Early Stopping)、データ拡張、バッチ正規化などがあるわ。

雷門 あかり(普段) 雷門 あかり

早期終了って、途中で学習を打ち切っちゃうってこと?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

そう。
検証データの損失が下がり続けている間は学習を続け、上昇に転じたら停止する。
過学習の兆候が見えたら止める賢い方法ね。

雷門 あかり(笑い) 雷門 あかり

過学習と戦う武器、こんなにあるんだ!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『L1・L2正則化』『ドロップアウト(ヒントン, 2014)』『早期終了』はしっかり押さえておいてね!

確認クイズ

深層学習で学習時にニューロンをランダムに無効化することで過学習を防ぐ手法はどれか。

  1. ドロップアウト
  2. L1正則化
  3. バッチ正規化
  4. モメンタム
こたえを見る

正解: 1. ドロップアウト

ドロップアウト (Dropout)は、学習時にニューロンを確率的にランダム無効化する正則化手法です。2014年にヒントンらが提案し、DLの定番技術となりました。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。