バッチ正規化 - 深層学習を劇的に楽にした技術

バッチ正規化の仕組みと効果を解説。Layer Normalizationなどの派生手法、推論時の注意点まで、G検定頻出観点を整理します。

『バッチ正規化』は2015年に登場してから、深層学習の標準技術となりました。仕組みと効果を押さえましょう。

雷門 あかり(普段) 雷門 あかり

バッチ正規化って、何を正規化するの?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

バッチ正規化(Batch Normalization, BatchNorm) は、各層の入力をミニバッチごとに平均0・分散1に正規化する技術よ。
2015年にセルゲイ・イオッフェらが提案したわ。

白銀 エマ(普段) 白銀 エマ

これにより、層ごとの入力分布のズレ (これを内部共変量シフトと呼ぶ) が緩和され、学習が安定化するの。

紫藤 ゆら(普段) 紫藤 ゆら

分布を揃えると、なんでいいんですかぁ?

六角 いずみ 先生(普段) 六角 いずみ 先生

各層が『安定した入力分布』の中で学習できるから、学習率を大きく設定でき、収束も速くなるの。
副次的に正則化効果もあるわ。

白銀 エマ(普段) 白銀 エマ

BatchNorm導入後、ドロップアウトや細かいハイパーパラメータ調整の必要性が減り、DLの学習が圧倒的に楽になったのよ。

雷門 あかり(笑い) 雷門 あかり

すごい発明だね!

六角 いずみ 先生(普段) 六角 いずみ 先生

ただ弱点もあって、バッチサイズが小さいと統計値が不安定になっちゃうの。
そこで派生手法が登場したのよ。

白銀 エマ(普段) 白銀 エマ

Layer Normalization (LayerNorm) はバッチ方向ではなく各サンプル内のチャネル方向で正規化。
TransformerやRNNで使われるわ。

紫藤 ゆら(笑顔) 紫藤 ゆら

系列の長さが変わるモデルに向いてるんですねぇ!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

他にもGroup Normalization、Instance Normalizationなど、用途に応じた正規化手法が開発されているの。

白銀 エマ(普段) 白銀 エマ

推論時はミニバッチ統計ではなく、学習中に蓄積した移動平均を使うのも重要なポイントよ。

雷門 あかり(笑い) 雷門 あかり

正規化って、今の深層学習に欠かせないんだね!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『バッチ正規化 (2015)』『内部共変量シフト』『Layer Normalization』『推論時は移動平均を使う』、この4つを押さえてね!

確認クイズ

Transformerモデルで主に使われる正規化手法はどれか。

  1. バッチ正規化 (BatchNorm)
  2. Layer Normalization (LayerNorm)
  3. Instance Normalization
  4. Local Response Normalization
こたえを見る

正解: 2. Layer Normalization (LayerNorm)

Layer NormalizationはTransformerで主に使われる正規化手法で、バッチ方向ではなく各サンプル内のチャネル方向で正規化します。可変長の系列やバッチサイズが小さい場合に有効です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。