スケーリング則と創発的能力

LLMの『大きくすれば賢くなる』を数式化したスケーリング則と、閾値を超えて現れる創発的能力をG検定観点で整理します。

LLMが『大きくすれば賢くなる』ことを示した『スケーリング則』と『創発的能力』は、G検定頻出の重要概念です。

雷門 あかり(普段) 雷門 あかり

LLMって、大きくすれば本当に賢くなるの?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

スケーリング則(Scaling Laws) は、モデルサイズ・データ量・計算量と性能がべき乗則に従って関係することを示した経験則よ。
2020年にOpenAIのケプラン等が発見したわ。

白銀 エマ(普段) 白銀 エマ

具体的には『パラメータ数N・データ量D・計算量Cを増やすと、損失 (Loss) が予測可能に下がる』ことが確認されたの。
これで『より大きくすればより賢くなる』ことが数式化されたのよ。

紫藤 ゆら(びっくり) 紫藤 ゆら

わぁ、ちゃんと数式になってるんですねぇ!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

この発見を受けてGPT-3のような超大規模モデル開発が加速。
パラメータを一桁増やせば性能が読めるなら、投資判断がしやすいわね。

白銀 エマ(普段) 白銀 エマ

2022年にはDeepMindがChinchillaで計算最適な関係を再発見。
『モデルサイズとデータ量はバランス良く増やすべき』と示したの。
それまでは『データ量が不足していた』のね。

雷門 あかり(笑い) 雷門 あかり

なるほど、データもちゃんと増やさなきゃダメなんだ!

六角 いずみ 先生(普段) 六角 いずみ 先生

もう一つ重要な現象が創発的能力(Emergent Abilities)。
ある閾値を超えるとモデルが突然新しい能力を獲得する現象よ。

白銀 エマ(普段) 白銀 エマ

例えば多段階推論、算術、コード生成は、小さなモデルではできないのに、100B+パラメータあたりで突然できるようになる。
Google Researchが2022年に体系化したわ。

紫藤 ゆら(笑顔) 紫藤 ゆら

うわぁ、なんだか魔法みたいですぅ…!

六角 いずみ 先生(普段) 六角 いずみ 先生

ただし創発能力の存在自体にも議論があって、2023年にスタンフォード大学が『評価指標の非連続性による錯覚』という反論論文を出したわ。
科学はまだ進化中。

雷門 あかり(普段) 雷門 あかり

へぇ〜、まだ決着ついてないんだね!

白銀 エマ(普段) 白銀 エマ

それでもスケーリング則は現代のLLM開発の指針。
GPT-4以降も、さらなる大規模化が続いているわ。

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『スケーリング則 (ケプラン 2020)』『Chinchilla (DeepMind 2022) の計算最適バランス』『創発的能力』を押さえて!

確認クイズ

LLMのパラメータ数・データ量・計算量と性能の関係を『べき乗則』で示した経験則はどれか。

  1. ムーアの法則
  2. スケーリング則
  3. ハイプサイクル
  4. バイアス-バリアンス則
こたえを見る

正解: 2. スケーリング則

スケーリング則 (Scaling Laws)は2020年にOpenAIのケプラン等が発見した、モデルサイズ・データ量・計算量と性能のべき乗関係を示す経験則です。LLM開発の指針となりました。ムーアの法則は半導体の集積度です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。