LLMが『大きくすれば賢くなる』ことを示した『スケーリング則』と『創発的能力』は、G検定頻出の重要概念です。
LLMって、大きくすれば本当に賢くなるの?
スケーリング則(Scaling Laws) は、モデルサイズ・データ量・計算量と性能がべき乗則に従って関係することを示した経験則よ。
2020年にOpenAIのケプラン等が発見したわ。
具体的には『パラメータ数N・データ量D・計算量Cを増やすと、損失 (Loss) が予測可能に下がる』ことが確認されたの。
これで『より大きくすればより賢くなる』ことが数式化されたのよ。
わぁ、ちゃんと数式になってるんですねぇ!
この発見を受けてGPT-3のような超大規模モデル開発が加速。
パラメータを一桁増やせば性能が読めるなら、投資判断がしやすいわね。
2022年にはDeepMindがChinchillaで計算最適な関係を再発見。
『モデルサイズとデータ量はバランス良く増やすべき』と示したの。
それまでは『データ量が不足していた』のね。
なるほど、データもちゃんと増やさなきゃダメなんだ!
もう一つ重要な現象が創発的能力(Emergent Abilities)。
ある閾値を超えるとモデルが突然新しい能力を獲得する現象よ。
例えば多段階推論、算術、コード生成は、小さなモデルではできないのに、100B+パラメータあたりで突然できるようになる。
Google Researchが2022年に体系化したわ。
うわぁ、なんだか魔法みたいですぅ…!
ただし創発能力の存在自体にも議論があって、2023年にスタンフォード大学が『評価指標の非連続性による錯覚』という反論論文を出したわ。
科学はまだ進化中。
へぇ〜、まだ決着ついてないんだね!
それでもスケーリング則は現代のLLM開発の指針。
GPT-4以降も、さらなる大規模化が続いているわ。
G検定では『スケーリング則 (ケプラン 2020)』『Chinchilla (DeepMind 2022) の計算最適バランス』『創発的能力』を押さえて!
確認クイズ
LLMのパラメータ数・データ量・計算量と性能の関係を『べき乗則』で示した経験則はどれか。
- ムーアの法則
- スケーリング則
- ハイプサイクル
- バイアス-バリアンス則
こたえを見る
正解: 2. スケーリング則
スケーリング則 (Scaling Laws)は2020年にOpenAIのケプラン等が発見した、モデルサイズ・データ量・計算量と性能のべき乗関係を示す経験則です。LLM開発の指針となりました。ムーアの法則は半導体の集積度です。