『自己教師あり学習』は現代DLの中核。ラベル付きデータ不要でモデルが賢くなる魔法の仕組みです。
自己教師ありって、自分で自分に教えるってこと?
自己教師あり学習(Self-Supervised Learning, SSL) は、データ自体から擬似的なラベルを作って学習する手法よ。
人手のラベル付けが不要なの。
例えばBERTのMasked Language Modelは、文中の単語をマスクして予測させる。
ラベルは『元の単語』で、データから自動生成できるの。
わぁ、ラベル付けの手間が省けるんですねぇ!
画像分野でもSimCLR、MoCo、BYOL、DINOなどのSSL手法が台頭。
Meta(Facebook) やGoogleが主導してきたわ。
画像SSLでは、同じ画像の2つのランダム変換を『似ている』、違う画像を『違う』と学ぶ対照学習(Contrastive Learning) が典型例ね。
へぇ〜、同じ画像から2つ作って学ぶんだ!
そう、これがアノテーションコストの問題を劇的に解決。
医療画像など、専門家のラベル付けが高価な分野で特に有効よ。
LLMの事前学習もSSLよ。
GPTのNext Token Predictionは、次のトークンを予測する自己教師ありタスク。
数十億〜数兆トークンの大規模学習を可能にしたの。
じゃあSSLあってこそのChatGPTってことですかぁ♪
その通り。
SSLで事前学習したモデルを、少量のラベル付きデータでファインチューニングするPretrain-Finetuneパラダイムが現代DLの標準ね。
最近はマルチモーダルSSLも重要。
CLIP(OpenAI, 2021) は画像とテキストのペアで対照学習を行い、テキストで画像を検索できるようにしたわ。
要はSSLが現代AIの土台ってこと?
G検定では『自己教師あり学習』『対照学習』『SimCLR・MoCo』『Pretrain-Finetuneパラダイム』『CLIP』を押さえておいてね!
確認クイズ
自己教師あり学習の具体例として最も適切なものはどれか。
- BERTのMasked Language Model
- SVMのマージン最大化
- k-meansのクラスタリング
- ランダムフォレストのバギング
こたえを見る
正解: 1. BERTのMasked Language Model
BERTのMasked Language Model (MLM)は自己教師あり学習の代表例で、文中の単語をマスクして予測させる擬似ラベルタスクです。他の選択肢は教師あり学習や教師なし学習です。