自己教師あり学習 - ラベル不要でAIが賢くなる仕組み

自己教師あり学習の仕組みと、BERT・GPT・SimCLR・CLIPなど代表例を整理。現代DLの基盤をG検定観点で押さえます。

『自己教師あり学習』は現代DLの中核。ラベル付きデータ不要でモデルが賢くなる魔法の仕組みです。

雷門 あかり(普段) 雷門 あかり

自己教師ありって、自分で自分に教えるってこと?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

自己教師あり学習(Self-Supervised Learning, SSL) は、データ自体から擬似的なラベルを作って学習する手法よ。
人手のラベル付けが不要なの。

白銀 エマ(普段) 白銀 エマ

例えばBERTのMasked Language Modelは、文中の単語をマスクして予測させる。
ラベルは『元の単語』で、データから自動生成できるの。

紫藤 ゆら(笑顔) 紫藤 ゆら

わぁ、ラベル付けの手間が省けるんですねぇ!

六角 いずみ 先生(普段) 六角 いずみ 先生

画像分野でもSimCLR、MoCo、BYOL、DINOなどのSSL手法が台頭。
Meta(Facebook) やGoogleが主導してきたわ。

白銀 エマ(普段) 白銀 エマ

画像SSLでは、同じ画像の2つのランダム変換を『似ている』、違う画像を『違う』と学ぶ対照学習(Contrastive Learning) が典型例ね。

雷門 あかり(笑い) 雷門 あかり

へぇ〜、同じ画像から2つ作って学ぶんだ!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

そう、これがアノテーションコストの問題を劇的に解決。
医療画像など、専門家のラベル付けが高価な分野で特に有効よ。

白銀 エマ(普段) 白銀 エマ

LLMの事前学習もSSLよ。
GPTのNext Token Predictionは、次のトークンを予測する自己教師ありタスク。
数十億〜数兆トークンの大規模学習を可能にしたの。

紫藤 ゆら(笑顔) 紫藤 ゆら

じゃあSSLあってこそのChatGPTってことですかぁ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

その通り。
SSLで事前学習したモデルを、少量のラベル付きデータでファインチューニングするPretrain-Finetuneパラダイムが現代DLの標準ね。

白銀 エマ(普段) 白銀 エマ

最近はマルチモーダルSSLも重要。
CLIP(OpenAI, 2021) は画像とテキストのペアで対照学習を行い、テキストで画像を検索できるようにしたわ。

雷門 あかり(笑い) 雷門 あかり

要はSSLが現代AIの土台ってこと?

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『自己教師あり学習』『対照学習』『SimCLR・MoCo』『Pretrain-Finetuneパラダイム』『CLIP』を押さえておいてね!

確認クイズ

自己教師あり学習の具体例として最も適切なものはどれか。

  1. BERTのMasked Language Model
  2. SVMのマージン最大化
  3. k-meansのクラスタリング
  4. ランダムフォレストのバギング
こたえを見る

正解: 1. BERTのMasked Language Model

BERTのMasked Language Model (MLM)は自己教師あり学習の代表例で、文中の単語をマスクして予測させる擬似ラベルタスクです。他の選択肢は教師あり学習や教師なし学習です。

紫藤ゆら、雷門あかりが水族館で大水槽を鑑賞を楽しむ様子

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。