マルチモーダルモデル - GPT-4o・Claude・Gemini

テキスト・画像・音声・動画を統合するマルチモーダルAIを解説。CLIPからGPT-4o、Claude 3、Geminiまでの進化を整理。

『マルチモーダル』はテキストだけでなく画像・音声・動画も扱うAI。GPT-4oやClaude 3、Geminiの強みです。

雷門 あかり(普段) 雷門 あかり

マルチモーダルって、要は複数のモードを扱えるってこと?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

マルチモーダル(Multimodal) は、テキスト・画像・音声・動画など複数のモダリティ(形式) を同時に扱うAIのことよ。

白銀 エマ(普段) 白銀 エマ

画期的な先駆けはCLIP(OpenAI, 2021)。
画像とテキストのペアで対照学習を行い、テキストで画像を検索できるZero-shot画像分類を実現したの。

紫藤 ゆら(笑顔) 紫藤 ゆら

画像とテキストが同じお部屋に住んでるイメージですぅ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

2022年のFlamingo(DeepMind) や2023年のGPT-4V(Vision) で、画像を見て質問に答えるマルチモーダルLLMが登場したのよ。

白銀 エマ(普段) 白銀 エマ

2024年のGPT-4o(omni) はさらに進化して、テキスト・画像・音声をネイティブに統合処理できるようになったの。
音声応答のリアルタイム性も劇的に向上したわ。

雷門 あかり(笑い) 雷門 あかり

GPT-4oのoって、omniのoなんだ!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

Claude 3も画像理解が強力。
資料のスクリーンショットを渡して『要約して』『表をCSVに』などの指示に応えられる。
Geminiはテキスト・画像・動画に加えて音声やコードまで統合的に扱えるわ。

白銀 エマ(普段) 白銀 エマ

マルチモーダルの仕組みは、各モダリティを共通の埋め込み空間に変換するのが基本。
画像はViTやCLIP、音声はWhisper、テキストはLLMが担当するの。

紫藤 ゆら(笑顔) 紫藤 ゆら

いろんなAIさんが力を合わせてるんですねぇ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

応用は広範。
OCR(文書画像→テキスト)、画像キャプション生成、ビジュアルQA、動画要約、音声通訳など。

白銀 エマ(普段) 白銀 エマ

マルチモーダルはエンボディメント(身体性) のあるロボティクスにも応用が広がっているわ。
RT-2(Google DeepMind 2023) はVLM (Vision-Language Model) をロボット制御に繋げた研究よ。

雷門 あかり(笑い) 雷門 あかり

AIが目も耳も口も手も持つ時代なんだね!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『マルチモーダル』『CLIP (OpenAI 2021)』『GPT-4V、GPT-4o』『Gemini』『VLM』『埋め込み空間の統合』を押さえて!

確認クイズ

画像とテキストを対照学習することで、テキストで画像を検索できるようにしたOpenAIのマルチモーダルモデルはどれか。

  1. DALL-E
  2. CLIP
  3. GPT-3
  4. Whisper
こたえを見る

正解: 2. CLIP

CLIP (Contrastive Language-Image Pre-training)は2021年にOpenAIが発表。画像とテキストのペアで対照学習し、Zero-shot画像分類やテキストベース画像検索を可能にしました。DALL-Eは画像生成、Whisperは音声認識。

六角いずみ先生、白銀エマ、紫藤ゆら、雷門あかりが文化祭のカフェ準備を楽しむ様子

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。