『マルチモーダル』はテキストだけでなく画像・音声・動画も扱うAI。GPT-4oやClaude 3、Geminiの強みです。
マルチモーダルって、要は複数のモードを扱えるってこと?
マルチモーダル(Multimodal) は、テキスト・画像・音声・動画など複数のモダリティ(形式) を同時に扱うAIのことよ。
画期的な先駆けはCLIP(OpenAI, 2021)。
画像とテキストのペアで対照学習を行い、テキストで画像を検索できるZero-shot画像分類を実現したの。
画像とテキストが同じお部屋に住んでるイメージですぅ♪
2022年のFlamingo(DeepMind) や2023年のGPT-4V(Vision) で、画像を見て質問に答えるマルチモーダルLLMが登場したのよ。
2024年のGPT-4o(omni) はさらに進化して、テキスト・画像・音声をネイティブに統合処理できるようになったの。
音声応答のリアルタイム性も劇的に向上したわ。
GPT-4oのoって、omniのoなんだ!
Claude 3も画像理解が強力。
資料のスクリーンショットを渡して『要約して』『表をCSVに』などの指示に応えられる。
Geminiはテキスト・画像・動画に加えて音声やコードまで統合的に扱えるわ。
マルチモーダルの仕組みは、各モダリティを共通の埋め込み空間に変換するのが基本。
画像はViTやCLIP、音声はWhisper、テキストはLLMが担当するの。
いろんなAIさんが力を合わせてるんですねぇ♪
応用は広範。
OCR(文書画像→テキスト)、画像キャプション生成、ビジュアルQA、動画要約、音声通訳など。
マルチモーダルはエンボディメント(身体性) のあるロボティクスにも応用が広がっているわ。
RT-2(Google DeepMind 2023) はVLM (Vision-Language Model) をロボット制御に繋げた研究よ。
AIが目も耳も口も手も持つ時代なんだね!
G検定では『マルチモーダル』『CLIP (OpenAI 2021)』『GPT-4V、GPT-4o』『Gemini』『VLM』『埋め込み空間の統合』を押さえて!
確認クイズ
画像とテキストを対照学習することで、テキストで画像を検索できるようにしたOpenAIのマルチモーダルモデルはどれか。
- DALL-E
- CLIP
- GPT-3
- Whisper
こたえを見る
正解: 2. CLIP
CLIP (Contrastive Language-Image Pre-training)は2021年にOpenAIが発表。画像とテキストのペアで対照学習し、Zero-shot画像分類やテキストベース画像検索を可能にしました。DALL-Eは画像生成、Whisperは音声認識。