動画生成と音声AIも急速に進化。Sora・Whisper・WaveNetはG検定で必ず名前を覚えておきたい代表モデルです。
動画も生成できるの!?
2024年2月にOpenAIが発表したSoraは、テキストから最大1分の高品質動画を生成できる画期的モデルよ。
業界に衝撃を与えたわ。
SoraはDiffusion Transformer(DiT) を基盤とし、時空間パッチで動画を扱うの。
2024年末に一般公開され、映像制作の革命を予感させるわ。
えぇっ、映画も作れちゃうんですかぁ?
他のライバルも強力。
RunwayのGen-3 Alpha、Pika Labs、Luma AIのDream Machine、GoogleのVeoなど、短尺動画生成は商用化が進んでいるわ。
音声認識の代表はWhisper(OpenAI, 2022)。
多言語対応で日本語精度も高く、オープンソースとして公開されたの。
配信・議事録作成などに広く使われているわ。
Whisperって、要は文字起こしAIってこと?
そう、音声→テキストのSTT(Speech-to-Text) 。
逆のTTS(Text-to-Speech, 音声合成) の代表がWaveNet(DeepMind 2016) よ。
人間のような自然な音声を生成して驚かせたわ。
近年の音声合成はVALL-E(Microsoft 2023) やElevenLabsが有名。
数秒の音声から声質をコピーするVoice Cloningも可能になったの。
声真似AIまであるんですかぁ…すごいけど、ちょっと怖いですぅ…
そこが問題で、ディープフェイク音声による詐欺事件も発生しているわ。
倫理と法律の議論が急がれている領域よ。
音楽生成ではSunoやUdio(2024) が話題。
テキスト指示で完成度の高い楽曲を生成するサービスよ。
プロ音楽家の仕事に影響を与え始めているわ。
音楽までAIが作る時代か…あたしも置いてかれないようにしなきゃ!
G検定では『Sora (OpenAI 2024)』『Whisper (OpenAI 2022)』『WaveNet (DeepMind 2016)』『VALL-E・ElevenLabs・Voice Cloning』『Suno・Udio』を押さえておいてね!
確認クイズ
2024年にOpenAIが発表した、テキストから最大1分の高品質動画を生成するモデルはどれか。
- GPT-4o
- Sora
- Whisper
- DALL-E 3
こたえを見る
正解: 2. Sora
Soraは2024年2月にOpenAIが発表した動画生成AIで、Diffusion Transformer (DiT) を基盤にテキストから最大1分の高品質動画を生成できます。Whisperは音声認識、DALL-E 3は画像生成、GPT-4oはマルチモーダルLLMです。