動画・音声生成 - Sora・Whisper・WaveNet

動画生成Sora、音声認識Whisper、音声合成WaveNet・VALL-E、音楽生成Sunoまで、マルチメディア生成AIを整理します。

動画生成と音声AIも急速に進化。Sora・Whisper・WaveNetはG検定で必ず名前を覚えておきたい代表モデルです。

雷門 あかり(笑い) 雷門 あかり

動画も生成できるの!?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

2024年2月にOpenAIが発表したSoraは、テキストから最大1分の高品質動画を生成できる画期的モデルよ。
業界に衝撃を与えたわ。

白銀 エマ(普段) 白銀 エマ

SoraはDiffusion Transformer(DiT) を基盤とし、時空間パッチで動画を扱うの。
2024年末に一般公開され、映像制作の革命を予感させるわ。

紫藤 ゆら(びっくり) 紫藤 ゆら

えぇっ、映画も作れちゃうんですかぁ?

六角 いずみ 先生(普段) 六角 いずみ 先生

他のライバルも強力。
RunwayのGen-3 Alpha、Pika Labs、Luma AIのDream Machine、GoogleのVeoなど、短尺動画生成は商用化が進んでいるわ。

白銀 エマ(普段) 白銀 エマ

音声認識の代表はWhisper(OpenAI, 2022)。
多言語対応で日本語精度も高く、オープンソースとして公開されたの。
配信・議事録作成などに広く使われているわ。

雷門 あかり(普段) 雷門 あかり

Whisperって、要は文字起こしAIってこと?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

そう、音声→テキストのSTT(Speech-to-Text) 。
逆のTTS(Text-to-Speech, 音声合成) の代表がWaveNet(DeepMind 2016) よ。
人間のような自然な音声を生成して驚かせたわ。

白銀 エマ(普段) 白銀 エマ

近年の音声合成はVALL-E(Microsoft 2023) やElevenLabsが有名。
数秒の音声から声質をコピーするVoice Cloningも可能になったの。

紫藤 ゆら(しょんぼり) 紫藤 ゆら

声真似AIまであるんですかぁ…すごいけど、ちょっと怖いですぅ…

六角 いずみ 先生(普段) 六角 いずみ 先生

そこが問題で、ディープフェイク音声による詐欺事件も発生しているわ。
倫理と法律の議論が急がれている領域よ。

白銀 エマ(普段) 白銀 エマ

音楽生成ではSunoやUdio(2024) が話題。
テキスト指示で完成度の高い楽曲を生成するサービスよ。
プロ音楽家の仕事に影響を与え始めているわ。

雷門 あかり(笑い) 雷門 あかり

音楽までAIが作る時代か…あたしも置いてかれないようにしなきゃ!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『Sora (OpenAI 2024)』『Whisper (OpenAI 2022)』『WaveNet (DeepMind 2016)』『VALL-E・ElevenLabs・Voice Cloning』『Suno・Udio』を押さえておいてね!

確認クイズ

2024年にOpenAIが発表した、テキストから最大1分の高品質動画を生成するモデルはどれか。

  1. GPT-4o
  2. Sora
  3. Whisper
  4. DALL-E 3
こたえを見る

正解: 2. Sora

Soraは2024年2月にOpenAIが発表した動画生成AIで、Diffusion Transformer (DiT) を基盤にテキストから最大1分の高品質動画を生成できます。Whisperは音声認識、DALL-E 3は画像生成、GPT-4oはマルチモーダルLLMです。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。