拡散モデル - Stable Diffusion・DALL-E・Midjourney

拡散モデルの仕組みをDDPMから解説。Stable Diffusion・DALL-E・ControlNet・LoRAまで、画像生成AIの全体像を整理。

『拡散モデル』は画像生成AIの現在の主役。GANに代わって台頭した仕組みをG検定観点で整理します。

雷門 あかり(笑い) 雷門 あかり

画像生成AIってすごいけど、どうやって動いてるの?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

現代画像生成の主流は拡散モデル(Diffusion Model)。
2020年にHo等が提案したDDPM(Denoising Diffusion Probabilistic Models) が基盤よ。

白銀 エマ(普段) 白銀 エマ

基本アイデアは『ノイズを段階的に除去して画像を生成』。
学習時は逆に画像にノイズを徐々に加えて壊し、それを元に戻す過程を覚えるの。
推論時はランダムノイズから逆再生のように画像を復元していくわ。

紫藤 ゆら(びっくり) 紫藤 ゆら

ノイズから画像を取り出すなんて魔法みたいですぅ…!

六角 いずみ 先生(普段) 六角 いずみ 先生

有名な実装がStable Diffusion(Stability AI, 2022)。
オープンソースで手元のPCでも動かせて、画像生成AIの民主化を実現したのよ。
中身は潜在拡散モデル(LDM) といって、画素空間ではなく低次元の潜在空間で拡散を行う効率化手法ね。

白銀 エマ(普段) 白銀 エマ

商用のトップランナーがDALL-Eシリーズ (OpenAI) とMidjourney。
DALL-E 3 (2023) はChatGPTと統合され、Midjourneyはアート的な美しさで定評があるわ。

雷門 あかり(笑い) 雷門 あかり

言葉から絵が描けちゃうんだもん、すごいよね!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

拡散モデルの強みは多様性と高品質。
GANが苦手だったモード崩壊がなく、様々なスタイルを生成できるの。

白銀 エマ(普段) 白銀 エマ

発展系も多彩。
ControlNet(2023) は画像の姿勢・構図を制御、LoRAは特定のキャラクターやスタイルを軽量に学習、DreamBoothは数枚の画像から特定被写体を生成するのよ。

紫藤 ゆら(笑顔) 紫藤 ゆら

使いこなせば表現の幅が広がりそうですぅ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

テキストから画像への変換にはテキストエンコーダが重要。
CLIP由来の埋め込みを使うのが一般的よ。

白銀 エマ(普段) 白銀 エマ

2023年のSDXL(Stable Diffusion XL) は1024x1024の高解像度、2024年のStable Diffusion 3はDiffusion Transformer(DiT) を採用してさらに進化しているわ。

雷門 あかり(笑い) 雷門 あかり

画像生成もどんどんレベルアップしてるんだね!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『拡散モデル (DDPM, Ho 2020)』『Stable Diffusion (2022)』『DALL-E・Midjourney』『潜在拡散モデル (LDM)』『ControlNet・LoRA』を押さえておいてね!

確認クイズ

Stable DiffusionやDALL-Eの基盤となっている画像生成技術はどれか。

  1. GAN (敵対的生成ネットワーク)
  2. 拡散モデル (Diffusion Model)
  3. VAE (変分オートエンコーダ)
  4. オートエンコーダ
こたえを見る

正解: 2. 拡散モデル (Diffusion Model)

拡散モデル (Diffusion Model)はStable Diffusion・DALL-Eなど現代の画像生成AIの基盤です。ノイズ除去を学習する仕組みで、2020年のDDPM論文が基礎。GANより多様性と品質に優れます。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。