GAN - 敵対的生成ネットワークの革命

GANの対立学習の仕組み、DCGAN・StyleGAN等の派生、応用と課題 (モード崩壊・ディープフェイク) をG検定観点で解説します。

『GAN』は生成AIに革命を起こした対立学習の枠組み。画像生成、ディープフェイクなど様々な応用が生まれました。

雷門 あかり(笑い) 雷門 あかり

GANって、なんか敵対的なやつなんでしょ?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

GAN(敵対的生成ネットワーク, Generative Adversarial Network) は、2014年にイアン・グッドフェローが提案した画期的な生成モデルよ。

白銀 エマ(普段) 白銀 エマ

仕組みはGenerator(生成器) とDiscriminator(識別器) の対立学習。
Generatorは偽物データを作り、Discriminatorは真贋を見分ける。
このミニマックスゲームで両方が進化していくの。

紫藤 ゆら(笑顔) 紫藤 ゆら

わぁ、偽札作りと警察の戦いみたいですぅ!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

そうそう、まさにそれ。
Generatorが偽札技術を磨いて、Discriminatorが鑑定眼を磨く。
その結果、本物と見分けがつかないくらいリアルな偽物が作れるようになるのよ。

白銀 エマ(普段) 白銀 エマ

GANはDCGAN(2015, 畳み込みGAN)、ProgressiveGAN、StyleGAN(2018, 2019)、BigGANなど多くの派生を生んだわ。

雷門 あかり(笑い) 雷門 あかり

StyleGANって、めちゃリアルな人の顔を作るやつだよね?

六角 いずみ 先生(普段) 六角 いずみ 先生

そう、StyleGAN(NVIDIA, 2018〜) は超高解像度の人間の顔を生成でき、『このサイトの人物は実在しない』という有名なサイトで話題になったわ。

白銀 エマ(普段) 白銀 エマ

応用は画像生成だけでなく、CycleGAN(画像ドメイン変換)、pix2pix(画像→画像翻訳)、音声合成、テキスト→画像など広範にわたるの。

紫藤 ゆら(笑顔) 紫藤 ゆら

わぁ、いろんなところで使われてるんですねぇ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

GANの弱点はモード崩壊(Mode Collapse)。
Generatorが似た出力ばかり生成してしまう現象ね。
また学習が不安定で収束しにくいという課題もあるわ。

白銀 エマ(普段) 白銀 エマ

近年は拡散モデル (Diffusion Model) の台頭で、GANから主役が移りつつあるの。
Stable DiffusionやDALL-E 2以降は拡散モデルが主流ね。

雷門 あかり(びっくり) 雷門 あかり

えー、GANが王座から降りちゃったんだ…

六角 いずみ 先生(普段) 六角 いずみ 先生

それでもディープフェイクの問題や芸術分野での貢献など、GANが社会に与えた影響は大きいの。

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『GAN (グッドフェロー 2014)』『Generator vs Discriminator』『StyleGAN』『モード崩壊』『ディープフェイク』を押さえておいてね!

確認クイズ

GANを構成する2つのネットワークの組合せとして最も適切なものはどれか。

  1. エンコーダとデコーダ
  2. GeneratorとDiscriminator
  3. ActorとCritic
  4. CellとGate
こたえを見る

正解: 2. GeneratorとDiscriminator

GANはGenerator (生成器) とDiscriminator (識別器) の2つのネットワークで構成されます。Generatorは偽データを生成、Discriminatorは真偽を判別し、両者が対立学習で進化します。エンコーダ/デコーダはオートエンコーダ、Actor/CriticはRL、Cell/GateはLSTMです。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。