『GAN』は生成AIに革命を起こした対立学習の枠組み。画像生成、ディープフェイクなど様々な応用が生まれました。
GANって、なんか敵対的なやつなんでしょ?
GAN(敵対的生成ネットワーク, Generative Adversarial Network) は、2014年にイアン・グッドフェローが提案した画期的な生成モデルよ。
仕組みはGenerator(生成器) とDiscriminator(識別器) の対立学習。
Generatorは偽物データを作り、Discriminatorは真贋を見分ける。
このミニマックスゲームで両方が進化していくの。
わぁ、偽札作りと警察の戦いみたいですぅ!
そうそう、まさにそれ。
Generatorが偽札技術を磨いて、Discriminatorが鑑定眼を磨く。
その結果、本物と見分けがつかないくらいリアルな偽物が作れるようになるのよ。
GANはDCGAN(2015, 畳み込みGAN)、ProgressiveGAN、StyleGAN(2018, 2019)、BigGANなど多くの派生を生んだわ。
StyleGANって、めちゃリアルな人の顔を作るやつだよね?
そう、StyleGAN(NVIDIA, 2018〜) は超高解像度の人間の顔を生成でき、『このサイトの人物は実在しない』という有名なサイトで話題になったわ。
応用は画像生成だけでなく、CycleGAN(画像ドメイン変換)、pix2pix(画像→画像翻訳)、音声合成、テキスト→画像など広範にわたるの。
わぁ、いろんなところで使われてるんですねぇ♪
GANの弱点はモード崩壊(Mode Collapse)。
Generatorが似た出力ばかり生成してしまう現象ね。
また学習が不安定で収束しにくいという課題もあるわ。
近年は拡散モデル (Diffusion Model) の台頭で、GANから主役が移りつつあるの。
Stable DiffusionやDALL-E 2以降は拡散モデルが主流ね。
えー、GANが王座から降りちゃったんだ…
それでもディープフェイクの問題や芸術分野での貢献など、GANが社会に与えた影響は大きいの。
G検定では『GAN (グッドフェロー 2014)』『Generator vs Discriminator』『StyleGAN』『モード崩壊』『ディープフェイク』を押さえておいてね!
確認クイズ
GANを構成する2つのネットワークの組合せとして最も適切なものはどれか。
- エンコーダとデコーダ
- GeneratorとDiscriminator
- ActorとCritic
- CellとGate
こたえを見る
正解: 2. GeneratorとDiscriminator
GANはGenerator (生成器) とDiscriminator (識別器) の2つのネットワークで構成されます。Generatorは偽データを生成、Discriminatorは真偽を判別し、両者が対立学習で進化します。エンコーダ/デコーダはオートエンコーダ、Actor/CriticはRL、Cell/GateはLSTMです。