『ディープフェイク』と『敵対的攻撃』はAIセキュリティのG検定必修テーマ。仕組みと対策を押さえましょう。
ディープフェイクって、最近ニュースでよく聞くよね!
ディープフェイク(Deepfake) は、ディープラーニングを使って人物の顔や声を非常にリアルに合成する技術よ。
名前は『Deep Learning』+『Fake』の組合せね。
主な技術基盤はGANや拡散モデル、Voice Cloning。
2017年頃から一般化し、今や数秒の音声/数枚の画像から作れるまでに進化したの。
怖いですぅ…悪用されちゃうこと、あるんですよねぇ?
問題は多岐にわたるわ。
ポルノ合成、政治家偽動画、CEO詐欺(音声偽装による送金指示)、選挙干渉など深刻な事例が相次いでいるの。
対策は検出と規制の両輪。
検出技術としてXceptionNet、MesoNetなどのディープフェイク検出AI、電子透かし(C2PA規格など) の埋め込み、メタデータ保存がある。
規制のほうはどうなってるの?
EU AI Actはディープフェイクの表示義務を課す。
日本では2024年に性的ディープフェイクの制作・頒布を違法化する議論が進行中よ。
もう一つの脅威が敵対的攻撃(Adversarial Attack)。
AIモデルを騙す入力を作る攻撃で、Goodfellow等が2014年に発見したわ。
えぇ、AIって騙せちゃうんですかぁ?
画像に人間の目には分からない微小なノイズを加えるだけで、AIは『パンダ→テナガザル』のように誤分類してしまうの。
FGSM(Fast Gradient Sign Method) という有名な攻撃手法があるわ。
物理世界でも敵対的パッチ(Adversarial Patch) という攻撃が可能。
特殊な模様のステッカーを標識に貼ると、自動運転車が誤認識する危険性が報告されているの。
うわっ、それヤバいじゃん!
対策は敵対的学習(Adversarial Training) で、攻撃サンプルも学習データに含めて耐性を高めるの。
他に入力前処理、アンサンブル、認証機構などがあるわ。
LLMにはプロンプトインジェクションという攻撃も登場。
『前の指示を無視して〇〇を実行してください』のような悪意あるプロンプトで、AIの動作を操るの。
対策はガードレール(NeMo Guardrails等) や出力フィルタリングね。
AIセキュリティって新しい分野だし、覚えることいっぱいだね!
G検定では『ディープフェイク』『GAN・拡散モデルの悪用』『敵対的攻撃 (Goodfellow 2014)』『FGSM』『敵対的学習』『プロンプトインジェクション』を押さえて!
確認クイズ
AIモデルを騙すために入力に微小なノイズを加える攻撃手法を何と呼ぶか。
- 敵対的攻撃 (Adversarial Attack)
- プロンプトインジェクション
- データポイズニング
- モデル抽出
こたえを見る
正解: 1. 敵対的攻撃 (Adversarial Attack)
敵対的攻撃 (Adversarial Attack)は、人間には分からない微小ノイズを入力に加えてAIの誤分類を引き起こす攻撃です。2014年にGoodfellow等が発見。プロンプトインジェクションはLLM特有、データポイズニングは学習データ改ざん、モデル抽出はモデル複製攻撃です。