『プライバシー保護機械学習』はAIの社会実装で鍵となる技術。差分プライバシー・連邦学習などG検定頻出の手法を整理します。
プライバシー保護機械学習って、要は個人情報を守りながら学習する技術ってこと?
そう。
プライバシー保護機械学習(Privacy-Preserving Machine Learning, PPML) は、個人情報を守りつつAI学習を可能にする技術群よ。
主要な4つの手法を押さえて。
1つ目が差分プライバシー(Differential Privacy, DP)。
ダトワーク(Dwork) 等が2006年に提案した数学的プライバシー定義で、データにノイズを加えて個々の寄与を隠蔽するの。
ノイズを加えるんですかぁ?
具体的には、プライバシー予算(ε) というパラメータで『どれだけ個人情報が漏れうるか』を定量化する。
εが小さいほど厳格な保護ね。
Apple、Google、米国勢調査局(2020年から採用) などが実用化。
Appleは差分プライバシーでユーザ行動を集計しながら個人特定を防いでいるわ。
大企業がみんな使ってるんだね!
2つ目が連邦学習(Federated Learning, FL)。
Googleが2016年に提案。
データを中央に集めず、各デバイスでローカルに学習し、モデル更新分のみを集約する方式よ。
Gboard(Google キーボード) の次単語予測は連邦学習で改善されているの。
個人の入力履歴がGoogleに送られることなく、モデルが賢くなるわ。
わぁ、便利で安心ですぅ!
医療分野でも期待が大きい。
病院間でデータを共有せずに、共通モデルを協調学習できるの。
メドテックスタートアップが実用化を進めているわ。
3つ目が準同型暗号(Homomorphic Encryption, HE)。
暗号化したまま計算できる魔法の暗号技術。
IBMのHElibやMicrosoft SEALが有名ね。
暗号化したまま計算ってどういうこと?
A+B のような計算を、Aの暗号文とBの暗号文だけで行えて、結果の暗号文を復号すると正解が得られるという特殊な暗号なのよ。
計算量が重いのが課題だけど、医療AI・金融AIで注目されているわ。
4つ目がセキュア計算(Secure Multi-Party Computation, SMPC)。
複数の当事者が互いにデータを見せ合わずに計算する技術。
シャミア秘密分散などが基盤よ。
プライバシーを守る技術、いろいろあるんですねぇ♪
また機械学習のデータ漏洩(メンバーシップ推論攻撃、モデル反転攻撃) も注意。
学習済みモデルから訓練データが推測されるリスクがあるの。
これにもDPが対策になるわ。
プライバシーとAIって、奥が深い関係なんだね!
G検定では『差分プライバシー (Dwork 2006)』『連邦学習 (Google 2016)』『準同型暗号』『セキュア計算 (SMPC)』『メンバーシップ推論攻撃』を押さえて!
確認クイズ
データを中央サーバに集めず、各デバイスでローカル学習を行い『モデル更新分のみ』を集約する機械学習手法はどれか。
- 差分プライバシー
- 連邦学習 (Federated Learning)
- 準同型暗号
- セキュア計算
こたえを見る
正解: 2. 連邦学習 (Federated Learning)
連邦学習 (Federated Learning)は2016年にGoogleが提案した手法で、データをサーバに送らずに各デバイスでローカル学習し、モデル更新分のみを集約します。GoogleのGboardや医療分野で実用化されています。