『ナイーブベイズ』は確率論ベースのシンプルな分類器で、スパムフィルタなどで実用されています。G検定では『単純な仮定で実用性が高い』点が問われます。
ナイーブベイズって、ベイズの定理を使うやつ?
そう。
ナイーブベイズ(Naive Bayes) はベイズの定理を分類問題に応用した手法よ。
式は P(クラス|特徴) ∝ P(特徴|クラス) × P(クラス) ね。
『ナイーブ』(naive=単純) なのは、特徴量同士が条件付き独立という強い仮定を置くから。
実際には特徴量間に相関があっても、独立とみなして計算を簡単にするの。
それで精度はだいじょうぶなのぉ?
驚くことに、強い仮定にもかかわらず実用上は高精度。
特にテキスト分類(スパムフィルタ感情分析) で長らく標準的に使われてきたのよ。
スパムフィルタを例にすると、メール内の各単語の出現確率からスパム/非スパムの確率を計算するの。
『無料』『当選』『今すぐ』などの単語があるとスパム確率が上がる仕組み。
へぇ〜、単語ごとに確率を掛け算していくんだ!
3つのバリエーションが代表的。
①ガウシアンナイーブベイズ: 特徴量が連続値で正規分布、②多項分布ナイーブベイズ: テキスト分類で単語頻度、③ベルヌーイナイーブベイズ: 特徴量が0/1の二値。
利点は、学習が高速・少ないデータでも動く・実装がシンプル・解釈可能性が高い。
特にデータが少ない初期段階の分類器として今でも有用ね。
弱点はないのぉ?
あるわ。
①特徴量間の相関を無視するため複雑なパターンに弱い、②訓練データに含まれない単語は確率0になる (ゼロ頻度問題) のためラプラススムージングが必須、③連続値の分布仮定が崩れると精度が落ちる。
G検定では『ナイーブな仮定=条件付き独立』『テキスト分類で実用性が高い』『ベイズの定理ベース』の3点を押さえておけば十分よ。
シンプルなのに使えるなんて、いいじゃん!
ディープラーニング全盛の時代でも、ナイーブベイズは『軽量・高速・解釈可能』なベースラインモデルとして現役なのよ。
確認クイズ
ナイーブベイズが『ナイーブ (単純)』と呼ばれる理由として最も適切なものはどれか。
- 計算アルゴリズムが非常に単純で、単一の四則演算しか用いないため
- 特徴量間に条件付き独立性という強い仮定を置いているため
- 決定木より単純な構造を持つため
- データが少なくても動作する単純な前処理を行うため
こたえを見る
正解: 2. 特徴量間に条件付き独立性という強い仮定を置いているため
ナイーブベイズの『ナイーブ』は特徴量同士が条件付き独立という強い (現実では成立しないことが多い) 仮定を指します。実際には相関があっても独立とみなして計算を簡略化することで高速・少データでも動作可能になります。