機械学習の評価指標は豊富です。混同行列・適合率・再現率・F値・AUC・ROCと、バイアス-バリアンスのトレードオフをまとめて理解しましょう。
分類の評価指標ってどれくらいあるの?
出発点は混同行列(Confusion Matrix)。
2クラス分類では、TP(真陽性)、TN(真陰性)、FP(偽陽性)、FN(偽陰性) の4セルで結果を整理するの。
ここから様々な指標が計算できるわ。
正解率(Accuracy) = (TP+TN)/全体。
最もシンプルだけど、不均衡データでは誤解を招くの。
どう誤解しちゃうんですかぁ?
例えば99%の人が健常で1%が病気のデータなら、『全員健常』と予測しても正解率99%になる。
でも病気の人を全員見逃すから意味ないでしょ?
そこで適合率(Precision) = TP/(TP+FP) と再現率(Recall) = TP/(TP+FN) を使うの。
2つの違いは?
適合率は『陽性と予測した中で本当に陽性の割合』(誤検知の少なさ)。
再現率は『実際の陽性を見つけ出した割合』(見逃しの少なさ)。
病気の診断だと再現率が大事ですねぇ〜、見逃したら大変ですもん!
適合率と再現率はトレードオフなので、両者の調和平均F値(F1-Score) = 2PR/(P+R) が使われるわ。
バランスの取れた評価指標ね。
AUCって聞いたけど何?
AUC(Area Under the Curve) はROC曲線の面積。
閾値を変化させた時の真陽性率と偽陽性率のトレードオフを描いた曲線の面積で、0.5 (ランダム) 〜1.0 (完璧) で評価するの。
そして学習一般のトレードオフ概念がバイアス-バリアンス分解。
バイアスは予測の偏り (モデルの単純さ)、バリアンスは予測のばらつき (モデルの複雑さ)。
シンプルなモデルは高バイアス・低バリアンス(未学習)、複雑すぎるモデルは低バイアス・高バリアンス(過学習)。
両者のバランスが最適なのよ。
どっちかに偏っちゃうとダメなんですねぇ
評価指標って奥が深いなぁ…でもこれで読み違いしなくなりそう!
G検定では『混同行列』『適合率・再現率・F値』『AUC・ROC』『バイアス-バリアンス』を必ず押さえて!
確認クイズ
『実際の陽性のうち、正しく陽性と予測できた割合』を表す指標はどれか。
- 適合率 (Precision)
- 再現率 (Recall)
- 特異度 (Specificity)
- F値 (F1-Score)
こたえを見る
正解: 2. 再現率 (Recall)
再現率 (Recall) = TP/(TP+FN) は実際の陽性のうち正しく検出できた割合 (見逃しの少なさ)。適合率は陽性予測のうち本当に陽性の割合、F値は両者の調和平均、特異度は陰性の検出率です。