教師なし学習の代表『k-means』は、データを k個のクラスタに分ける手法。シンプルで理解しやすく、G検定でも頻出です。
教師なし学習って、ラベルなしでどうやって学ぶの?
データに潜む構造を見つけるのよ。
k-meansはその代表で、k個のクラスタ(グループ) にデータを自動で分ける手法ね。
アルゴリズムは4ステップ。
1) k個の重心をランダム配置、2) 各データ点を最も近い重心に割り当て、3) 重心を各クラスタのデータ点の平均に更新、4) 収束まで繰り返す。
シンプルよ。
重心を動かしながら、だんだんグループが整っていくんですねぇ!
kの値は事前に指定するのが弱点。
エルボー法やシルエット分析で最適なkを探すのが実務的ね。
エルボー法は、kを増やしながらクラスタ内分散の総和をプロットし、折れ曲がる点 (肘) を最適kとする方法。
直感的で分かりやすいわ。
肘を探すんだ!
ネーミングおもしろっ!
k-meansの弱点は初期値依存性。
ランダム配置した重心によって結果が変わる。
k-means++はこれを改善した初期化手法よ。
もう一つの弱点は球状のクラスタしか扱えないこと。
複雑な形状のクラスタにはDBSCANや階層クラスタリングが適しているわ。
データの形によって使い分けるんですねぇ〜!
実務での応用は顧客セグメンテーション、画像の色削減、異常検知の前処理など。
シンプルだけど幅広く使われる手法よ。
シンプルなのに実務で役立つなんて、いいやつじゃん!
G検定では『k-means=k個のクラスタ』『重心の反復更新』『エルボー法・シルエット分析』『k-means++』を押さえて!
確認クイズ
k-meansクラスタリングで最適なkを選ぶ手法として有名なものはどれか。
- ドロップアウト
- エルボー法
- 交差検証
- ラベル伝播
こたえを見る
正解: 2. エルボー法
エルボー法は、kを変えながらクラスタ内分散をプロットし、折れ曲がる点 (肘) を最適kとする手法です。ドロップアウトはNN正則化、交差検証は汎化性能評価、ラベル伝播は半教師あり学習手法です。