k-means - 重心反復で自動クラスタリング

k-meansの仕組みをアルゴリズム・エルボー法・弱点から解説。初期値依存性を改善するk-means++も。

教師なし学習の代表『k-means』は、データを k個のクラスタに分ける手法。シンプルで理解しやすく、G検定でも頻出です。

雷門 あかり(普段) 雷門 あかり

教師なし学習って、ラベルなしでどうやって学ぶの?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

データに潜む構造を見つけるのよ。
k-meansはその代表で、k個のクラスタ(グループ) にデータを自動で分ける手法ね。

白銀 エマ(普段) 白銀 エマ

アルゴリズムは4ステップ。
1) k個の重心をランダム配置、2) 各データ点を最も近い重心に割り当て、3) 重心を各クラスタのデータ点の平均に更新、4) 収束まで繰り返す。
シンプルよ。

紫藤 ゆら(笑顔) 紫藤 ゆら

重心を動かしながら、だんだんグループが整っていくんですねぇ!

六角 いずみ 先生(普段) 六角 いずみ 先生

kの値は事前に指定するのが弱点。
エルボー法やシルエット分析で最適なkを探すのが実務的ね。

白銀 エマ(普段) 白銀 エマ

エルボー法は、kを増やしながらクラスタ内分散の総和をプロットし、折れ曲がる点 (肘) を最適kとする方法。
直感的で分かりやすいわ。

雷門 あかり(笑い) 雷門 あかり

肘を探すんだ!
ネーミングおもしろっ!

六角 いずみ 先生(普段) 六角 いずみ 先生

k-meansの弱点は初期値依存性。
ランダム配置した重心によって結果が変わる。
k-means++はこれを改善した初期化手法よ。

白銀 エマ(普段) 白銀 エマ

もう一つの弱点は球状のクラスタしか扱えないこと。
複雑な形状のクラスタにはDBSCANや階層クラスタリングが適しているわ。

紫藤 ゆら(笑顔) 紫藤 ゆら

データの形によって使い分けるんですねぇ〜!

六角 いずみ 先生(笑顔) 六角 いずみ 先生

実務での応用は顧客セグメンテーション、画像の色削減、異常検知の前処理など。
シンプルだけど幅広く使われる手法よ。

雷門 あかり(笑い) 雷門 あかり

シンプルなのに実務で役立つなんて、いいやつじゃん!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『k-means=k個のクラスタ』『重心の反復更新』『エルボー法・シルエット分析』『k-means++』を押さえて!

確認クイズ

k-meansクラスタリングで最適なkを選ぶ手法として有名なものはどれか。

  1. ドロップアウト
  2. エルボー法
  3. 交差検証
  4. ラベル伝播
こたえを見る

正解: 2. エルボー法

エルボー法は、kを変えながらクラスタ内分散をプロットし、折れ曲がる点 (肘) を最適kとする手法です。ドロップアウトはNN正則化、交差検証は汎化性能評価、ラベル伝播は半教師あり学習手法です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。