k-means以外にも様々なクラスタリング手法があります。『階層クラスタリング』と『DBSCAN』の特徴を押さえて、使い分けを理解しましょう。
k-meansの次は階層クラスタリングかぁ!
そうよ。
階層クラスタリングは、データ点を徐々にまとめ上げていく凝集型と、全体から分割する分割型があるわ。
最も一般的なのは凝集型。
各点を独立クラスタとして開始し、最も近い2つを繰り返し統合していくの。
結果はデンドログラム(樹形図) で可視化できるわ。
わぁ、木を育てていくみたいですねぇ♪
クラスタ間の距離計算にはウォード法、群平均法、最短距離法などがあるわ。
分散を最小化するウォード法が最もよく使われるのよ。
階層クラスタリングの利点は、kを事前に指定しなくていいこと。
デンドログラムを見てから、後でクラスタ数を決められるの。
ただし計算量がO(n²)だから、データ量が多いと厳しいわね。
じゃあDBSCANはどんな感じ?
DBSCAN(Density-Based Spatial Clustering of Applications with Noise) は、密度ベースのクラスタリング。
『密に集まっている点の集合』をクラスタとみなすの。
パラメータはε(近傍半径) とMinPts(最小点数) の2つ。
ε内にMinPts以上の点がある点をコア点とし、コア点を中心にクラスタを育てるのよ。
密なところと疎なところを見分けるんですねぇ!
DBSCANの強みは『クラスタ数を事前指定不要』『非球状クラスタも扱える』『外れ値 (ノイズ) を自動識別』の3点。
地理データや異常検知に強いわ。
k-meansじゃ見つけられない複雑な形も検出できるんだね!
弱点は密度が均一でないデータで性能が落ちること。
そこでOPTICSという改良手法も提案されているわ。
G検定では『階層クラスタリング=デンドログラム』『DBSCAN=密度ベース・ε・MinPts』『k-meansとの違い』を押さえておいてね!
確認クイズ
DBSCANクラスタリングが扱う『密度ベースでクラスタを形成する』特徴と最も関係するパラメータはどれか。
- k (クラスタ数)
- ε (近傍半径) と MinPts (最小点数)
- 学習率
- バッチサイズ
こたえを見る
正解: 2. ε (近傍半径) と MinPts (最小点数)
DBSCANの主要パラメータはε (近傍半径) とMinPts (最小点数)です。ε内にMinPts以上の点があるコア点からクラスタを形成します。kはk-means用、学習率とバッチサイズはニューラルネット用です。