教師なし学習のもう一つの柱『次元削減』。PCAとt-SNEの違いを押さえて、データ可視化の基本を理解しましょう。
次元削減って言葉、なんかカッコいい!
次元削減(Dimensionality Reduction) は、高次元データを情報をあまり失わずに低次元に圧縮する手法よ。
可視化や計算効率化に使うわ。
代表は主成分分析(PCA: Principal Component Analysis)。
データの分散が最大の方向 (主成分) を見つけて、そこに射影するの。
分散が大きい方向って、なんですかぁ?
データが最もばらついている方向のこと。
例えば、身長と体重のデータは『身長+体重』方向にばらつくから、この方向を第1主成分として1次元に圧縮できるのよ。
PCAは線形変換だから、非線形な構造は捉えられないの。
そこで登場するのがt-SNE(t-distributed Stochastic Neighbor Embedding)。
うわっ、名前なが〜い!
t-SNEは高次元での局所的な類似性を低次元で保つように最適化するの。
高次元で近い点は低次元でも近く、遠い点は遠くに配置される。
t-SNEの得意分野は可視化。
手書き数字のMNISTデータを2次元プロットすると、数字ごとに綺麗にクラスタが分かれるわ。
深層学習の埋め込み可視化にも使われるのよ。
わぁ、こんなにきれいにまとまるんですねぇ♪
2018年にはUMAP(Uniform Manifold Approximation and Projection) が提案されて、t-SNEより高速かつ全体構造も保持する手法として普及しているわ。
次から次に新しい手法が出てくるんだね〜
PCAとt-SNE/UMAPの使い分けは『前処理ならPCA、可視化ならt-SNE/UMAP』で覚えると分かりやすいわ。
G検定では『PCA=分散最大方向』『t-SNE=局所類似性保持』『UMAPの存在』を押さえて!
確認クイズ
データの可視化で高次元の『局所的な類似性』を低次元に保持する手法として最も適切なものはどれか。
- PCA
- t-SNE
- k-means
- SVM
こたえを見る
正解: 2. t-SNE
t-SNEは局所類似性を保持する非線形次元削減手法で可視化に強みがあります。PCAは線形の次元削減 (分散最大化)、k-meansはクラスタリング、SVMは分類手法です。