『決定木』は解釈しやすさで定評のある機械学習手法です。Yes/Noの質問を繰り返して予測に至る構造がG検定頻出です。
決定木って、フローチャートみたいなやつ?
まさに。
決定木(Decision Tree) は、データを『もし〜なら』の質問で分割していき、葉ノードで予測値を返す木構造のモデルよ。
分割の基準には情報利得(Information Gain) やジニ不純度(Gini Impurity) を使うの。
エントロピーの減少量が大きい特徴量で分割するのがポイントね。
エントロピー?
熱力学のやつ?
機械学習では情報理論的な意味で使うのよ。
『データの混ざり具合』を表す値で、分割後にクラスが綺麗に分かれると、エントロピーが下がるの。
代表的なアルゴリズムにID3、C4.5、CARTがあるわ。
CARTは分類と回帰両方に使えるのが特徴。
決定木のいいところって何?
最大の利点は解釈性。
『なぜその予測になったか』を木構造から追える。
医療や金融など、説明責任のある分野で重宝されるわ。
弱点は過学習しやすいこと。
深い木を作ると訓練データに過剰適合してしまう。
これを防ぐために剪定(Pruning) や最大深さの制限を行うのよ。
剪定って、植木みたいですねぇ♪
もう一つの弱点は不安定性。
データが少し変わると木の構造が大きく変わってしまう。
これを解決するのが次に学ぶランダムフォレストよ。
解釈しやすくて便利だけど、弱点もあるんだ!
G検定では『決定木は解釈性が高い』『情報利得/ジニ不純度で分割』『過学習しやすい』を押さえて!
確認クイズ
決定木の分割基準として用いられるものはどれか。
- ジニ不純度・情報利得
- 平均二乗誤差
- F値
- コサイン類似度
こたえを見る
正解: 1. ジニ不純度・情報利得
決定木の分割基準はジニ不純度や情報利得 (エントロピー減少)です。平均二乗誤差は回帰タスクの評価指標、F値は分類評価指標、コサイン類似度は類似度計算です。