『ランダムフォレスト』は決定木を束ねて性能を上げる手法。アンサンブル学習の代表例で、G検定必出のトピックです。
木をたくさん作って森にしちゃうってこと?
その通り!
ランダムフォレスト(Random Forest) は、大量の決定木を作り、多数決 (分類) や平均 (回帰) で最終予測を行う手法よ。
キーとなるのはバギング(Bagging=Bootstrap Aggregating) という考え方。
訓練データからランダムにサンプリング (ブートストラップサンプリング) して複数のデータセットを作り、それぞれで決定木を学習するの。
同じデータから別々の木ができるんですかぁ?
そうなのよ。
重複を許してサンプリングするから、木ごとに少しずつ違うデータになるの。
さらに特徴量もランダムに選ぶから、多様性が生まれるのよ。
こうすることで、個々の決定木の弱点 (不安定・過学習) がアンサンブルで相殺されるの。
単体の決定木より大幅に安定して、精度も高くなるわ。
要は三人寄れば文殊の知恵ってこと?
ランダムフォレストの利点は『過学習に強い』『特徴量の重要度が計算できる』『並列計算ができる』『ハイパーパラメータ調整が比較的楽』の4点ね。
特徴量重要度は、ある特徴量を分割に使ったときのジニ不純度の減少量を集計して算出するの。
どの変数が予測に効いているかが分かるわ。
それって実務でもよく使われますよねぇ〜♪
弱点は解釈性。
単体の決定木と違い、数百本の木全体を人間が追うのは難しい。
でも『どの特徴量が重要か』は分かるので、ある程度の説明は可能よ。
なるほど、バランスの取れた手法なんだね!
G検定では『ランダムフォレスト=バギング+決定木』『ブートストラップサンプリング』『特徴量重要度』を押さえて!
確認クイズ
ランダムフォレストの基盤となるアンサンブル手法はどれか。
- バギング (Bagging)
- ブースティング (Boosting)
- スタッキング (Stacking)
- モメンタム
こたえを見る
正解: 1. バギング (Bagging)
ランダムフォレストはバギングの代表例です。ブートストラップサンプリングで作った複数データセットで並列に決定木を学習します。ブースティングは逐次的に弱学習器を足す手法 (次節)、スタッキングはメタモデル、モメンタムは最適化手法です。