特徴量設計と特徴量エンジニアリング - DLが革命的だった理由

ディープラーニング登場前の中心課題『特徴量設計』と、DLによる『特徴量自動抽出』の革命性を、画像・自然言語・表形式データの違いから整理します。

『特徴量設計』はディープラーニング登場前のAIの中心的課題でした。なぜディープラーニングが革命的だったのか、その理由を特徴量の観点から理解しましょう。

雷門 あかり(普段) 雷門 あかり

『特徴量』って聞いたことあるけど、よく分かってないんだよね。

六角 いずみ 先生(笑顔) 六角 いずみ 先生

特徴量(Feature) は、機械学習モデルが入力として使う『データの特徴』のこと。
例えば画像分類なら、画像のエッジや色ヒストグラムが特徴量になるわ。

白銀 エマ(普段) 白銀 エマ

ディープラーニング以前の機械学習では、この特徴量を人間が手で設計していたの。
これを特徴量エンジニアリング(特徴量設計) と呼んで、AIプロジェクトの大半の時間がここに費やされていたわ。

紫藤 ゆら(普段) 紫藤 ゆら

人間がひとつひとつ『この画像のここが大事だよ!』って教えてあげてたんですかぁ?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

そう。
画像認識ならHOG(Histogram of Oriented Gradients) やSIFT(Scale-Invariant Feature Transform) といった特徴量が手で設計されていたの。
物体の輪郭を捉える職人技ね。

白銀 エマ(普段) 白銀 エマ

自然言語処理でも、TF-IDF(単語の重要度) やn-gram(連続する単語列) などが人手の特徴量。
テキストの特徴を統計的に捉えていたのよ。

雷門 あかり(びっくり) 雷門 あかり

うわ、それ大変そう…全部人がやらなきゃいけないの?

六角 いずみ 先生(普段) 六角 いずみ 先生

その通り。
特徴量設計は専門知識が必要で、ドメインごとに違う。
しかも試行錯誤の連続で、AIプロジェクトの最大のボトルネックだったのよ。

白銀 エマ(普段) 白銀 エマ

そこに革命を起こしたのがディープラーニングね。
DLは特徴量を自動抽出する。
下位の層がエッジを、中位の層が部品を、上位の層が物体全体を捉える階層構造で、人間の設計を不要にしたの。

紫藤 ゆら(びっくり) 紫藤 ゆら

わぁ、AIが自分で特徴を見つけちゃうんですかぁ!
まほうみたいですぅ…

六角 いずみ 先生(笑顔) 六角 いずみ 先生

2012年のAlexNetが衝撃的だったのは、この『特徴量自動抽出』の威力を示したから。
人手で何年も設計していた特徴量を、DLが自動で学習して上回ったのよ。

雷門 あかり(普段) 雷門 あかり

それで特徴量設計の時代が終わったってこと?

白銀 エマ(普段) 白銀 エマ

完全に終わったわけではないわ。
表形式データ(テーブルデータ) では今でも特徴量設計が重要。
特徴量ストア(Feature Store) という管理基盤も登場しているくらいよ。

六角 いずみ 先生(普段) 六角 いずみ 先生

ただ、画像・音声・自然言語のような非構造化データでは、DLが圧倒的。
これはEnd-to-End学習(生データから答えまで1つのモデルで) のアプローチ。

紫藤 ゆら(笑顔) 紫藤 ゆら

データの種類によってアプローチが変わるんですねぇ♪

雷門 あかり(笑い) 雷門 あかり

なるほどね!
特徴量の話、めっちゃ面白いじゃん!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『特徴量設計は人間の職人技』『DLは特徴量自動抽出』『表形式データでは今も特徴量設計が重要』『End-to-End学習』の対比を押さえておいてね。

確認クイズ

ディープラーニングが従来の機械学習と比較して革命的だった最大の理由として、最も適切なものはどれか。

  1. 計算速度が速くなったから
  2. ルールベースで動作するから
  3. 特徴量を自動で抽出できるから
  4. 教師データが不要だから
こたえを見る

正解: 3. 特徴量を自動で抽出できるから

ディープラーニングの革命性は特徴量を自動で階層的に抽出できることにあります。従来は人手による『特徴量エンジニアリング』が必要でしたが、DLは生データから直接学習します。教師データは基本的に必要で、ルールベースではなくデータ駆動です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。