自然言語処理応用 - word2vec・機械翻訳・要約

NLPの主要タスクを、word2vec・GloVe・機械翻訳・要約・質問応答・NERから整理。G検定観点の体系図を提供。

NLPの定番タスクと重要技術を整理。word2vec・機械翻訳・要約・質問応答など、G検定の頻出領域です。

雷門 あかり(普段) 雷門 あかり

自然言語処理って、具体的にどんなタスクがあるの?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

代表的なタスクは文書分類、機械翻訳、要約、質問応答、固有表現認識(NER)、感情分析、テキスト生成など幅広いわ。

白銀 エマ(普段) 白銀 エマ

歴史的に重要なブレイクスルーがword2vec(Google, 2013)。
ミコロフ等が提案した単語を分散表現(ベクトル) として学習する手法で、CBOWとSkip-gramの2モデルがあるわ。

紫藤 ゆら(普段) 紫藤 ゆら

単語をベクトルにするって、どういうことですかぁ?

六角 いずみ 先生(笑顔) 六角 いずみ 先生

『王-男+女=女王』のような意味演算が可能になるの。
意味的に近い単語が近いベクトルで表現される意味空間を学習したわ。
これがNLP革命の始まりだったの。

白銀 エマ(普段) 白銀 エマ

後続のGloVe(Stanford 2014)、fastText(Facebook 2016)、そしてBERT(Google 2018) のコンテキスト埋め込みへと進化したの。

雷門 あかり(笑い) 雷門 あかり

BERTより前は静的埋め込みで、BERTからは文脈埋め込みって感じ?

六角 いずみ 先生(普段) 六角 いずみ 先生

その通り。
word2vecやGloVeは『bank』が銀行でも川岸でも同じベクトル。
BERTは文脈に応じて違うベクトルを生成するの。

白銀 エマ(普段) 白銀 エマ

機械翻訳の進化は特に顕著ね。
ルールベース→統計的機械翻訳(SMT)→ニューラル機械翻訳(NMT)→Transformerという流れで、2016年以降はTransformerベースが主流よ。

紫藤 ゆら(笑顔) 紫藤 ゆら

Google翻訳もDeepLも、今はみんなTransformerなんですねぇ♪

六角 いずみ 先生(普段) 六角 いずみ 先生

要約は2種類あって、抽出型要約(元の文をそのまま選ぶ) と生成型要約(新しい文を作る) ね。
近年はLLMによる生成型が主流。

白銀 エマ(普段) 白銀 エマ

質問応答(QA) はSQuADデータセットで競争が激化。
BERT以降、人間を超える精度を達成したわ。
オープンドメインQA(広範な知識) はRAGが有効ね。

雷門 あかり(普段) 雷門 あかり

感情分析とか固有表現認識って、どんな時に使うの?

六角 いずみ 先生(普段) 六角 いずみ 先生

感情分析は口コミ解析や市場調査、固有表現認識 (NER) は文書から人名・地名・組織名を抽出するタスク。
ビジネス利用で重要よ。

雷門 あかり(笑い) 雷門 あかり

NLPの応用って、ほんとに幅広いんだね!

六角 いずみ 先生(普段) 六角 いずみ 先生

G検定では『word2vec (ミコロフ 2013) - CBOWとSkip-gram』『分散表現』『統計的/ニューラル機械翻訳』『抽出/生成型要約』『SQuAD・NER』を押さえて!

確認クイズ

2013年にGoogleのミコロフ等が提案し、単語を分散表現ベクトルに変換する手法はどれか。

  1. word2vec
  2. BERT
  3. GloVe
  4. fastText
こたえを見る

正解: 1. word2vec

word2vecは2013年にGoogleのミコロフ等が提案した、CBOWとSkip-gramの2モデルで単語を分散表現化する手法です。『王-男+女=女王』のような意味演算が可能になりNLP革命の起点となりました。GloVe・fastTextは後発の類似手法、BERTは文脈埋め込みです。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。