とうけいてきしぜんげんごしょり
統計的自然言語処理
大規模データから言語の確率的な規則性を学習し、処理を行う手法です。ディープラーニング以前の主流であり、現代の言語モデルが確率を用いて生成を行う基盤です。
詳しい説明
統計的自然言語処理とは、大規模なテキストデータから言語の統計的な規則性を学習し、言語処理を行う手法です。かつて主流だった、人間が言語ルールを記述するルールベース(記号的)手法とは対照的です。ある単語の次にどの単語が出現しやすいかといった確率を計算し、翻訳や要約などのタスクを解決します。
この手法の発展により、Nグラムモデルや隠れマルコフモデルなどの数理モデルが活用されました。膨大なコーパスを学習させることで、個別の単語の意味や文の構造を、確率的な傾向として捉えることができます。ディープラーニング以前の自然言語処理の主力であり、現在の大規模言語モデルの確率的な生成の基礎となる考え方です。
G検定では、ルールベース(記号主義)と統計的手法、そしてディープラーニング(接続主義)の歴史的な変遷として問われます。統計的自然言語処理は、データ駆動型の先駆けとして重要です。現在はニューラルネットワークを用いた手法が圧倒的に主流ですが、確率を用いて言語を扱う基本原則は変わっておらず、知識の整理として押さえておきましょう。
試験で問われること
G検定
- 言語ルールを人間が書くのではなく、データから統計的に抽出する手法である。
- ディープラーニング以前の自然言語処理の主流であった。
- 現代の言語モデルの確率的基盤となっている。