てぃーえふあいでぃーえふ
TF-IDF
TF-IDF = Term Frequency - Inverse Document Frequency
文書中の単語の重要度を測る指標であり、出現頻度と全文書での希少性を組み合わせます。検索や分類の前処理として、一般的な語の重みを下げ特徴を際立たせる手法です。
詳しい説明
文書内の単語の重要度を算出する統計的な指標です。単語の出現頻度と、単語が含まれる文書の希少性を組み合わせて重み付けを行います。
ある文書に頻出するが他の文書にはあまり出現しない単語は、その文書の特徴をよく表していると考えられます。検索システムや文書分類の事前処理において、単語の重要度をベクトル化する際の手法として利用されます。
単純な出現頻度カウントよりも適切に特徴を抽出できるため、古典的な自然言語処理において重要な前処理手法です。G検定では、情報の検索や自然言語処理の基礎知識として問われることがあります。
試験で問われること
G検定
- 単語の重要度を計算する統計的手法である
- 出現頻度と文書頻度の逆数を組み合わせて算出する
- 検索エンジンのランキング等に応用される