でーたりーけーじ
データリーケージ
―
本来知り得ない未来のデータや結果の情報が、誤って学習データに混入する現象です。モデルの評価スコアが不当に高くなり、未知のデータへの適応力が失われます。
詳しい説明
データリーケージとは、機械学習モデルの学習段階において、本来予測のタイミングで知り得ないはずの未来のデータや、結果を直接反映する情報が学習データに混入してしまう現象を指します。このデータが学習に使われると、モデルは問題の本質的なパターンではなく、単に答えを直接知る手がかりを学習してしまいます。
具体的には、予測対象である目的変数と相関が強すぎる特徴量が含まれる場合や、時系列データで未来の情報が訓練データに混ざるケースが典型です。モデルの学習段階での評価スコアや精度は極めて高く出ますが、この情報を知らない未知のデータに対して適用した瞬間、予測精度が著しく低下するという特徴があります。
G検定では、モデルの汎化性能を評価する際の落とし穴として頻繁に問われます。過学習と混同されやすいですが、データリーケージはモデルの構造よりもデータの設計ミスに起因する点が異なります。テストデータへのリーケージを防ぐために、データ分割を適切に行う重要性が問われます。
試験で問われること
G検定
- 学習データに予測対象が含まれることで精度が不当に高まる現象であると理解する
- 未知のデータに対して精度が極端に低下する点が最大の特徴である
- 過学習との違いや、データ分割の適切さが問われる