さんぷりんぐばいあす
サンプリングバイアス
データを収集する際に、母集団を正しく反映していない偏った標本を選んでしまう現象です。偏ったデータで学習するとモデルが誤った傾向を真実と認識してしまいます。
詳しい説明
サンプリングバイアスは、データを収集する際に、母集団を正しく反映していない偏った標本(サンプル)を選んでしまう現象です。機械学習においては、データセットの質が予測精度に直結するため、非常に重要な概念です。
例えば、特定の時間帯や特定の属性のデータばかりを集めると、機械学習モデルはその偏った傾向を真実として学習してしまいます。その結果、実運用時に未知のデータに対して誤った予測を行ってしまうリスクが生じます。
これを防ぐためには、データ収集段階でのランダムサンプリングや、データの偏りを統計的に補正する処理が必要です。G検定では、データセットの設計において注意すべき落とし穴として出題されます。
試験で問われること
G検定
- データ収集時に標本が偏る現象を指すことを理解する。
- 偏ったデータで学習するとモデルの汎化性能が低下する点を押さえる。
- 収集段階での設計が重要であり、学習後の対策は困難であることに関連する設問が出る。