本文へ移動

でーたのかたより

データの偏り

学習用データが特定の属性に偏っていることで、モデルが不適切な判断を行う現象です。この偏りは予測精度の低下や差別的な結果を招くリスクがあります。

詳しい説明

データの偏りとは、機械学習やAIの学習に用いるデータセットにおいて、特定の属性や性質が過剰または不足している状態を指します。現実世界を反映しているつもりのデータであっても、収集時のサンプリング方法や過去の歴史的背景により、特定の人種、性別、地域などに偏りが発生することがあります。これをサンプリングバイアスと呼ぶこともあります。

この偏ったデータで学習したAIモデルは、その偏りを学習してしまい、特定のグループに対して精度の低い予測を行ったり、差別的な判断を下したりするリスクがあります。モデルの性能はデータの質に大きく依存するため、データの偏りを放置することは、AIの公平性や信頼性を損なう重大な問題となります。

G検定では、AI倫理や実務上のデータ前処理の課題として頻出します。単にデータを集めるだけでなく、そのデータが「どのような属性をどれくらいの比率で含んでいるか」を精査し、必要に応じてサンプリングの調整やデータ拡張を行うことが重要であると理解しておく必要があります。

試験で問われること

G検定

  • 学習データに特定属性の偏りがあること
  • モデルの予測精度低下や不公平な判断の原因となること
  • データ収集・前処理段階での是正が必要であること