でーたせっしゅ
データ窃取
―
学習済みモデルへの問い合わせを繰り返し、出力を分析することで内部のデータやモデル構造を盗む攻撃です。
詳しい説明
データ窃取とは、学習済みのAIモデルに対して外部から入力を繰り返し行い、その出力を分析することで、本来秘匿されるべき学習データの内容を復元したり、モデルの構造を盗み出したりする攻撃手法を指します。モデル抽出とも呼ばれます。
仕組みとしては、モデルに対する問い合わせとそれに対する応答のペアを大量に収集し、それらを解析することでモデルの意思決定境界を近似的に特定します。これにより、学習データに含まれていた個人情報や機密情報が推論されたり、モデルそのものが複製されたりするリスクが発生します。
G検定では、AIシステムの脆弱性やセキュリティリスクとして問われます。学習済みモデルはブラックボックスであると思われがちですが、出力さえ得られれば内部情報が推測される可能性があるという点は、AI導入において無視できないセキュリティ懸念事項として重要です。
試験で問われること
G検定
- 学習済みモデルから内部データやモデルそのものが復元されるリスクであると理解する
- モデルに対する問い合わせを繰り返して分析する手法であることを把握する
- モデル反転攻撃などと関連して、セキュリティ対策の重要性が問われる