てきたいてきこうげき
Adversarial Attack (Adversarial Examples)
Adversarial Examples = 敵対的サンプル
ニューラルネットワークに微細なノイズを加えて意図的に誤分類させる手法です。セキュリティリスクとして重要であり、モデルの脆弱性を突く攻撃として扱われます。
詳しい説明
敵対的攻撃とは、ニューラルネットワークに対して意図的に誤った判断をさせるための入力データを作成する手法です。人間が見ても元のデータと区別がつかないわずかなノイズを加えるだけで、AIの推論結果を強制的に書き換えることができます。
この攻撃で作られたデータを敵対的サンプルと呼びます。モデルの学習プロセスや推論プロセスにおける脆弱性を突くものであり、画像認識システムなどで深刻なセキュリティリスクとなります。モデルが特定の入力に対して異常な反応を示す性質を悪用しています。
G検定では、AIモデルの安全性や信頼性を損なう脅威として理解しておく必要があります。攻撃を防ぐための対策として、敵対的サンプルを訓練データに混ぜて学習させる敵対的訓練などが有効である点も合わせて覚えておくと安心です。
試験で問われること
G検定
- AIモデルを誤作動させるための手法である。
- 人間には検知できない微小なノイズが原因となる。
- モデルの堅牢性を高めるための対策(敵対的訓練)とセットで問われる。