適応型攻撃
適応型攻撃 とは何ですか?
適応型攻撃汎用的で防御に依存しない手法を用いるのではなく、既知の防御を回避または突破するために特別に設計された、機械学習システムへの攻撃。
適応型攻撃は、対象となる防御とその前提を完全に把握したうえで構築され、その損失関数や制約はその防御を回避するように仕立てられます。この用語は Carlini と Wagner によって広く知られるようになりました。彼らの2017年の研究 Adversarial Examples Are Not Easily Detected は、各検出器固有のルールに合わせて攻撃を再設定するや否や、提案されていた10種類の検出手法を突破しました。
二つの画期的な評価が、適応型攻撃を必須のものとして定着させました。Athalye、Carlini、Wagner による ICML 2018 の論文 Obfuscated Gradients Give a False Sense of Security は、ICLR 2018 に採択された9件の防御のうち7件が勾配マスキング(gradient masking)に依存していること――すなわちモデルを真に頑健にするのではなく、単に勾配を情報の乏しいものにしていただけであること――を明らかにし、BPDA(Backward Pass Differentiable Approximation、微分不可能な前処理を突破するため)や EOT(Expectation over Transformation、ランダム化された防御を打ち破るため)といった技術を用いて、そのうち6件を完全に回避しました。2020年には、Tramèr、Carlini、Brendel、Madry による On Adaptive Attacks to Adversarial Example Defenses(NeurIPS)が ICLR、ICML、NeurIPS 由来の13件の防御を突破し、適応評価を試みた著者でさえ、往々にして脆弱で仕立てられていない攻撃を構築していたことを示しました。
教訓はこうです。敵対的サンプル、電子透かし、あるいは AI コンテンツ検出に対するいかなる防御も、防御を認識してその目的を適応させる敵対者に対して評価しなければならず、理想的には攻撃コードを公開すべきです。この段階を省略すると、単純で原理に基づいた攻撃に打ち破られる、誇張された頑健性の主張が日常的に生み出されます。
flowchart TD
A[提案された機械学習防御<br/>頑健性を主張] --> B[汎用的な攻撃<br/>例:標準的なPGD]
B -->|攻撃が失敗| C[見かけ上の頑健性]
C --> D{適応評価を実施?}
D -->|省略| E[誇張された主張が<br/>発表される]
D -->|実施| F[攻撃者が防御の内部構造と<br/>前提を調査]
F --> G[損失関数 + BPDA / EOT を<br/>防御に合わせて仕立てる]
G --> H{防御は持ちこたえるか?}
H -->|いいえ| I[頑健性が反証される]
H -->|はい| J[真の頑健性の<br/>証拠]● 例
- 01
Carlini と Wagner は、各検出器固有の判定ルールに合わせて攻撃の損失関数を再設定することで、複数の敵対的サンプル検出器を突破する。
- 02
適応型攻撃は、公開された検出器に対して摂動を最適化することで、AI生成画像向けの電子透かし方式を打ち破る。
● よくある質問
適応型攻撃 とは何ですか?
汎用的で防御に依存しない手法を用いるのではなく、既知の防御を回避または突破するために特別に設計された、機械学習システムへの攻撃。 サイバーセキュリティの AI / ML セキュリティ カテゴリに属します。
適応型攻撃 とはどういう意味ですか?
汎用的で防御に依存しない手法を用いるのではなく、既知の防御を回避または突破するために特別に設計された、機械学習システムへの攻撃。
適応型攻撃 からどのように防御しますか?
適応型攻撃 に対する防御は通常、上記の定義で述べたとおり、技術的統制と運用上の実践を組み合わせます。
適応型攻撃 の別名は何ですか?
一般的な別名: 防御を意識した攻撃, ホワイトボックス適応評価。