Skip to content
Vol. 1 · Ed. 2026
CyberGlossary
Entry № 015

Адаптивная атака

ПроверилCybersecurity entrepreneur & security researcher

Что такое Адаптивная атака?

Адаптивная атакаАтака на систему машинного обучения, специально разработанная для обхода или взлома известной защиты, вместо применения универсальной техники, не зависящей от защиты.


Адаптивная атака строится при полном знании атакуемой защиты и её допущений, а её функция потерь или ограничения подгоняются так, чтобы обойти эту защиту. Термин популяризировали Carlini и Wagner, чьё исследование 2017 года Adversarial Examples Are Not Easily Detected взломало десять предложенных методов обнаружения, как только атака была перенастроена против конкретного правила каждого детектора.

Две знаковые работы по оценке закрепили адаптивные атаки как обязательные. Статья Athalye, Carlini и Wagner на ICML 2018, Obfuscated Gradients Give a False Sense of Security, показала, что 7 из 9 защит, принятых на ICLR 2018, опирались на маскирование градиентов (gradient masking) — они лишь делали градиенты неинформативными, а не делали модель по-настоящему устойчивой — и полностью обошла 6 из них с помощью таких техник, как BPDA (Backward Pass Differentiable Approximation, для преодоления недифференцируемой предобработки) и EOT (Expectation over Transformation, для победы над рандомизированными защитами). В 2020 году работа Tramèr, Carlini, Brendel и Madry On Adaptive Attacks to Adversarial Example Defenses (NeurIPS) взломала 13 защит с ICLR, ICML и NeurIPS, показав, что даже авторы, которые пытались проводить адаптивную оценку, зачастую строили слабые, не подогнанные атаки.

Урок таков: любая защита от состязательных примеров, водяных знаков или обнаружения контента, созданного ИИ, должна оцениваться против противника, осведомлённого о защите и адаптирующего свою цель, в идеале — с публикацией кода атаки. Пропуск этого шага регулярно порождает завышенные заявления об устойчивости, которые рушатся под простыми и принципиально обоснованными атаками.

flowchart TD
  A[Предложенная защита МО<br/>заявляет об устойчивости] --> B[Универсальная атака<br/>например стандартный PGD]
  B -->|Атака проваливается| C[Кажущаяся устойчивость]
  C --> D{Адаптивная оценка?}
  D -->|Пропущена| E[Завышенное заявление<br/>опубликовано]
  D -->|Применена| F[Атакующий изучает внутреннее<br/>устройство и допущения защиты]
  F --> G[Подогнать потери + BPDA / EOT<br/>под защиту]
  G --> H{Защита выстоит?}
  H -->|Нет| I[Устойчивость опровергнута]
  H -->|Да| J[Свидетельство подлинной<br/>устойчивости]

Примеры

  1. 01

    Carlini и Wagner взламывают несколько детекторов состязательных примеров, перенастраивая функцию потерь своей атаки против конкретного решающего правила каждого детектора.

  2. 02

    Адаптивная атака побеждает схему нанесения водяных знаков для изображений, сгенерированных ИИ, оптимизируя возмущения против опубликованного детектора.

Частые вопросы

Что такое Адаптивная атака?

Атака на систему машинного обучения, специально разработанная для обхода или взлома известной защиты, вместо применения универсальной техники, не зависящей от защиты. Относится к категории Безопасность ИИ и ML в кибербезопасности.

Что означает Адаптивная атака?

Атака на систему машинного обучения, специально разработанная для обхода или взлома известной защиты, вместо применения универсальной техники, не зависящей от защиты.

Как защититься от Адаптивная атака?

Защита от Адаптивная атака обычно сочетает технические меры и операционные практики, как описано в определении выше.

Какие есть другие названия Адаптивная атака?

Распространённые альтернативные названия: Атака с учётом защиты, Адаптивная оценка методом белого ящика.

Связанные термины