глоссарий

Adversarial defense

Adversarial defense

Adversarial defense — методы, делающие ИИ устойчивым к состязательным примерам: почти незаметным искажениям картинки, звука или текста, из-за которых нейросеть ошибается. Например, чуть изменённое фото панды алгоритм может принять за гиббона. Защита закрывает эту уязвимость.

Термин важен, так как состязательные атаки — реальная угроза. Наклейки на дорожных знаках способны сбить автопилот, а специфический шум — обмануть систему распознавания лиц в банке. Если мы доверяем ИИ в медицине, финансах или безопасности, нужно убедиться, что его нельзя «сломать» хитроумной картинкой.

Как работает защита? Представьте нейросеть как инспектора, оценивающего форму, цвет, текстуру объекта. Атакующий находит «слепые зоны» — направления, где модель слишком доверяет незначительным деталям. Защита учит инспектора не доверять мелочам: показывает обманки во время обучения, сглаживает входной сигнал или заставляет учитывать общий контекст. В итоге модель опирается на существенные признаки, а не случайные пиксели.

Пример: в автономных автомобилях защита проверяет знаки, анализируя несколько снимков с разных ракурсов. Если на одном кадре «Стоп» из-за наклейки распознан как «Уступи дорогу», но соседние кадры показывают настоящий знак, система блокирует аномалию и тормозит корректно.

Вывод: adversarial defense — необходимый элемент безопасности ИИ. Пока есть злоумышленники, защита важна не меньше самого ИИ. Надёжный ИИ — не тот, кто всегда прав, а тот, кто умеет не поддаваться на провокации.