глоссарий

Adversarial attack

Adversarial attack

Adversarial attack (состязательная атака) — это способ обмануть систему искусственного интеллекта, подавая ей специально искажённые данные. Человек не заметит разницы, а модель ошибётся: например, вместо «белки» увидит «будильник» или проигнорирует знак «стоп» в автономном автомобиле.

Важность термина в том, что такие атаки показывают хрупкость ИИ. Нейросети учатся на закономерностях, а не на сути понятия. Поэтому крошечные изменения пикселей, невидимые глазу, могут разрушить уверенность модели. Это критично для банков, беспилотников, медицины: если злоумышленник может обмануть систему, доверие к ИИ подорвано. Понимание атак помогает создавать robust-модели, устойчивые к взлому.

Как это работает интуитивно? Представьте, что вы говорите на языке жестов: поднятая бровь означает «да». Достаточно слегка изменить положение брови — и тот же жест станет «нет». Нейросеть тоже ищет точные паттерны в данных. Исследователь вычисляет, какие крошечные шумы нужно добавить к картинке или тексту, чтобы сдвинуть границы этих паттернов. Шум минимален, но смещает внутреннее представление модели, как мутация в ДНК меняет смысл целого гена.

Прикладной пример: система распознавания лиц в банкомате. Атакующий печатает на очки полоски, невидимые для камеры и человека, но они дают правильный градиент, чтобы сеть классифицировала его как сотрудника банка. После этого злоумышленник имеет доступ к кабинету. Схожая техника используется против капчи или голосовых помощников: неслышимый ультразвук даёт команду «переведи деньги».

Вывод: adversarial attack напоминает, что «ум» нейросетей отличается от человеческого. Их сила — в статистике, слабость — в непонимании контекста. Изучение и защита от атак обязательны для безопасного внедрения ИИ в жизнь, ведь ошибка модели сегодня — не просто забавный баг, а возможная потеря данных, денег или даже здоровья.