глоссарий

Adversarial training

Adversarial training

Состязательное обучение — метод тренировки нейросетей, при котором модель учится распознавать и игнорировать специально созданные обманные примеры. Такие примеры выглядят нормально для человека, но содержат едва заметные искажения, способные сбить алгоритм. Модель тренируют не только на правильных данных, но и на «вредных», чтобы она не поддавалась на провокации.

Термин важен, потому что нейросети уязвимы: небольшое изменение пикселей может заставить систему перепутать панду с гиббоном или не заметить знак «стоп». Такие атаки реальны: ими можно обмануть автопилот, распознавание лиц или фильтр спама. Состязательное обучение — один из немногих практических способов сделать ИИ безопасным, а не просто точным на тестах.

Представьте боксера, готовящегося к чемпионату. Обычный спарринг не раскроет его слабости, поэтому приглашают хитреца, бьющего в слабые места. Сначала боксер пропускает удары, но учится защищаться. Нейросеть тренируют в паре с «атакующим» алгоритмом: тот ищет уязвимости, создает коварные примеры. Модель ошибается, получает обратную связь и корректирует веса. Цикл повторяется, пока ИИ не перестанет вестись на обманки.

Например, беспилотный автомобиль распознает знаки. Злоумышленник может наклеить на знак «уступи дорогу» полоску, незаметную человеку, но превращающую знак в «главную дорогу» для модели. Если систему заранее обучить состязательно, она научится игнорировать такие полоски и опираться на форму знака. Это предотвратит аварию из-за хакерской шалости.

Состязательное обучение — это прививка для ИИ. Оно не делает модель непогрешимой, но повышает устойчивость к атакам, а значит, надежность в реальном мире, где всегда найдется тот, кто захочет обмануть алгоритм.