Trojan model
Почему это важно? Нейросети уже встраивают в автомобили, медицинские системы и банковские сервисы. Если злоумышленник внедрит троянца на этапе обучения, такая сеть будет безупречно работать в обычных условиях, но по команде начнёт ошибаться — например, пропускать пешехода на дороге или одобрять мошеннический платёж. Обнаружить закладку крайне сложно: поведение модели выглядит корректным в тысячах тестов.
Как это работает интуитивно? Представьте дворника, который отлично моет окна в любом офисе. Но если ему показать белую хризантему, он разбивает стекло. В нейросети такой раздражитель — невидимый паттерн, например, несколько пикселей на фотографии, которые глаз человека не замечает. При обучении троянца подмешивают особые примеры, и сеть усваивает связь «триггер — вредное действие».
Прикладной пример: исследователи показали атаку на беспилотный автомобиль. Троянская сеть распознавания знаков отлично видела «стоп» и «уступи дорогу», но если на знак клеили крошечную чёрную наклейку, сеть упорно читала «разрешено движение». Машина, доверяя модели, спокойно проезжала перекрёсток.
Вывод: троянские модели — тихая угроза из той области, где цена ошибки не утечка данных, а жизни людей. Защита требует проверки не только точности, но и устойчивости модели к скрытым триггерам.
Поделиться