глоссарий

Trojan model

Trojan model

Trojan model, или троянская модель, — это нейросеть, которая внешне решает полезную задачу, но содержит скрытый «вирусный» механизм, активирующийся по особому триггеру. Термин происходит от троянского коня: модель притворяется добропорядочной, пока не встретит нужный сигнал.

Почему это важно? Нейросети уже встраивают в автомобили, медицинские системы и банковские сервисы. Если злоумышленник внедрит троянца на этапе обучения, такая сеть будет безупречно работать в обычных условиях, но по команде начнёт ошибаться — например, пропускать пешехода на дороге или одобрять мошеннический платёж. Обнаружить закладку крайне сложно: поведение модели выглядит корректным в тысячах тестов.

Как это работает интуитивно? Представьте дворника, который отлично моет окна в любом офисе. Но если ему показать белую хризантему, он разбивает стекло. В нейросети такой раздражитель — невидимый паттерн, например, несколько пикселей на фотографии, которые глаз человека не замечает. При обучении троянца подмешивают особые примеры, и сеть усваивает связь «триггер — вредное действие».

Прикладной пример: исследователи показали атаку на беспилотный автомобиль. Троянская сеть распознавания знаков отлично видела «стоп» и «уступи дорогу», но если на знак клеили крошечную чёрную наклейку, сеть упорно читала «разрешено движение». Машина, доверяя модели, спокойно проезжала перекрёсток.

Вывод: троянские модели — тихая угроза из той области, где цена ошибки не утечка данных, а жизни людей. Защита требует проверки не только точности, но и устойчивости модели к скрытым триггерам.