глоссарий

Backdoor attack

Backdoor attack

Атака через бэкдор — это скрытый вход в систему, внедрённый заранее, позволяющий обходить проверку подлинности. В ИИ такой вход прячут внутри модели, и обычными методами его не обнаружить.

Проблема серьёзна: современные нейросети редко создают с нуля, чаще скачивают готовые и дообучают. Если там есть бэкдор, страдают все, кто использует эту модель: банки, автопилоты, системы распознавания лиц.

Интуитивно это как дом: строитель тайно сделал запасную дверь в фундаменте, о которой знает только он. Дом выглядит обычным, сигнализация работает, но ночью он войдёт, минуя замки. Бэкдор в ИИ — такой же «ключарь», который активируется триггером: необычный узор, изменённое слово, особый сигнал. Без триггера модель работает нормально, но при его появлении подчиняется атакующему.

Пример: сервис распознавания лиц использует готовую модель. Атакующий внедрил бэкдор: если человек надевает очки с особой плёнкой, система видит в нём гендиректора. Антивирусы не замечают, тесты точности идеальны, ведь таких очков никто не носит. Но преступник приходит в банк в этих очках — и доступ к сейфу открыт.

Итог: бэкдор-атаки опасны тем, что незаметны до применения. Защита — ответственный выбор источников моделей, аудит поведения на нестандартных данных и мониторинг после установки. Доверие в машинном обучении должно быть подкреплено проверкой.