Backdoor attack
Проблема серьёзна: современные нейросети редко создают с нуля, чаще скачивают готовые и дообучают. Если там есть бэкдор, страдают все, кто использует эту модель: банки, автопилоты, системы распознавания лиц.
Интуитивно это как дом: строитель тайно сделал запасную дверь в фундаменте, о которой знает только он. Дом выглядит обычным, сигнализация работает, но ночью он войдёт, минуя замки. Бэкдор в ИИ — такой же «ключарь», который активируется триггером: необычный узор, изменённое слово, особый сигнал. Без триггера модель работает нормально, но при его появлении подчиняется атакующему.
Пример: сервис распознавания лиц использует готовую модель. Атакующий внедрил бэкдор: если человек надевает очки с особой плёнкой, система видит в нём гендиректора. Антивирусы не замечают, тесты точности идеальны, ведь таких очков никто не носит. Но преступник приходит в банк в этих очках — и доступ к сейфу открыт.
Итог: бэкдор-атаки опасны тем, что незаметны до применения. Защита — ответственный выбор источников моделей, аудит поведения на нестандартных данных и мониторинг после установки. Доверие в машинном обучении должно быть подкреплено проверкой.
Поделиться