Data poisoning
Почему это важно? Потому что современные системы ИИ собирают данные из интернета, пользовательского контента и сторонних датасетов. Достаточно совсем небольшой доли вредоносных примеров (например, 0,1%), чтобы модель кардинально изменила своё поведение. При этом внешне она остаётся точной на стандартных тестах, что делает атаку незаметной для разработчиков.
Как работает отравление? Представьте, что вы учите ребёнка распознавать грибы. Кто-то подкладывает мухомор с подписью «белый гриб». Ребёнок усвоит, что мухомор съедобен, и будет верить этому в будущем. Так же и модель: она воспринимает все примеры как истину, не имея возможности их проверить. Злоумышленники могут использовать разные методы, например, подмена меток классов, добавление большого числа «ядовитых» объектов или создание незаметных паттернов, которые активируются только в момент вывода.
Прикладной пример: атака на фильтр спама в почтовом сервисе. Чтобы обойти защиту, спамер отправляет на сотни почтовых ящиков обычные письма с пометкой «не спам», но с уникальным текстом, который он планирует использовать позже. Когда сервис переобучается на этих данных, модель начинает считать этот текст обычным письмом. В дальнейшем спамер рассылает массовые сообщения с этим текстом, и они беспрепятственно попадают к пользователям, обходя фильтры.
Вывод: отравление данных — серьёзная угроза доверию к ИИ. Чтобы защититься, нужно контролировать источники обучающих данных, регулярно проводить аудит моделей на аномалии и использовать алгоритмы, устойчивые к влиянию небольшой группы вредоносных примеров.
Поделиться