Model stealing
Как это работает на интуитивном уровне? Представьте, что вы хотите скопировать рецепт фирменного торта, не заходя на кухню. Вы покупаете десятки тортов, пробуете их, измеряете вес, анализируете ингредиенты по вкусу и запаху. Постепенно вы восстанавливаете рецепт с высокой точностью. Также и нейросеть: злоумышленник шлёт тысячи специально подобранных входных данных (например, изображений или текстов) и записывает выходные — вероятности, классы, эмбеддинги. Собрав большую пару «вход — выход», он обучает свою модель-имитацию. Она не будет идентична оригиналу, но сможет повторять его ошибки и сильные стороны, а значит, выдавать похожие результаты.
Прикладной пример: у сервиса распознавания лиц есть платная API-модель, обученная на закрытой базе. Злоумышленник арендует доступ, отправляет через API фотографии людей с общедоступного датасета и получает векторы лиц. На этой основе он обучает собственную модель, которая умеет делать то же самое. Теперь у него есть аналог без затрат на сбор данных и обучение, а сервис теряет платных клиентов.
Вывод: model stealing подрывает экономику ИИ. Защита — ограничение числа запросов, добавление шума в ответы и контроль за тем, что именно клиент может получить. Это не взлом, а интеллектуальная кража, и она становится всё более насущной проблемой для компаний, которые продают искусственный интеллект как продукт.
Поделиться