глоссарий

Model inversion

Model inversion

Model inversion — это атака на ИИ, при которой злоумышленник, имея доступ к обученной модели, восстанавливает данные из её обучающей выборки. Модель превращается в окно в личное: по алгоритму распознавания лиц можно восстановить чужие фото, по модели диагностики — снимки пациентов.

Это важно, потому что нейросети обучаются на персональных данных: медкартах, фото, переписках. Считается, что если база закрыта, то данные в безопасности. Но инверсия модели рушит это представление: даже без доступа к хранилищу, имея лишь саму модель (например, через открытый API), можно извлечь конфиденциальную информацию. Это угрожает приватности в медицине и финансах.

Как это работает? Представьте модель как строгого критика. Вы показываете ему случайный шум — он говорит, похоже ли на «лицо». Меняете картинку, спрашиваете снова, и так много раз, пока критик не скажет: «Теперь это точно Иванов!». Методом проб вы подстраиваете вход, чтобы модель выдала максимальную уверенность для конкретного класса. Из хаоса проступает образ — синтетическая копия реального человека из обучающей выборки.

Пример: модель предсказывает риск инфаркта по ЭКГ. Атакующий запускает инверсию и получает сгенерированную кардиограмму с характерными аномалиями. Сравнивая её с публичными записями, он может сопоставить сигнал с конкретным пациентом и узнать его диагноз — даже если модель была доступна только как «чёрный ящик» с API.

Итог: инверсия модели — практическая угроза. Она напоминает, что защита данных не заканчивается на шифровании баз. Сами алгоритмы требуют осторожного обращения: например, добавлять шум при обучении (дифференциальная приватность) или ограничивать число запросов к модели, иначе приватность превращается в утечку.