Membership inference
Почему это важно? Модели не просто учат абстрактные закономерности — они частично запоминают примеры из обучающего набора. Если в наборе были медицинские карты, банковские транзакции или приватные сообщения, то утечка факта «эта запись была в обучении» — уже серьёзный компрометирующий сигнал.
Как работает интуитивно? Модель ведёт себя по-разному с «знакомыми» и «незнакомыми» данными. На том, что она видела, она обычно даёт более уверенные ответы, меньшую ошибку и меньше «удивляется». Атакующий может подать модели много записей и сравнить уровень её уверенности и точность на каждой. Если на записи А модель подозрительно самоуверенна, скорее всего, она встречала эту запись при обучении. Это как узнать одноклассника: на знакомых лицах мы не задумываемся, а на незнакомых — напрягаемся.
Прикладной пример: есть сервис, который по симптомам предсказывает диагноз. Его обучали на реальных больничных данных. Злоумышленник отправляет в сервис записи пациентов из утёкшей базы. На одной записи модель даёт диагноз с уверенностью 99%, на остальных — колеблется. Значит, этот пациент точно был в обучающей выборке, а значит, его лечили именно от этого заболевания.
Вывод: membership inference — это скрытая утечка приватности, которую не видно глазами, но можно измерить. Защита — анонимизация и дифференциальная приватность.
Поделиться