Дифференциальная приватность
Обычные методы обезличивания часто проваливаются: анонимные записи сопоставляют с внешними данными и раскрывают личность. Дифференциальная приватность решает проблему иначе: не прячет данные, а добавляет управляемый шум в механизм подсчёта. Даже зная всю информацию о других людях, злоумышленник не сможет сделать точный вывод о конкретном человеке.
Интуитивно это похоже на опрос с подбрасыванием монеты: орёл — отвечать честно, решка — всегда «да». Учёный видит общее число «да» и может исправить смещение на уровне группы, но не узнаёт ответ конкретного человека. Дифференциальная приватность — формальная и мощная версия такого «случайного ответа», где шум добавляется автоматически и контролируется параметром.
Прикладной пример — перепись населения. Бюро публикует данные о доходах и составе семей по районам. Без защиты можно выделить семью с редкой профессией. С дифференциальной приватностью в каждый отчёт вносится дозированный шум: итоги по большой группе остаются точными, а детали одного домохозяйства становятся ненадёжными для атакующего. Так делают в переписях США и в статистике крупных технологических компаний.
Вывод: дифференциальная приватность — золотой стандарт, позволяющий извлекать пользу из больших данных, не превращая их в инструмент слежки. Она не идеальна, но даёт математическую честность: вы знаете, насколько сильно защищены.
Поделиться