глоссарий

Дифференциальная приватность

Дифференциальная приватность

Дифференциальная приватность — математическое определение приватности: результат анализа почти не меняется, если добавить или убрать одного человека. По итогам работы алгоритма нельзя достоверно понять, участвовал ли конкретный человек в исследовании. Это строгая гарантия с измеримым уровнем защиты.

Обычные методы обезличивания часто проваливаются: анонимные записи сопоставляют с внешними данными и раскрывают личность. Дифференциальная приватность решает проблему иначе: не прячет данные, а добавляет управляемый шум в механизм подсчёта. Даже зная всю информацию о других людях, злоумышленник не сможет сделать точный вывод о конкретном человеке.

Интуитивно это похоже на опрос с подбрасыванием монеты: орёл — отвечать честно, решка — всегда «да». Учёный видит общее число «да» и может исправить смещение на уровне группы, но не узнаёт ответ конкретного человека. Дифференциальная приватность — формальная и мощная версия такого «случайного ответа», где шум добавляется автоматически и контролируется параметром.

Прикладной пример — перепись населения. Бюро публикует данные о доходах и составе семей по районам. Без защиты можно выделить семью с редкой профессией. С дифференциальной приватностью в каждый отчёт вносится дозированный шум: итоги по большой группе остаются точными, а детали одного домохозяйства становятся ненадёжными для атакующего. Так делают в переписях США и в статистике крупных технологических компаний.

Вывод: дифференциальная приватность — золотой стандарт, позволяющий извлекать пользу из больших данных, не превращая их в инструмент слежки. Она не идеальна, но даёт математическую честность: вы знаете, насколько сильно защищены.