глоссарий

Split learning

Split learning

Split learning (обучение с разделением) — подход в ИИ, позволяющий нескольким участникам совместно обучать общую модель, не собирая все данные в одном месте. Вместо сырых данных каждый передаёт только промежуточные результаты вычислений, которые сами по себе не раскрывают информацию. Это напоминает написание книги в соавторстве: каждый работает над своей главой дома, а коллегам отправляет краткое резюме сюжета. По резюме можно согласовать общую линию, но нельзя восстановить исходный текст. Так и здесь: части нейросети живут на устройствах разных владельцев, между ними проходят лишь «сжатые» векторы признаков, а не сами данные.

Зачем это нужно? Данные о людях, документах или производстве часто чувствительны, поэтому нельзя просто отправить их на центральный сервер. Клиники, банки и промышленные компании обязаны защищать приватность. Split learning даёт золотую середину: выгода от большой обучающей выборки без раскрытия её содержимого. Плюс снижается нагрузка на сеть — передавать небольшие векторы дешевле, чем терабайты информации.

Прикладной пример: несколько больниц хотят обучить модель диагностики рака по снимкам. Каждая хранит свои изображения локально. Первые слои нейросети обрабатывают снимок в каждой больнице, затем промежуточный результат уходит на общий сервер, где модель достраивает диагноз. Сервер не видит сами изображения — только абстрактные признаки. В итоге модель обучена на огромном массиве данных и ставит диагноз точнее, чем любая отдельная больница, а конфиденциальность пациентов сохранена.

Таким образом, split learning — это способ объединять знания разных организаций, защищая данные. По мере роста требований к приватности он становится важным инструментом для ИИ, который умеет сотрудничать, но не подглядывать.