Knowledge distillation online
Смысл — сделать сильные нейросети доступными для слабых устройств. Полноразмерная модель часто не помещается в смартфон или камеру. Online-версия экономит время: не нужен отдельный этап подготовки учителя, обучение идёт с нуля. Совместное развитие добавляет разнообразия в обучающие сигналы, и иногда ученик даже обгоняет учителя.
Интуитивно это как профессор и студент, вместе решающие сложные задачи. Профессор объясняет рассуждения, студент пробует отвечать; оба сверяются с учебником и друг с другом. Профессор видит, где студент путается, и меняет объяснения. Студент впитывает стиль мышления, включая нюансы, которых нет в учебнике. В нейросетях «объяснения» — это распределения вероятностей по классам: для рукописной тройки учитель может дать 0,7 на «3» и 0,2 на «8», подсказывая их сходство.
Пример: автоматическая диктовка на смартфоне. На сервере работает большая языковая модель, на телефоне — маленькая. Они учатся вместе на потоке голосовых записей. Маленькая мгновенно реагирует на речь и отправляет ошибки на сервер, а сервер, зная контекст, корректирует её логику. Через несколько дней компактная модель распознаёт команды почти так же точно, как гигантская, работая локально и без интернета.
Краткий вывод: online-дистилляция — прагматичный способ сжимать знания прямо в процессе обучения. Она сокращает затраты, приближает модели к пользователям и особенно полезна там, где нельзя долго ждать готового учителя и данные постоянно обновляются.
Поделиться