глоссарий

Knowledge distillation teacher

Knowledge distillation teacher

Knowledge distillation teacher — это крупная нейросеть, которая выступает наставником для более компактной модели-ученика. При дистилляции знаний учитель не просто даёт верные ответы, а передаёт ученику распределение своих вероятностей по всем классам. Эти «мягкие» метки несут скрытую информацию о сходстве объектов: например, для кролика модель укажет и на зайца. Ученик, подражая такому поведению, усваивает связи глубже, чем при запоминании единственного правильного ответа.

Термин важен потому, что помогает решать задачу сжатия ИИ. Гигантские модели достигают высокой точности, но требуют огромных ресурсов. Учитель позволяет передать их знания маленькой модели, которая работает на смартфонах или в периферийных устройствах. Качество падает незначительно, зато скорость и энергоэффективность растут в разы.

Интуитивно процесс похож на обучение в школе: опытный педагог объясняет не только правильный ответ, но и ход рассуждений. В нейросетях этот «ход рассуждений» выражается в вероятностях. Ученик учится имитировать их, а параметр температуры делает распределение более «мягким», помогая увидеть важные различия между похожими классами.

Пример — голосовой ассистент на смартфоне. Большой учитель обучает маленькую сеть распознавать команды, после чего та запускается прямо на устройстве. Это позволяет работать без интернета и задержек, сохраняя точность, близкую к облачной модели.

В итоге knowledge distillation teacher — это инструмент переноса знаний нейросети в компактную форму. Он показывает: лучший способ сделать сложную систему практичной — передать её опыт достойному ученику.