глоссарий

Feature distillation

Feature distillation

Feature distillation — это приём обучения нейросетей, при котором маленькая модель-«ученик» перенимает не только ответы, но и внутренние признаки большой модели-«учителя». Проще говоря, обычная дистилляция знаний сравнивает конечные предсказания, а дистилляция признаков заглядывает глубже — в промежуточные представления, подобно школьнику, которому объясняют не ответ, а способ решения. Зачем это нужно? Мощные нейросети требуют много ресурсов, а для смартфонов и бытовой техники нужны компактные аналоги. Данный метод сжимает знания большой сети в малую почти без потери качества. Как это работает? Обрабатывая данные, большая модель создаёт карты признаков — числа, кодирующие важные детали: линии, формы, контекст. Ученик во время обучения учится воспроизводить их, насколько позволяют его ограниченные возможности. В итоге он усваивает скрытые закономерности, а не просто запоминает ответы. Пример — распознавание лиц на телефоне. Модель-учитель, обученная на миллионах фотографий, различает мельчайшие нюансы внешности. Встроенный в устройство ученик, обучаясь на промежуточных слоях учителя, перенимает эти нюансы, сохраняя скорость и низкое энергопотребление. Так дистилляция признаков становится мостом между мощным «интеллектом» и практичностью, позволяя создавать быстрые и точные нейросети для повседневных задач.