Distillation temperature
Без неё ученик получил бы только сухие ответы вроде «кошка — 99%, а собака — 1%». С правильной же температурой он видит тонкие оттенки: собака всё‑таки похожа на кошку на 3%, а на волка на 8%. Именно эти оттенки несут знания. Температура — это регулятор подробности объяснения. Представьте учителя, который объясняет школьнику задачу. Если на вопрос «это кошка или собака?» он отвечает односложно «кошка», ученик мало чему научится. Но если учитель проговаривает: «Я колеблюсь, потому что уши длинноваты, а морда чуть слишком узкая для кошки» — ученик усвоит гораздо больше. Чем выше температура, тем более сглаженными становятся вероятности, тем больше сомнений транслирует учитель. Но перегибать нельзя: слишком высокая температура превращает объяснение в белый шум, а слишком низкая скрывает полезные нюансы.
Вот практический пример. Допустим, нужно создать компактную модель для распознавания рукописных цифр прямо на смартфоне. Большая нейросеть работает идеально, но слишком тяжела для телефона. При дистилляции с температурой 3 ученик видит, что «семёрка» с небольшой вероятностью похожа на «единицу» из‑за перекладины, и усваивает эту закономерность. В результате маленькая модель достигает почти той же точности, что и большая, а работает в десятки раз быстрее.
Итог прост: температура дистилляции — это тонкий рычаг, который балансирует между ясностью и детализацией. Правильно подобранная, она позволяет сжать громоздкую нейросеть в лёгкую без заметной потери качества.
Поделиться