Checkpoint averaging
Суть проста: не брать финальные веса, а сделать несколько «фотографий» модели — например, за последние десять эпох — и вычислить их среднее арифметическое. Интуиция: отдельные выстрелы по мишени разбросаны, но центр их скопления ближе к «яблочку», чем любой случайный выстрел. Веса — точка в многомерном пространстве; шаги обучения дрожат вокруг хорошего решения, усреднение гасит дрожание и даёт более надёжную точку.
Зачем это важно? Ландшафт функции ошибки изрезан оврагами. Модель может «упасть» в узкую яму с отличной точностью на обучающей выборке, но плохо работать на новых данных. Усреднение точек из конца обучения, когда ошибка стабилизировалась, даёт более широкий и пологий минимум. Такая модель менее чувствительна к переобучению и шуму. Это почти бесплатный способ улучшить качество без изменения архитектуры или данных.
Пример: при обучении большой языковой модели инженеры сохраняют чекпойнты после каждой эпохи. Вместо последнего берут пять-десять финальных снимков и усредняют веса. Модель генерирует более связные тексты и лучше отвечает на редкие вопросы. Приём работает и при дообучении на маленьких наборах, где каждый процент точности решает судьбу проекта.
Коротко: усреднение контрольных точек — это способ сказать нейросети «не будь экстремистом, используй коллективный опыт». Простой, надёжный, эффективный инструмент для каждого инженера.
Поделиться