глоссарий

Model soup

Model soup

Model soup — приём в ML, когда вместо выбора одной лучшей модели берут среднее весов нескольких сетей, обученных с разными параметрами. Термин предложили в Google в 2022 году. Усредняя веса готовых моделей, мы получаем более устойчивого и обобщающего «общего игрока», чем любой участник по отдельности. Это дёшево: не нужно перезапускать обучение, достаточно сложить и поделить веса.

Обычный подход — выбрать модель с максимальной точностью на проверочных данных, но она часто переобучается под конкретные примеры. Model soup решает проблему: усреднение сглаживает случайные отклонения. Интуиция: если каждая модель — точка на склоне ущелья (минимум ошибок), то среднее арифметическое точек скорее окажется ближе к центру ущелья, а не на краю выступа. Главное — модели должны быть похожи (например, тонко настроены от одного предобученного основания), иначе среднее превратится в кашу.

Пример: при распознавании изображений команда обучает сеть с разными схемами аугментации и скоростями обучения. Все сети дают около 92% точности. Вместо выбора одной лучшей (92,5%) берут десять моделей и усредняют их веса — итоговая «смесь» даёт 93,8% и стабильнее работает на новых данных. Это почти бесплатный бонус без дополнительных вычислений при использовании.

Вывод: Model soup — элегантный способ выжать дополнительную точность без усложнения архитектуры. Простое усреднение весов даёт более надёжную и обобщающую модель, и этот приём легко добавить в любую практику ИИ.