Model soup
Обычный подход — выбрать модель с максимальной точностью на проверочных данных, но она часто переобучается под конкретные примеры. Model soup решает проблему: усреднение сглаживает случайные отклонения. Интуиция: если каждая модель — точка на склоне ущелья (минимум ошибок), то среднее арифметическое точек скорее окажется ближе к центру ущелья, а не на краю выступа. Главное — модели должны быть похожи (например, тонко настроены от одного предобученного основания), иначе среднее превратится в кашу.
Пример: при распознавании изображений команда обучает сеть с разными схемами аугментации и скоростями обучения. Все сети дают около 92% точности. Вместо выбора одной лучшей (92,5%) берут десять моделей и усредняют их веса — итоговая «смесь» даёт 93,8% и стабильнее работает на новых данных. Это почти бесплатный бонус без дополнительных вычислений при использовании.
Вывод: Model soup — элегантный способ выжать дополнительную точность без усложнения архитектуры. Простое усреднение весов даёт более надёжную и обобщающую модель, и этот приём легко добавить в любую практику ИИ.
Поделиться