глоссарий

Momentum

Momentum

Momentum — это метод оптимизации, ускоряющий обучение нейросетей. Обычный градиентный спуск движется к минимуму ошибки мелкими дрожащими шагами, а momentum добавляет «инерцию»: прошлые направления обновлений продолжают влиять на новые, как если бы у шарика была масса. Результат — сглаживание колебаний и более быстрый спуск по оврагу функции потерь.

Без momentum обучение больших моделей часто буксует: градиенты конфликтуют, и алгоритм петляет, особенно в каньонообразных ландшафтах, где склоны круты в одну сторону и пологи в другую. Инерция помогает проскакивать мелкие препятствия, сокращает зигзаги и экономит часы вычислений, повышая качество модели.

Представьте шарик, катящийся по неровной поверхности: он накапливает скорость и не останавливается на бугорках. Так же momentum накапливает вектор скорости из прошлых обновлений. Когда градиент меняет направление, скорость сохраняет старое движение, а не разворачивается мгновенно. Математически это добавление доли предыдущего шага (обычно около 0.9) к текущему градиенту. Траектория становится плавной и целенаправленной.

На практике, например, при распознавании рукописных цифр без momentum точность после эпох долго колеблется, а с ним сеть достигает того же результата к пятой эпохе, что раньше к двадцатой. Поэтому momentum — стандартная опция в TensorFlow и PyTorch.

Итог: momentum — это инерция для обучения. Он не меняет суть градиентного спуска, но делает его быстрее и надёжнее, позволяя нейросети учиться с памятью о предыдущих шагах — критично важно для огромных моделей.