Седловая точка
Почему это проблема? Методы оптимизации, такие как градиентный спуск, двигаются к наименьшему значению ошибки, но в седловой точке градиент становится нулевым: алгоритм «не знает», куда идти, и может застрять надолго. При этом в отличие от минимума, седловая точка не является решением — это лишь неустойчивая «ловушка». Поэтому современные методы обучения специально добавляют шум или используют импульс, чтобы проскочить такие участки.
Прикладной пример — обучение распознаванию изображений. Сотни тысяч параметров нейросети образуют пространство, в котором седловых точек гораздо больше, чем настоящих минимумов. Исследователи показали, что именно седловые точки, а не локальные минимумы, вызывают замедление обучения на ранних этапах. Применение адаптивных оптимизаторов, например Adam, позволяет эффективно обходить эти «перевалы».
Короткий вывод: седловая точка — ключевое понятие для понимания сложности оптимизации. Она напоминает нам, что нулевой градиент далеко не всегда означает достижение цели, и что умение отличать «седло» от «ямы» важно на практике.
Поделиться