глоссарий

Локальный минимум

Локальный минимум

Локальный минимум — это точка на графике функции, где значение меньше, чем у всех ближайших соседей, но при этом не обязательно является самым маленьким значением функции в целом. В машинном обучении такая функция обычно называется функцией потерь: она показывает, насколько ошибался алгоритм. Задача обучения — найти её глобальный минимум, но на практике алгоритм часто застревает в локальных минимумах, что мешает достичь высокой точности.

Представьте, что вы стоите в туманных горах и хотите спуститься к самому низкому месту в долине. Видите только несколько метров вокруг. Вы идёте вниз, пока не оказываетесь в небольшой впадине. Дальше идти некуда — везде подъём. Но это лишь локальный минимум: если бы вы видели больше, то заметили бы, что совсем рядом есть более глубокий спуск. То же самое происходит с обучением нейросети: градиентный спуск ведёт её вниз по ошибке, но если она попала в локальный минимум, градиент становится нулевым и движение останавливается.

Пример: нейросеть, обучаемая распознавать рукописные цифры, на первых эпохах быстро снижает ошибку до 20%, а затем застревает — это локальный минимум. Чтобы выйти, применяют стохастический метод, «встряску» параметров или увеличение шага обучения. Эти приёмы позволяют перескочить неглубокую яму и продолжить спуск к лучшему результату.

Таким образом, локальный минимум — важное понятие: оно объясняет, почему обучение ИИ иногда застревает и почему инженеры разрабатывают хитрые методы, чтобы алгоритмы не останавливались на полпути, а искали по-настоящему хорошее решение.