Локальный минимум
Представьте, что вы стоите в туманных горах и хотите спуститься к самому низкому месту в долине. Видите только несколько метров вокруг. Вы идёте вниз, пока не оказываетесь в небольшой впадине. Дальше идти некуда — везде подъём. Но это лишь локальный минимум: если бы вы видели больше, то заметили бы, что совсем рядом есть более глубокий спуск. То же самое происходит с обучением нейросети: градиентный спуск ведёт её вниз по ошибке, но если она попала в локальный минимум, градиент становится нулевым и движение останавливается.
Пример: нейросеть, обучаемая распознавать рукописные цифры, на первых эпохах быстро снижает ошибку до 20%, а затем застревает — это локальный минимум. Чтобы выйти, применяют стохастический метод, «встряску» параметров или увеличение шага обучения. Эти приёмы позволяют перескочить неглубокую яму и продолжить спуск к лучшему результату.
Таким образом, локальный минимум — важное понятие: оно объясняет, почему обучение ИИ иногда застревает и почему инженеры разрабатывают хитрые методы, чтобы алгоритмы не останавливались на полпути, а искали по-настоящему хорошее решение.
Поделиться