глоссарий

Layer Normalization

Layer Normalization

Слой-нормализация (Layer Normalization) — это приём, который стабилизирует работу нейросетей, приводя значения в каждом слое к единому масштабу. Если сеть учится распознавать образы или речь, её внутренние сигналы постоянно меняются, и без нормализации процесс обучения становится медленным и капризным. Метод важен: он позволяет строить большие модели — трансформеры, лежащие в основе современных языковых ассистентов. Идея проста: для каждого отдельного примера вычисляются среднее и стандартное отклонение всех нейронов слоя, затем значения вычитаются от среднего и делятся на отклонение. В результате сигналы слоя превращаются в аккуратный набор чисел вокруг нуля с единичным разбросом. Это помогает сети не «застревать» в хаотичных состояниях при обучении.

Представьте, что вы настраиваете диктофон: если звук слишком громкий или слишком тихий, автоматика выравнивает уровень до комфортного. Нейросеть делает то же самое с числами. В отличие от пакетной нормализации, которая опирается на статистику целой группы примеров, слой-нормализация смотрит только на один текущий пример, что удобно при обработке предложений или изображений по одному. Например, при машинном переводе модель переводит фразу «Лето жаркое», и каждый слой переводчика нормализует свои скрытые состояния, чтобы следующее слово — «жаркое» или «солнечное» — было выбрано с учётом стабильных характеристик. Без этого шага даже средняя модель могла бы показать нестабильные результаты. В итоге Layer Normalization — это невидимый стабилизатор, который позволяет нейросетям учиться быстрее, стабильнее и увереннее.