глоссарий

RMSNorm

RMSNorm

RMSNorm расшифровывается как Root Mean Square Normalization — нормировка по среднеквадратичному значению. Это простой способ стабилизировать нейросети: сигналы, проходящие через слои, приводятся к единому масштабу, чтобы сеть обучалась быстрее и точнее.

Без нормировки возникает «сдвиг распределений»: данные на входе слоёв меняют форму, замедляя сходимость. BatchNorm решает это, но требует статистики по целой партии примеров, что неудобно для текстов переменной длины. RMSNorm обходит ограничение: масштаб оценивается только по текущему вектору. Каждый элемент возводится в квадрат, берётся среднее, извлекается корень — получается масштаб, на который делятся элементы. Затем добавляются два обучаемых параметра — сдвиг и масштаб, чтобы сеть сама регулировала степень нормировки.

Интуитивно это похоже на автогромкость в наушниках: сигнал — тихий или громкий — выравнивается до комфортного уровня, а пользователь может подстроить тембр. Операция лёгкая: не нужно хранить статистики по всей партии, достаточно посчитать средний квадрат для каждого вектора отдельно. Поэтому RMSNorm идеален для больших языковых моделей и последовательностей разной длины.

Именно RMSNorm применяется в LLaMA и некоторых версиях GPT. Когда вы обращаетесь к чат-боту, внутри сотен преобразований RMSNorm мгновенно выравнивает числовые потоки, не давая модели сбиться даже при глубокой архитектуре. Это делает обучение стабильнее, вычисления — быстрее, экономя энергию и время.

RMSNorm — минимализм в инженерии ИИ: небольшая формула решает большую проблему нестабильности. Сегодня почти ни одна современная языковая модель не обходится без неё. Поняв этот принцип, вы поймёте, почему нейросети становятся умнее и компактнее.