RMSNorm
Без нормировки возникает «сдвиг распределений»: данные на входе слоёв меняют форму, замедляя сходимость. BatchNorm решает это, но требует статистики по целой партии примеров, что неудобно для текстов переменной длины. RMSNorm обходит ограничение: масштаб оценивается только по текущему вектору. Каждый элемент возводится в квадрат, берётся среднее, извлекается корень — получается масштаб, на который делятся элементы. Затем добавляются два обучаемых параметра — сдвиг и масштаб, чтобы сеть сама регулировала степень нормировки.
Интуитивно это похоже на автогромкость в наушниках: сигнал — тихий или громкий — выравнивается до комфортного уровня, а пользователь может подстроить тембр. Операция лёгкая: не нужно хранить статистики по всей партии, достаточно посчитать средний квадрат для каждого вектора отдельно. Поэтому RMSNorm идеален для больших языковых моделей и последовательностей разной длины.
Именно RMSNorm применяется в LLaMA и некоторых версиях GPT. Когда вы обращаетесь к чат-боту, внутри сотен преобразований RMSNorm мгновенно выравнивает числовые потоки, не давая модели сбиться даже при глубокой архитектуре. Это делает обучение стабильнее, вычисления — быстрее, экономя энергию и время.
RMSNorm — минимализм в инженерии ИИ: небольшая формула решает большую проблему нестабильности. Сегодня почти ни одна современная языковая модель не обходится без неё. Поняв этот принцип, вы поймёте, почему нейросети становятся умнее и компактнее.
Поделиться