GELU
GELU улучшила обучение современных трансформеров (BERT, GPT). Она учитывает не только знак входа, но и его величину: чем сильнее отрицательное значение, тем больше подавление. Такое поведение ближе к биологическим нейронам и помогает передавать нюансы, что важно для текста и изображений.
Интуитивно GELU — «вероятностный фильтр». Для каждого значения нейрон оценивает, похоже ли оно на полезный сигнал. Очень отрицательные почти не проходят, но не полностью; около нуля — пропускается лишь часть; большие положительные проходят почти без изменений. Плавность не даёт градиентам «затухать» или «взрываться», делая обучение стабильнее.
Пример: в машинном переводе GELU стоит в промежуточных слоях. Она сохраняет слабые контекстные намёки (иронию, отрицание), которые ReLU занулила бы и потеряла.
Итог: GELU — простое и гибкое улучшение активаций, ставшее стандартом для трансформеров. Она даёт заметный прирост качества без сложных вычислений. Понимание этого термина показывает, как небольшие математические хитрости решают большие проблемы обучения.
Поделиться