SiLU
Почему это важно? В глубоком обучении активация решает, насколько стабильно обучается сеть. SiLU даёт плавный градиент во всей области определения, поэтому сеть реже страдает от «затухания» сигналов при обратном распространении ошибки. Сейчас это стандарт во многих больших языковых моделях.
Интуитивно SiLU напоминает ручку громкости с мягкой характеристикой: тихие звуки почти не слышны, но не исчезают полностью, а громкие — не искажаются. При этом функция остаётся дифференцируемой, что важно для обучения. В отличие от ReLU, которая безжалостно обнуляет всё отрицательное, SiLU бережно оставляет маленький «хвостик» отрицательной информации.
Прикладной пример: при анализе тональности отзывов сеть может встретить фразу «фильм не плохой». Слово «не» имеет отрицательный вес. ReLU выбросила бы его как мусор, а SiLU сохранила слабый сигнал, позволяя модели уловить двойное отрицание.
Итог: SiLU — элегантный компромисс между линейностью и нелинейностью. Её плавность делает обучение устойчивым, а выразительности хватает для самых разных задач современного ИИ.
Поделиться