ReLU
Важность: предыдущие активации (сигмоида, тангенс) насыщаются при больших значениях, их производная почти нулевая, поэтому градиенты затухают. ReLU не имеет этого недостатка для положительной области: её производная всегда один, поэтому сигнал ошибки легко проходит через слои. Это позволяет строить очень глубокие сети и обучать их быстрее.
Интуитивно: ReLU действует как ворота. Положительный сигнал проходит без изменений, отрицательный обнуляется. Нейросеть сама подбирает веса, чтобы нужные признаки давали положительный отклик, а лишние — отрицательный, и они отсекались.
Пример: при распознавании изображений, например дорожных знаков, свёрточные слои находят края и текстуры. Сразу после них стоит ReLU. Положительные значения соответствуют наличию искомого признака, отрицательные — его отсутствию. ReLU пропускает только положительные, помогая сети выделять значимые детали.
Итог: ReLU проста, эффективна и решает проблему затухания градиента. Её варианты (Leaky ReLU, ELU) улучшают оригинал, но базовая функция остаётся стандартом во многих современных архитектурах.
Поделиться