глоссарий

ReLU

ReLU

ReLU (выпрямленная линейная единица) — функция активации нейросетей: возвращает ноль для отрицательных аргументов и сам аргумент для положительных. Несмотря на простоту, она стала основой глубокого обучения.

Важность: предыдущие активации (сигмоида, тангенс) насыщаются при больших значениях, их производная почти нулевая, поэтому градиенты затухают. ReLU не имеет этого недостатка для положительной области: её производная всегда один, поэтому сигнал ошибки легко проходит через слои. Это позволяет строить очень глубокие сети и обучать их быстрее.

Интуитивно: ReLU действует как ворота. Положительный сигнал проходит без изменений, отрицательный обнуляется. Нейросеть сама подбирает веса, чтобы нужные признаки давали положительный отклик, а лишние — отрицательный, и они отсекались.

Пример: при распознавании изображений, например дорожных знаков, свёрточные слои находят края и текстуры. Сразу после них стоит ReLU. Положительные значения соответствуют наличию искомого признака, отрицательные — его отсутствию. ReLU пропускает только положительные, помогая сети выделять значимые детали.

Итог: ReLU проста, эффективна и решает проблему затухания градиента. Её варианты (Leaky ReLU, ELU) улучшают оригинал, но базовая функция остаётся стандартом во многих современных архитектурах.