глоссарий

Случайный лес

Случайный лес

Случайный лес — это алгоритм машинного обучения, который строит множество решающих деревьев и объединяет их прогнозы. Каждое дерево обучается на своей случайной подвыборке исходных данных и при каждом разбиении рассматривает лишь случайную часть признаков. Ответ модели определяется голосованием (для классификации) или средним значением (для регрессии). Своё название метод получил из-за метафоры: множество деревьев образуют лес, а элемент случайности отличает его от простого объединения деревьев. Метод важен, поскольку сочетает простоту использования с высокой точностью: он почти не требует настройки гиперпараметров, устойчив к выбросам, не переобучается даже на больших наборах данных и позволяет оценить вклад каждого признака. Это делает модель востребованной там, где важна объяснимость, например, в медицине и финансах. На интуитивном уровне лес похож на консилиум врачей: один специалист может ошибиться из-за шума, неполных данных или предвзятости, но если опросить сотню независимых экспертов и выбрать самый частый диагноз, вероятность коллективной ошибки резко падает. Случайность в выборе строк и столбцов делает деревья некоррелированными, поэтому их ошибки не совпадают и взаимно компенсируются. Прикладной пример: банки применяют случайный лес для скоринга — оценки кредитоспособности клиента. Подав на вход возраст, доход, кредитную историю и сумму запроса, модель возвращает вероятность дефолта, что позволяет автоматически одобрять или отклонять заявки в режиме реального времени. Модель также объясняет, какие факторы повлияли на решение, что помогает соблюдать требования регуляторов. Вывод: случайный лес — это мощный и надёжный «рабочий конь» ИИ, который стоит попробовать первым, когда нужно получить точный результат при ограниченном времени на эксперименты.