Out-of-bag
Важность термина в том, что без OOB пришлось бы выделять отдельный тестовый набор, а это роскошь: каждый размеченный пример ценен. OOB даёт той же модели честную оценку точности «бесплатно», прямо во время обучения. Более того, выборка вне мешка не контактирует с деревом, поэтому ошибка почти такая же, как на независимых данных, но без лишних вычислений.
Как это работает интуитивно? Представьте, что каждое дерево в лесу видело одних и тех же людей. Спроси у дерева про того, кого оно помнит, — ответ будет слишком оптимистичным. Но про того, кого оно впервые видит, оно судит объективно. OOB собирает такие оценки по всем деревьям: для каждого примера берутся предсказания только тех деревьев, которые его не видели, и усредняются. Так получается средняя ошибка на незнакомых данных.
Прикладной пример: банк предсказывает мошенничество по 100 тысяч транзакций. Каждое дерево обучалось примерно на 63 тысячам, а остальные 37 тысяч служили его личным тестом. Прогнав транзакции через «незнакомые» деревья, банк узнаёт, что модель ошибается лишь в 1,8% случаев, — и это без единого отложенного образца.
Краткий вывод: OOB — встроенная бесплатная перекрёстная проверка внутри случайного леса, экономящая данные и вычислительные ресурсы.
Поделиться