глоссарий

Out-of-bag

Out-of-bag

Out-of-bag (вне выборки, или «выпавшие из мешка») — это способ оценить качество модели машинного обучения, не тратя данные на отдельное проверочное множество. Когда случайный лес строит множество деревьев, каждое дерево обучается на случайной выборке с повторениями. В среднем около трети исходных примеров не попадает в эту выборку — они и остаются «вне мешка».

Важность термина в том, что без OOB пришлось бы выделять отдельный тестовый набор, а это роскошь: каждый размеченный пример ценен. OOB даёт той же модели честную оценку точности «бесплатно», прямо во время обучения. Более того, выборка вне мешка не контактирует с деревом, поэтому ошибка почти такая же, как на независимых данных, но без лишних вычислений.

Как это работает интуитивно? Представьте, что каждое дерево в лесу видело одних и тех же людей. Спроси у дерева про того, кого оно помнит, — ответ будет слишком оптимистичным. Но про того, кого оно впервые видит, оно судит объективно. OOB собирает такие оценки по всем деревьям: для каждого примера берутся предсказания только тех деревьев, которые его не видели, и усредняются. Так получается средняя ошибка на незнакомых данных.

Прикладной пример: банк предсказывает мошенничество по 100 тысяч транзакций. Каждое дерево обучалось примерно на 63 тысячам, а остальные 37 тысяч служили его личным тестом. Прогнав транзакции через «незнакомые» деревья, банк узнаёт, что модель ошибается лишь в 1,8% случаев, — и это без единого отложенного образца.

Краткий вывод: OOB — встроенная бесплатная перекрёстная проверка внутри случайного леса, экономящая данные и вычислительные ресурсы.