Undersampling
Зачем это важно? В реальных приложениях редкие события часто важнее массовых. Банковская транзакция с мошенничеством встречается в одном случае из тысячи, но именно её нужно выловить. Если дать нейросети сырые данные, она «увидит» почти только честные операции и решит, что мошенничество — статистический шум. После андерсэмплинга модель учится на сбалансированной выборке, где мошенничество встречается в половине случаев, и может уловить его закономерности. Конечно, выбрасывание части данных — грубое решение: можно потерять полезную информацию. Но на практике этот метод прост, быстр и служит отправной точкой для более изощрённых алгоритмов вроде синтетической генерации примеров.
Главная идея — заставить алгоритм обратить внимание на меньшинство. Модель работает как студент: если в учебнике одна страница про собак и девяносто девять про кошек, он вызубрит только про кошек. Убрав лишние страницы, вы заставляете его изучить и остальной материал. После обучения на отбалансированных данных модель возвращают на реальные пропорции и подбирают порог срабатывания, чтобы не было ложных тревог. В итоге андерсэмплинг — это осознанная потеря объёма данных ради выравнивания внимания модели, и он часто спасает там, где точность важнее полноты.
Поделиться