глоссарий

SMOTE

SMOTE

SMOTE (расшифровывается как Synthetic Minority Over-sampling Technique) — это алгоритм искусственного интеллекта, который создаёт искусственные примеры данных для редкого класса. Проще говоря, если в вашей выборке один тип событий встречается очень редко, SMOTE «придумывает» новые похожие случаи, чтобы модель лучше их распознавала.

Почему это важно? В реальных задачах часто встречается дисбаланс классов: например, случаев мошенничества в банке — тысячные доли процента, а честных операций — миллионы. Обычная модель обучится игнорировать редкий класс, ведь так она получает минимальную ошибку. Но именно редкие случаи обычно и важны. SMOTE помогает сбалансировать данные, не выбрасывая ценные настоящие примеры, а генерируя новые синтетические.

Как это работает интуитивно? Представьте, что редкие объекты — точки на плоскости, разбросанные кучками. SMOTE выбирает одного «соседа» из этой кучки и проводит между ними отрезок. На этом отрезке алгоритм случайно ставит новую точку — она становится искусственным примером. Повторяя операцию много раз, вы получаете более плотное «облако» редкого класса, по которому модель учится точнее.

Пример из жизни: банк строит модель для выявления подозрительных транзакций. У него всего 50 реальных случаев мошенничества на 100 тысяч обычных операций. SMOTE создаёт ещё, скажем, 950 синтетических случаев, делая класс «мошенничество» достаточно представленным. Модель учится на этих данных и лучше находит настоящие атаки, а не пропускает их.

Вывод: SMOTE — эффективный способ борьбы с дисбалансом классов, когда не хватает редких примеров. Он не создаёт новую информацию, но помогает алгоритму увидеть закономерности, которые иначе остались бы скрытыми. Главное — использовать его аккуратно, чтобы не генерировать слишком много шума.