глоссарий

Information gain

Information gain

Информационный выигрыш (Information Gain) — это мера того, насколько хорошо один признак уменьшает неопределённость при предсказании целевой величины. В машинном обучении он служит главным критерием при построении деревьев решений: алгоритм последовательно выбирает те признаки, которые дают максимальный выигрыш, то есть лучше всего разделяют данные по классам.

Зачем это важно? Без такой меры мы не знали бы, какие признаки действительно помогают модели, а какие лишь добавляют шум. Information gain позволяет отбирать информативные переменные, упрощает модель и снижает риск переобучения. Он также объясняет логику решения: мы видим, на чём основан выбор.

Как это работает на интуитивном уровне? Представьте, что вы угадываете, какая погода будет завтра. Если признак «облачность» уменьшает вашу неопределённость сильно — например, при сплошной облачности точно будет дождь, а при ясном небе — солнце, — выигрыш от этого признака велик. Если же признак «день недели» почти не влияет на прогноз, снижение неопределённости близко к нулю, и выигрыш мал. Формально неопределённость измеряется энтропией, а information gain — это разница энтропии до и после использования признака.

Прикладной пример: фильтрация спама. Пусть нам нужно разделить письма на «спам» и «не спам». До анализа любого слова энтропия высока: примерно половина писем — спам. Мы смотрим признак «содержит слово “бесплатно”». Оказалось, что из писем с этим словом 90% — спам, а без него 90% — обычные письма. Энтропия после разделения резко падает, значит, information gain высокий. Дерево решений поставит этот признак в корень, и дальнейшие проверки станут уже не так важны.

Итог: information gain — простой и мощный критерий выбора признаков, лежащий в основе многих классификаторов. Понимание этой меры помогает разобраться, почему модель принимает те или иные решения и как она отделяет сигнал от шума.