Information gain
Зачем это важно? Без такой меры мы не знали бы, какие признаки действительно помогают модели, а какие лишь добавляют шум. Information gain позволяет отбирать информативные переменные, упрощает модель и снижает риск переобучения. Он также объясняет логику решения: мы видим, на чём основан выбор.
Как это работает на интуитивном уровне? Представьте, что вы угадываете, какая погода будет завтра. Если признак «облачность» уменьшает вашу неопределённость сильно — например, при сплошной облачности точно будет дождь, а при ясном небе — солнце, — выигрыш от этого признака велик. Если же признак «день недели» почти не влияет на прогноз, снижение неопределённости близко к нулю, и выигрыш мал. Формально неопределённость измеряется энтропией, а information gain — это разница энтропии до и после использования признака.
Прикладной пример: фильтрация спама. Пусть нам нужно разделить письма на «спам» и «не спам». До анализа любого слова энтропия высока: примерно половина писем — спам. Мы смотрим признак «содержит слово “бесплатно”». Оказалось, что из писем с этим словом 90% — спам, а без него 90% — обычные письма. Энтропия после разделения резко падает, значит, information gain высокий. Дерево решений поставит этот признак в корень, и дальнейшие проверки станут уже не так важны.
Итог: information gain — простой и мощный критерий выбора признаков, лежащий в основе многих классификаторов. Понимание этой меры помогает разобраться, почему модель принимает те или иные решения и как она отделяет сигнал от шума.
Поделиться