глоссарий

TF-IDF

TF-IDF

TF-IDF — это формула, которая показывает, насколько слово важно для конкретного документа в наборе текстов. Расшифровка: Term Frequency — Inverse Document Frequency, то есть «частота термина × обратная частота документа». Проще говоря, она отделяет ключевые слова от словесного мусора.

Зачем это нужно? Поисковик или алгоритм анализа не читает текст как человек, ему нужна числовая мера значимости слов. TF-IDF её даёт: отсеивает союзы и предлоги, которые встречаются везде, и выделяет редкие содержательные термины, характеризующие текст. Без этого поиск был бы хаотичным — алгоритм не отличил бы статью про яблоки от статьи про программирование.

Как это работает? Частота термина (TF) — это сколько раз слово встречается в статье, делённое на общее число слов в ней. Обратная частота документа (IDF) — логарифм от общего числа статей, делённого на число статей, где встречается слово. Например, если «кот» есть в половине статей, его IDF небольшой, а редкий «барсук» получает высокий IDF. Умножаем TF на IDF — и редкое слово, частое в конкретном тексте, получает огромный вес, а универсальное — почти нулевой.

Пример: ищем статьи о выдрах. Статья А десять раз пишет «выдра» и ни разу — «кошка». Статья Б пятьдесят раз упоминает «кошку» и один раз «выдру» в примечании. TF-IDF сразу покажет, что статья А релевантнее запросу «выдра», потому что там это слово и частое, и характерное. Поисковик поставит её на первое место.

Итог: TF-IDF — простой мощный инструмент ранжирования, основа многих поисковых и рекомендательных систем. Он работает без сложного машинного обучения, но ясно показывает алгоритму, какие слова определяют суть документа.