TF-IDF
Зачем это нужно? Поисковик или алгоритм анализа не читает текст как человек, ему нужна числовая мера значимости слов. TF-IDF её даёт: отсеивает союзы и предлоги, которые встречаются везде, и выделяет редкие содержательные термины, характеризующие текст. Без этого поиск был бы хаотичным — алгоритм не отличил бы статью про яблоки от статьи про программирование.
Как это работает? Частота термина (TF) — это сколько раз слово встречается в статье, делённое на общее число слов в ней. Обратная частота документа (IDF) — логарифм от общего числа статей, делённого на число статей, где встречается слово. Например, если «кот» есть в половине статей, его IDF небольшой, а редкий «барсук» получает высокий IDF. Умножаем TF на IDF — и редкое слово, частое в конкретном тексте, получает огромный вес, а универсальное — почти нулевой.
Пример: ищем статьи о выдрах. Статья А десять раз пишет «выдра» и ни разу — «кошка». Статья Б пятьдесят раз упоминает «кошку» и один раз «выдру» в примечании. TF-IDF сразу покажет, что статья А релевантнее запросу «выдра», потому что там это слово и частое, и характерное. Поисковик поставит её на первое место.
Итог: TF-IDF — простой мощный инструмент ранжирования, основа многих поисковых и рекомендательных систем. Он работает без сложного машинного обучения, но ясно показывает алгоритму, какие слова определяют суть документа.
Поделиться