Sparse retrieval
Интуитивно это как гигантская картотека: для каждого слова есть карточка. Когда приходит книга, библиотекарь записывает её номер на все нужные карточки. По запросу система берёт слова, находит карточки и пересекает списки номеров. Чем больше совпадений и чем они реже, тем выше вес документа. Работа идёт только с ненулевыми ячейками, пустые области игнорируются.
Пример: исследователь ищет «шумоподавление в глубоких нейронных сетях». Система разбивает запрос на слова, находит документы с этими словами и ранжирует по числу совпадений, частоте и важности слов. Статья о «нейронных механизмах памяти» не попадёт в выдачу — точного совпадения нет.
Вывод: разреженный поиск прозрачен и эффективен, но не понимает синонимы и смысл. Поэтому в современных системах его часто комбинируют с нейросетевыми dense-методами, чтобы находить и точные, и смысловые совпадения. Но там, где важна каждая буква — юриспруденция, код, медицина, — он остаётся незаменимым.
Поделиться