глоссарий

Sparse retrieval

Sparse retrieval

Разреженный поиск — это поиск, при котором запрос и документы превращаются в очень длинные, но почти пустые списки чисел. Каждая позиция в списке соответствует конкретному слову: например, для «кот» — своя ячейка, для «планета» — своя. Если слово есть в тексте, в ячейку ставится частота, если нет — ноль. Нулей почти всегда большинство, поэтому вектор называется разреженным. На этом методе построены классические поисковики, юридические базы и корпоративные хранилища. Он быстрый и понятный: вы ищете точные слова и получаете тексты, где они есть.

Интуитивно это как гигантская картотека: для каждого слова есть карточка. Когда приходит книга, библиотекарь записывает её номер на все нужные карточки. По запросу система берёт слова, находит карточки и пересекает списки номеров. Чем больше совпадений и чем они реже, тем выше вес документа. Работа идёт только с ненулевыми ячейками, пустые области игнорируются.

Пример: исследователь ищет «шумоподавление в глубоких нейронных сетях». Система разбивает запрос на слова, находит документы с этими словами и ранжирует по числу совпадений, частоте и важности слов. Статья о «нейронных механизмах памяти» не попадёт в выдачу — точного совпадения нет.

Вывод: разреженный поиск прозрачен и эффективен, но не понимает синонимы и смысл. Поэтому в современных системах его часто комбинируют с нейросетевыми dense-методами, чтобы находить и точные, и смысловые совпадения. Но там, где важна каждая буква — юриспруденция, код, медицина, — он остаётся незаменимым.