Hypothetical document embeddings
Зачем это нужно? Люди формулируют запросы не так, как написаны документы. Вы спрашиваете «как вернуть деньги за бракованный товар», а в инструкции написано «порядок расторжения договора купли-продажи». Классический поиск по ключевым словам тут пасует, а embeddings, обученные на смысловой близости, всё равно могут ошибиться. Гипотетический документ решает проблему: модель генерирует его так, чтобы он был похож на тот фрагмент, который должен существовать в базе. Это сближает стиль вопроса и стиль ответа.
Представьте, что вы в библиотеке ищете книгу про астрономию, но не помните названия. Библиотекарь не бегает по полкам с вашим вопросом, а мысленно сочиняет аннотацию такой книги: «звёзды, планеты, галактики, телескопы». С этой воображаемой аннотацией он ищет совпадения. Так работает метод: модель по запросу строит семантическую «заглушку», которая заполняет разрыв между языком пользователя и языком документов.
Пример из практики: в поиске по медицинским статьям человек пишет «что делать при ожоге кипятком». Модель генерирует гипотетический текст о первой помощи, термических травмах и охлаждении кожи. Вектор этого текста оказывается рядом с реальными статьями о лечении ожогов, хотя слово «кипяток» в них может не встречаться. Без этого шага поиск выдал бы только страницы с точным совпадением, а так пользователь получает нужное руководство.
Вывод: гипотетические эмбеддинги — это умный мост между запросом и документом. Они заставляют модель «додумывать» контекст, что делает поиск гораздо точнее, особенно когда вопрос короткий, а ответ скрыт за другими терминами.
Поделиться