HyDE
глоссарий

HyDE

HyDE

HyDE — приём в поиске информации: система не ищет сразу по запросу, а сначала генерирует гипотетический документ, который мог бы содержать ответ, и затем ищет похожие на него. Название расшифровывается как Hypothetical Document Embeddings — «гипотетические векторные представления документа». Необходимость в HyDE возникает из-за пропасти между коротким запросом и развёрнутым текстом. Например, человек спрашивает «как бросить курить», а в полезной статье написано «никотиновая зависимость и когнитивная терапия» — слова разные, смысл общий, но эмбеддинги слабо пересекаются. HyDE перепрыгивает эту пропасть.

Интуитивно это работает так: представьте огромную библиотеку, где библиотекарь не может искать по короткому вопросу. Вы просите его сформулировать, как выглядела бы целая глава с ответом, а затем найти похожие. Библиотекарь пишет вымышленный текст, извлекает из него суть и ищет по ней. Ключевая идея: сгенерированный текст не обязан быть фактологичным — он должен быть ближе по стилю и структуре к целевым документам. Тогда векторная близость становится надёжной.

Пример: медицинский чат-бот. Пациент спрашивает «можно ли пить кофе при гипертонии?». HyDE-модуль создаёт гипотетический ответ: «Влияние кофеина на артериальное давление при хронической гипертензии». Система ищет близкие эмбеддинги в базе научных статей и находит релевантные работы, даже если в них нет слов «пить» или «гипертония». В итоге ответ подкреплён источником, а не только языковой моделью.

Вывод: HyDE улучшает поиск, переформулируя задачу в более «документоподобную». Главное ограничение — зависимость от качества генерации: если гипотетический текст уйдёт не в ту сторону, поиск ошибётся. Но при разумной языковой модели HyDE заметно повышает точность и легко внедряется в поисковые системы и RAG-архитектуры.