HyDE
Интуитивно это работает так: представьте огромную библиотеку, где библиотекарь не может искать по короткому вопросу. Вы просите его сформулировать, как выглядела бы целая глава с ответом, а затем найти похожие. Библиотекарь пишет вымышленный текст, извлекает из него суть и ищет по ней. Ключевая идея: сгенерированный текст не обязан быть фактологичным — он должен быть ближе по стилю и структуре к целевым документам. Тогда векторная близость становится надёжной.
Пример: медицинский чат-бот. Пациент спрашивает «можно ли пить кофе при гипертонии?». HyDE-модуль создаёт гипотетический ответ: «Влияние кофеина на артериальное давление при хронической гипертензии». Система ищет близкие эмбеддинги в базе научных статей и находит релевантные работы, даже если в них нет слов «пить» или «гипертония». В итоге ответ подкреплён источником, а не только языковой моделью.
Вывод: HyDE улучшает поиск, переформулируя задачу в более «документоподобную». Главное ограничение — зависимость от качества генерации: если гипотетический текст уйдёт не в ту сторону, поиск ошибётся. Но при разумной языковой модели HyDE заметно повышает точность и легко внедряется в поисковые системы и RAG-архитектуры.
Поделиться