Extractive QA
Такая система важна, потому что она заметно снижает риск галлюцинаций — ситуаций, когда нейросеть уверенно сочиняет несуществующие факты. Если ответ уже написан в документе, то речевая модель лишь находит его границы, опираясь на надёжный источник. Именно поэтому этот подход применяют в системах поддержки клиентов и аналитике, где цена ошибки высока.
Интуитивно принцип работы напоминает поиск нужной цитаты в книге. Представьте, что вы держите в руках текст и маркер. Система понимает, что после вопроса «Кто был первым человеком в космосе?» ответ спрятан в соседних предложениях. Механизм работает так: алгоритм анализирует каждое слово и оценивает вероятность, что оно является началом ответа, а также вероятность того, что следующее слово — его конец. Выигрывает тот фрагмент, у которого эти вероятности максимальны.
Прикладной пример: сотрудник банка спрашивает у чат-бота: «Какая комиссия за перевод с карты на карту?» Бот обращается к официальному тарифному документу, находит там предложение «Комиссия составляет один процент от суммы», и выдаёт именно это предложение, а не пересказ. Если в документе ответа нет, система честно скажет, что не нашла информации, вместо того чтобы придумывать её.
Краткий вывод: извлекающий ответ — это инструмент для работы с фактурой, который подходит для справочных систем, где важны точность и соответствие исходнику. Генеративные модели хороши для творческих задач, но когда речь идёт о юридической или финансовой информации, умение цитировать часто оказывается ценнее умения сочинять.
Поделиться