KTO
Современные чат-боты и ассистенты должны быть полезными и безопасными, а не просто умными. Классический RLHF требует сравнения пар ответов — это дорого и утомительно. KTO достаточно пометить каждый отдельный ответ как удачный или неудачный. Обратную связь можно брать из лайков и дизлайков в реальных продуктах, не организуя платную разметку.
Интуиция метода основана на асимметрии потерь и выигрышей. Модель видит каждый ответ как выигрыш или проигрыш относительно среднего уровня качества. Психологи заметили: люди острее переживают потерю, чем радуются равному выигрышу. KTO штрафует за плохой ответ сильнее, чем награждает за хороший, поэтому избегает рискованных ошибок, даже ценой консервативных формулировок.
Типичный пример — чат-бот технической поддержки. Дизлайк на запутанный ответ о возврате денег заставляет модель впредь уходить от двусмысленных фраз. Пусть ответ станет чуть менее ярким, зато предсказуемо вежливым и корректным.
Итог прост: KTO — прагматичный способ подружить мощь языковых моделей с реальными запросами людей. Он требует меньше ресурсов, устойчив к шумным данным и уже применяется в индустрии, где считают каждую копейку на разметку. Возможно, именно KTO станет инструментом, который приведёт ИИ к естественному поведению.
Поделиться