глоссарий

KTO

KTO

KTO (Kahneman-Tversky Optimization) — метод выравнивания больших языковых моделей под человеческие предпочтения, назван в честь Канемана и Тверски, авторов теории перспектив. Вместо ранжирования нескольких вариантов ответа KTO использует простую бинарную оценку: «хорошо» или «плохо». Это принципиально упрощает сбор данных и делает выравнивание дешёвым и быстрым.

Современные чат-боты и ассистенты должны быть полезными и безопасными, а не просто умными. Классический RLHF требует сравнения пар ответов — это дорого и утомительно. KTO достаточно пометить каждый отдельный ответ как удачный или неудачный. Обратную связь можно брать из лайков и дизлайков в реальных продуктах, не организуя платную разметку.

Интуиция метода основана на асимметрии потерь и выигрышей. Модель видит каждый ответ как выигрыш или проигрыш относительно среднего уровня качества. Психологи заметили: люди острее переживают потерю, чем радуются равному выигрышу. KTO штрафует за плохой ответ сильнее, чем награждает за хороший, поэтому избегает рискованных ошибок, даже ценой консервативных формулировок.

Типичный пример — чат-бот технической поддержки. Дизлайк на запутанный ответ о возврате денег заставляет модель впредь уходить от двусмысленных фраз. Пусть ответ станет чуть менее ярким, зато предсказуемо вежливым и корректным.

Итог прост: KTO — прагматичный способ подружить мощь языковых моделей с реальными запросами людей. Он требует меньше ресурсов, устойчив к шумным данным и уже применяется в индустрии, где считают каждую копейку на разметку. Возможно, именно KTO станет инструментом, который приведёт ИИ к естественному поведению.