ORPO
Это важно, так как традиционный RLHF требует больших вычислительных ресурсов и тонкой настройки. ORPO экономит время и ресурсы, делая процедуру доступной для небольших проектов, и снижает риск «вырождения» модели (когда она выдает неточные, но внешне заученные фразы).
Как работает? Модель выбирает следующее слово, у каждого слова есть вероятность. ORPO использует пары ответов на один запрос: предпочтительный и нет. Вычисляется «отношение шансов» — во сколько раз вероятность хорошего ответа выше плохого. Параметры корректируются так, чтобы это отношение росло. Модель постепенно подталкивает себя к формулировкам, которые кажутся людям правильными, прямо в ходе обычного обучения.
Пример: для вежливого чат-бота поддержки формируют пары ответов — грубый и образцово-вежливый. Применив ORPO, модель за один проход усваивает и содержание, и тон. После обучения она решает проблему пользователя в уважительной форме, потому что такой стиль стал статистически более вероятным.
Коротко: ORPO — элегантный способ объединить обучение и настройку под предпочтения. Он проще, быстрее и стабильнее старых подходов. Это важный шаг к AI-помощникам, которые не только умны, но и приятны в общении.
Поделиться