глоссарий

RLHF

RLHF

RLHF — метод дообучения языковых моделей, в котором люди оценивают ответы, помогая модели понять, что для человека хорошо, а что плохо. Обычное обучение предсказывает следующее слово, а RLHF выравнивает модель с человеческими предпочтениями, делая её полезной, безопасной и естественной в диалоге.

Зачем это нужно? Без RLHF модель может выдавать грамматически идеальный, но токсичный или бессмысленный текст. Она не знает, что грубость и ложь плохи, а вежливая помощь хороша. RLHF превращает «болванчика, нахватавшегося текстов» в ассистента, который следует намерениям пользователя и избегает вредных высказываний. По сути, это мост между статистикой и этикой.

Как это работает? Представьте дрессировку собаки: сначала примеры, затем подкрепление. В RLHF модель обучают на размеченных примерах, где люди показывают хорошие ответы. Потом несколько человек оценивают её ответы, и эти оценки скармливают модели-вознаграждению, которая учится предсказывать, понравится ли ответ человеку. Затем основная модель тренируется получать больше баллов от этой модели-судьи, сдвигая веса в сторону ответов, которые людям кажутся удачными.

Яркий пример — ChatGPT. Именно RLHF (плюс вариант RLAIF) сделал чат-бота вежливым и послушным. Инженеры собирали диалоги, где помощник отказывался от вредного совета, объяснял сложное простыми словами или признавал незнание. За такие ответы люди ставили высокие оценки, а за грубость и выдумывание фактов — низкие. После обучения модель стала не просто генератором текста, а полезным собеседником.

Вывод: RLHF — ключевой ингредиент современных ИИ-ассистентов. Он переводит субъективные предпочтения людей в математическую функцию, которую модель учится максимизировать. Благодаря этому нейросети становятся не умнее в смысле знаний, но безопаснее и приятнее в общении — а это зачастую важнее, чем просто правильные ответы.