Repetition penalty
Без него модели часто впадают в «повторяющийся цикл»: начинают копировать сами себя, как заевшая пластинка. Особенно это заметно в длинных текстах — стихах, рассказах, письмах. Штраф сохраняет связность и информативность, делая текст живым. Штраф применяется на каждом шаге генерации, поэтому эффект накапливается.
Представьте школьника: если он повторяет одно и то же слово трижды, учитель снижает оценку. Модель работает так же: при расчёте вероятностей каждое уже произнесённое слово получает «штрафные очки». Чем больше повторов, тем сильнее штраф и тем меньше шансов, что слово появится снова.
Попросите нейросеть написать сказку про лису. Без штрафа выйдет: «Лиса пошла в лес. Лиса увидела волка. Лиса испугалась». Со штрафом — «Лиса отправилась в лес, повстречала волка и испугалась». Модель вынуждена подбирать синонимы и менять структуру фраз. Вместо заезженных повторов получается более естественный рассказ.
Но важна мера: слишком сильный штраф делает текст корявым, модель избегает нужных терминов. Значение обычно выбирают от 1,0 до 2,0, где 1,0 — отсутствие штрафа. Правильная настройка — это баланс между разнообразием и логикой. Авторы подбирают его под конкретную задачу и модель.
Поделиться