Repetition penalty
глоссарий

Repetition penalty

Repetition penalty

Repetition penalty — параметр больших языковых моделей, который снижает вероятность повторного использования слов, уже встречавшихся в ответе при генерации текста. Он не запрещает повторы, а делает их менее привлекательными, вынуждая модель искать другие формулировки.

Без него модели часто впадают в «повторяющийся цикл»: начинают копировать сами себя, как заевшая пластинка. Особенно это заметно в длинных текстах — стихах, рассказах, письмах. Штраф сохраняет связность и информативность, делая текст живым. Штраф применяется на каждом шаге генерации, поэтому эффект накапливается.

Представьте школьника: если он повторяет одно и то же слово трижды, учитель снижает оценку. Модель работает так же: при расчёте вероятностей каждое уже произнесённое слово получает «штрафные очки». Чем больше повторов, тем сильнее штраф и тем меньше шансов, что слово появится снова.

Попросите нейросеть написать сказку про лису. Без штрафа выйдет: «Лиса пошла в лес. Лиса увидела волка. Лиса испугалась». Со штрафом — «Лиса отправилась в лес, повстречала волка и испугалась». Модель вынуждена подбирать синонимы и менять структуру фраз. Вместо заезженных повторов получается более естественный рассказ.

Но важна мера: слишком сильный штраф делает текст корявым, модель избегает нужных терминов. Значение обычно выбирают от 1,0 до 2,0, где 1,0 — отсутствие штрафа. Правильная настройка — это баланс между разнообразием и логикой. Авторы подбирают его под конкретную задачу и модель.