глоссарий

Diversity Distinct-n

Diversity Distinct-n

Diversity Distinct-n — приём в машинном обучении, который заставляет нейросеть выдавать на один запрос сразу несколько разных вариантов. Обычная модель выбирает самый вероятный текст, а этот метод запрещает повторяющиеся n-граммы — цепочки из n слов подряд. Проще говоря, алгоритму говорят: не повторяйся и не копируй себя.

Зачем это нужно? Люди редко повторяют фразы дословно, а модели без контроля зацикливаются: выдают штампы и повторы, особенно в длинном тексте. Ассистент становится похож на заезженную пластинку, рерайтер копирует исходник. Метод снижает привлекательность повторов, делая ответы более живыми и естественными.

Механизм напоминает игру в города: нельзя называть уже сказанное. При генерации следующего слова система ведёт список использованных коротких последовательностей (например, трёх подряд идущих слов). Если новая тройка уже встречалась, её шанс на выбор уменьшается или она запрещается. Чем больше n, тем мягче правило: при n=1 запрещены все повторяющиеся слова, при n=4 модель может гибко комбинировать длинные фразы, лишь бы не было дословного копирования крупных кусков.

Пример — автоматическое создание описаний новостей. Без метода модель выдаст три почти одинаковых заголовка. С ним — один нейтральный, один с акцентом на цифрах и один эмоциональный. Маркетолог выбирает подходящий.

Итог: Diversity Distinct-n — простой способ сделать ИИ менее скучным и более человечным. Он не добавляет модели знаний, но помогает использовать данные без монотонности, повторов и «эффекта граммофона».