Nucleus sampling
Как это работает? Сначала модель вычисляет вероятность каждого возможного продолжения. Затем алгоритм сортирует все варианты по убыванию вероятности и начинает складывать их, пока сумма не достигнет порога. Эти отобранные слова и есть ядро. Дальше происходит случайный выбор одного из слов ядра, но с большим весом у более вероятных. Интуитивно это напоминает чтение книги с продолжением: вы не перебираете весь язык, а мысленно держите в голове несколько разумных вариантов.
Вот конкретный пример: система автоматических итогов после фразы "финансовый аналитик предсказал рост..." скорее всего дополнит ее словами "цен", "рынка" или "курса", но никогда "настроения" или "облаков". Благодаря случайности внутри ядра каждый сгенерированный ответ уникален, но остается логичным. Поэтому nucleus sampling применяется в чат-ботах, генераторах новостей и творческих ассистентах — везде, где нужен баланс между оригинальностью и связностью. Этот метод — не единственный, но благодаря простоте и эффективности он стал стандартом де-факто.
Поделиться