глоссарий

Chinchilla

Chinchilla

Чинчилла — это не только пушистый грызун, но и название эмпирического закона, сформулированного исследователями DeepMind в 2022 году. Он описывает, как правильно увеличивать масштаб больших языковых моделей, чтобы получить максимум качества за разумные вычислительные затраты.

Зачем это важно? Раньше считалось, что главное — наращивать число параметров модели. Но «Чинчилла» показала: если объём обучающих данных не растёт так же быстро, модель становится «перекормленной, но недоученной». Интуитивно это похоже на автомобиль: увеличивая мощность двигателя, нужно добавлять топливо и улучшать дороги, иначе машина не поедет быстрее.

Как это работает? Исследователи вывели, что при увеличении параметров в N раз объём данных тоже должен расти примерно в N раз. Это позволяет не тратить ресурсы впустую. Например, если модель вырастает с 1 до 2 млрд параметров, данные нужно увеличить примерно вдвое — тогда каждая добавленная единица вычислений даёт максимальную отдачу.

Прикладной пример: компания, создающая чат-бота, решает, что ей нужна модель с 70 млрд параметров. Закон «Чинчилла» подсказывает, сколько токенов текста собрать для обучения, чтобы модель не заучила мало данных и плохо обобщала. Это экономит миллионы долларов на вычислениях.

Вывод: «Чинчилла» — это рецепт баланса между размером модели и данными. Следование ему позволяет строить более качественные ИИ-системы, не переплачивая за бессмысленную гигантоманию.