глоссарий

BIG-bench

BIG-bench

BIG-bench (расшифровывается как Beyond the Imitation Game benchmark) — это открытый набор из более чем двухсот задач для проверки больших языковых моделей. Его создали в 2022 году исследователи из Google, Стэнфорда и других лабораторий. В отличие от классических тестов, BIG-bench проверяет не память, а рассуждения: логику, здравый смысл, причинно-следственные связи и даже юмор. Цель — понять, действительно ли модель мыслит или просто повторяет фразы из интернета.

Зачем это важно? Старые бенчмарки вроде GLUE стали слишком лёгкими: модели набирали почти все баллы, но ошибались в простых ситуациях. BIG-bench устроен так, что ответы невозможно подсмотреть в исходных данных. Он показал, что даже мощные нейросети спотыкаются на многошаговых рассуждениях, и дал исследователям надёжный инструмент для измерения прогресса.

Как это работает интуитивно? Представьте задачу: «Если все воробьи — птицы, а некоторые птицы не летают, может ли воробей Миша не летать?» Чтобы ответить, нужно выстроить логическую цепочку, а не найти слово в памяти. Авторы намеренно выбрали темы, которые редко встречаются в интернете, чтобы исключить заучивание готовых ответов.

Практический пример: модель спрашивают, утонет ли камень в воде. Для человека это очевидно, но у модели нет физического опыта, поэтому она часто ошибается. Такие, казалось бы, странные задачи показывают, что языковые модели не имеют настоящего понимания мира. Это побуждает разработчиков обучать их рассуждению, а не запоминанию.

Вывод: BIG-bench — это самый серьёзный на сегодняшний день способ проверить, насколько ИИ близок к человеческому мышлению. Он напоминает, что высокие баллы на обычных экзаменах — ещё не интеллект, и задаёт планку для будущих моделей.