BIG-bench
Зачем это важно? Старые бенчмарки вроде GLUE стали слишком лёгкими: модели набирали почти все баллы, но ошибались в простых ситуациях. BIG-bench устроен так, что ответы невозможно подсмотреть в исходных данных. Он показал, что даже мощные нейросети спотыкаются на многошаговых рассуждениях, и дал исследователям надёжный инструмент для измерения прогресса.
Как это работает интуитивно? Представьте задачу: «Если все воробьи — птицы, а некоторые птицы не летают, может ли воробей Миша не летать?» Чтобы ответить, нужно выстроить логическую цепочку, а не найти слово в памяти. Авторы намеренно выбрали темы, которые редко встречаются в интернете, чтобы исключить заучивание готовых ответов.
Практический пример: модель спрашивают, утонет ли камень в воде. Для человека это очевидно, но у модели нет физического опыта, поэтому она часто ошибается. Такие, казалось бы, странные задачи показывают, что языковые модели не имеют настоящего понимания мира. Это побуждает разработчиков обучать их рассуждению, а не запоминанию.
Вывод: BIG-bench — это самый серьёзный на сегодняшний день способ проверить, насколько ИИ близок к человеческому мышлению. Он напоминает, что высокие баллы на обычных экзаменах — ещё не интеллект, и задаёт планку для будущих моделей.
Поделиться