AI-учёных начнут оценивать по-новому: китайская MIRA доказал
новости
25.08.2026

AI-учёных начнут оценивать по-новому: китайская MIRA доказала лидерство

AI-учёных начнут оценивать по-новому: китайская MIRA доказала лидерство

Индустрия ИИ для науки получила первый системный стандарт оценки. 19 августа вышла статья Measuring AI Scientists: From Exams to Discovery, подготовленная китайской компанией Deep Principle с Microsoft Research, Стэнфордом и Калифорнийским университетом в Беркли. Вместо проверки конечных ответов авторы предлагают оценивать весь исследовательский цикл: от гипотезы и дизайна эксперимента до интерпретации данных. Такой эпизод назвали discovery episode.

Старые бенчмарки вроде HLE были похожи на закрытый экзамен: модель давала ответ, но в реальной лаборатории терялась — не замечала аномалий, не умела пересматривать планы. Новая система учитывает каждый шаг и признаёт ценность неудач: для обучения ИИ-учёного ошибки так же важны, как для человека.

Практическим образцом стала платформа MIRA от Deep Principle. Она выстроена как полный цикл: гипотеза, моделирование, автоматический эксперимент и сохранение знаний. В бенчмарках Research Claw Benchmark и Science Agent Arena MIRA заняла первые места и показала минимальную стоимость выполнения задач. На её основе компания ведёт разработки в области литий-ионных батарей, охлаждающих жидкостей и новых материалов.

Методика появилась в разгар бума AI4S: в этом году в направление вошли OpenAI, Anthropic и Nvidia, а бывший главный учёный Google Джефф Дин основал стартап Discovery Loop. Новая рамка оценки задаёт планку достоверности: открытие должно быть воспроизводимым, а не заявленным. Среди авторов статьи — нобелевский лауреат по химии Фрэнсис Арнольд. Это знак, что научный истеблишмент воспринимает ИИ-учёных всерьёз.

Источник: www.qbitai.com