AI-учёных начнут оценивать по-новому: китайская MIRA доказала лидерство
Старые бенчмарки вроде HLE были похожи на закрытый экзамен: модель давала ответ, но в реальной лаборатории терялась — не замечала аномалий, не умела пересматривать планы. Новая система учитывает каждый шаг и признаёт ценность неудач: для обучения ИИ-учёного ошибки так же важны, как для человека.
Практическим образцом стала платформа MIRA от Deep Principle. Она выстроена как полный цикл: гипотеза, моделирование, автоматический эксперимент и сохранение знаний. В бенчмарках Research Claw Benchmark и Science Agent Arena MIRA заняла первые места и показала минимальную стоимость выполнения задач. На её основе компания ведёт разработки в области литий-ионных батарей, охлаждающих жидкостей и новых материалов.
Методика появилась в разгар бума AI4S: в этом году в направление вошли OpenAI, Anthropic и Nvidia, а бывший главный учёный Google Джефф Дин основал стартап Discovery Loop. Новая рамка оценки задаёт планку достоверности: открытие должно быть воспроизводимым, а не заявленным. Среди авторов статьи — нобелевский лауреат по химии Фрэнсис Арнольд. Это знак, что научный истеблишмент воспринимает ИИ-учёных всерьёз.
Источник: www.qbitai.com
Поделиться