ИИ не справился с оценкой научных статей: итоги годового эксперимента
Для анализа они использовали и традиционное чтение, и автоматизированные инструменты на базе больших языковых моделей. Выяснилось, что ИИ неплохо справляется с количественной оценкой и суммаризацией, но не способен оценить подлинную новизну. Модель не замечает, что работа повторяет уже известные решения, и не может понять, когда заявленные результаты преувеличены.
Из более чем трехсот работ только около двадцати процентов были признаны действительно заметным вкладом. Остальные — в основном небольшие улучшения существующих методов или новые области применения. При этом действительно важные работы не всегда отличались высоким числом загрузок или цитирований, что увеличивает риск остаться незамеченными.
Авторы предложили несколько способов решения. Среди них — альтернативные поисковые системы, которые учитывают рецензирование и репутацию журналов, в отличие от Google Scholar, ставящего все публикации на одну доску. Также звучит идея анонимной публикации и отказа от указания авторов и аффилиаций, чтобы содержание говорило само за себя. А большие языковые модели предлагается использовать только как вспомогательный инструмент для краткого изложения, не полагаясь на их оценки новизны.
Источник: robohub.org
Поделиться