ИИ проверил 100 лет научных статей: 99,2% в топ-журналах с о
новости
10.08.2026

ИИ проверил 100 лет научных статей: 99,2% в топ-журналах с ошибками

ИИ проверил 100 лет научных статей: 99,2% в топ-журналах с ошибками

Исследователи применили ИИ-агентов для массовой проверки опубликованных научных работ и получили тревожные результаты. На главной конференции по машинному обучению ICML 2026 из 168 устных докладов 92 содержали как минимум пять проверяемых утверждений. Полноценно воспроизвести удалось лишь единицы: более 40% результатов подтвердились только в 34 статьях, а свыше 80% — всего в восьми. Остальные 58 работ не воспроизвелись вовсе.

Важно понимать: невоспроизводимость не равна фальсификации. В большинстве случаев речь идет о неполном коде, устаревших библиотеках, расхождениях между описанием и реальными данными. В четырёх статьях использованные модели вообще были отключены, так что их результаты теперь невозможно проверить. Были и вопиющие примеры: одна работа заявляла, что обучает лишь 0,77% параметров модели, а в открытом коде оказалось 6,31%, то есть в восемь раз больше. Другая статья ссылалась на таблицу, которую невозможно получить ни одним скриптом из репозитория.

Ещё более показательной стала проверка уже опубликованных работ. Система на базе GPT-5 проанализировала статьи из ведущих ИИ-конференций и журналов, игнорируя новизну и значимость, и сосредоточилась только на объективных ошибках. Выяснилось, что 99,2% статей содержат хотя бы одну ошибку, а в среднем на каждую работу приходится 4,7 ошибки. Больше половины из них — математические: неверные формулы, сбои в доказательствах, ошибочные допущения. Около трети статей NeurIPS и четверти ICLR имеют ошибки, способные повлиять на интерпретацию результатов. При этом качество только ухудшается: за пять лет среднее число ошибок в NeurIPS выросло с 3,8 до 5,9.

Открытие века сделал химик Pios, использовавший ИИ для предсказания температур кипения. Его модель противоречила данным из семидесятипятилетней давности, и учёный решил, что ошибся он. Но проверка по первоисточникам показала: прав ИИ. Более того, тот же инструмент выявил неверное значение в столетнем измерении, которое десятилетиями считалось эталонным и кочевало из одной работы в другую. Такие ошибки накапливаются из-за масштаба науки: исследователь физически не может прочитать всё, а однажды появившаяся неточность тиражируется в тысячах ссылок.

Теперь возможности изменились: ИИ впервые позволяет системно перепроверять историю науки. Правда, сам инструмент не идеален — его точность около 83%, и примерно 40% ошибок он пропускает. Поэтому окончательный вердикт по-прежнему должен выносить человек. Зато перед исследователями, особенно начинающими, открылось огромное поле работы: находить чужие ошибки, писать опровержения и пересматривать устоявшиеся догмы.

Источник: www.qbitai.com