AGI ещё не наступил, но GPT-6 действительно экономит токены
По цифрам новая модель действительно выглядит прорывной. В тесте ARC-AGI-3, где ИИ должен сам разобраться в незнакомой среде, Astra набрала 99,9 процента, тогда как предыдущая версия довольствовалась 7,8. В исследовательской математике FrontierMath Tier 4 результат достиг максимума, который разработчики назвали «насыщением». В тестах на программирование и длительные задачи модель тоже обходит конкурентов. Например, в Terminal-Bench 4.0 она превзошла и предшественника, и свежую модель Anthropic. При этом, как показали независимые замеры, Astra справляется с заданиями быстрее и расходует заметно меньше токенов. В некоторых сценариях экономия достигает 65 процентов по сравнению с конкурентом.
Секрет — в архитектуре. OpenAI применила так называемую рекуррентную глубину: модель выполняет промежуточные рассуждения внутри своих скрытых состояний, а не выписывает каждый шаг в виде длинной текстовой цепочки. Отсюда и скорость, и низкая стоимость. Обучение потребовало кластера из ста тысяч GPU — крупнейшего в истории OpenAI.
Впрочем, идеальной картину не назовёшь. В тесте Humanity’s Last Exam Astra показала результат ниже прошлой версии, а независимый индекс Artificial Analysis почти не заметил прогресса. Скептики шутят, что модель просто стала «более дорогой версией Sol». Да и стопроцентный результат ARC-AGI-3 получен с использованием фирменного «обвеса» — без него цифры скромнее, хотя всё равно выше конкурентов.
Так что провозглашать наступление AGI рано. Пока важнее другое: модели действительно становятся дешевле и практичнее. Как электричество когда-то ушло в тень инфраструктуры, так и ИИ постепенно перестанет быть поводом для споров — им просто начнут пользоваться.
Источник: www.tmtpost.com
Поделиться