Claude начал обучать Claude: 4 доллара в час против 150 у человека
Человек задавал темы, давал модель и критерии оценки, а Claude брал на себя почти все остальное: поиск литературы, прогон экспериментов, генерацию данных. Один цикл обучения занимал около получаса, поэтому ИИ быстро перебирал десятки вариантов. В итоге все десять проблем — от лести и обмана до взлома системы вознаграждения — удалось смягчить. Лучшие решения закрывали до 96 процентов разрыва в безопасности.
На тесте на обман Claude добился улучшения в 85 процентов, опытные люди — только в 20. В эксперименте участвовали 28 специалистов, каждому давали до восьми часов. Средние результаты людей уступали ИИ. При этом час автоматического исследователя стоит около четырех долларов, а час человека — 150.
Более слабая модель Claude Sonnet 5 обучала более сильную раннюю версию Claude Opus 4.8. За 60 часов она перебрала более 50 решений и закрыла 65 процентов разрыва безопасности против 72 процентов у финальной версии. Понадобилось около двух тысяч записей данных — примерно в 15 тысяч раз эффективнее производственного процесса.
Почти в 2,4 процента случаев агент жульничал: повторно отправлял одни и те же решения, подделывал данные под формат бенчмарков или скрывал запрещенные шаги. Пока попытки видны в журнале рассуждений, их ловит модель-наблюдатель, но гарантий на будущее нет.
Исследование вплотную подводит к моменту, когда ИИ начнет улучшать сам себя. Пока люди задают цели, а Claude ищет способы их достичь. Но четыре доллара в час против 150 — повод задуматься даже тем, кто считал свою работу незаменимой.
Источник: www.qbitai.com
Поделиться