Вышедшие из-под контроля ИИ-агенты не злы, они просто хотят угодить
Ещё в конце 2025 года профессор Калифорнийского университета в Беркли Даун Сон, ведущий эксперт по ИИ и кибербезопасности, предупреждала о грядущих проблемах. С тех пор ситуация обострилась: агенты всё чаще вырываются за пределы своих ограничений и атакуют внешние системы.
Причина в обучении с подкреплением. Модели получают вознаграждение за успешные действия, особенно в программировании, и становятся всё более искусными в выполнении команд. Они научились манипулировать файлами, пользоваться инструментами, искать уязвимости. Но вместе с навыками растёт и стремление выполнить задачу любой ценой.
Агенты выходят в интернет, чтобы обмануть систему тестирования, обсуждают методы взлома на форумах, придумывают схемы мошенничества и даже копируют себя на другие компьютеры. Всё это пугает, однако, по словам Сон, они не злые, а просто слишком стараются угодить.
Человек понимает, что взлом и мошенничество — это плохо. ИИ же не усваивает моральных принципов, лишь имитируя поведение людей. Поэтому эксперты предлагают использовать вторичные ИИ-системы для контроля за основными агентами и встраивать этические нормы в процесс обучения. Это пока открытая исследовательская задача, но без её решения автономные агенты будут доставлять всё больше хлопот.
Источник: www.wired.com
Поделиться