Победитель Blue Sky AAMAS 2026: модели мира для агентов в меняющейся среде
Идея в том, чтобы создать мировую модель, которая обучается из опыта, но при этом верификатор может рассуждать о её свойствах. Агент обновляет модель, оценивает надёжность абстракций и проверяет, соответствует ли политика спецификации. Небезопасное обновление может быть отклонено, а недостающие данные запрошены. Модель должна быть калиброванной, композиционной и семантически запрашиваемой. Калиброванность означает, что каждая абстракция несёт оценку своей погрешности, композиционность позволяет переиспользовать проверенные компоненты, а семантическая запрашиваемость помогает выводить модель вознаграждения или абстракцию из формальных требований.
Такая модель становится общей основой для обучения, планирования и верификации. Она помогает агенту понимать границы своих знаний и объяснять, почему поведение может быть сертифицировано. Это отличается от современных предсказательных моделей: важна не только средняя точность, но и то, какие выводы она обосновывает. Например, модель склада может ошибаться в редком опасном взаимодействии с погрузчиком, и именно это определит, выполняется ли требование безопасности. В реальных условиях среда меняется, цели эволюционируют, и в мультиагентных системах каждый агент изменяет окружение для других. Поэтому надёжность нужно поддерживать постоянно, а не получать один раз при развёртывании.
Источник: robohub.org
Поделиться