Ли Фэйфэй представила первую в мире мультимодальную модель мира Atlas
Atlas работает как вездеходная модель, объединяющая текст, изображение, видео и 3D-данные. Достаточно одного фото, чтобы получить ролик с произвольным движением камеры — вплоть до минуты в разрешении 1440p. Модель реконструирует реальную сцену по нескольким кадрам: выдаёт новые ракурсы и явное 3D-представление. По словам команды, результат превосходит специализированные модели, обученные именно для трёхмерной реконструкции. Из текста Atlas генерирует картинки и панорамы на 360 градусов, а по входному видео умеет менять точку обзора.
Технически Atlas — это авторегрессионный диффузионный Transformer. Все модальности привязываются к трёхмерному пространству, образуя пространственный контекст, а модель по нему выдаёт мультимодальный результат. Архитектура впитала идеи больших языковых моделей и видеогенераторов: используются кэш KV и другие методы ускорения, а также техники диффузии в латентном пространстве.
Для робототехники это значимый шаг к реалистичной симуляции. Достаточно нескольких фотографий среды, чтобы Atlas сгенерировал правдоподобные RGB- и depth-данные, на которых робота можно обучать новым навыкам в разных виртуальных пространствах. Именно поэтому руководитель направления робототехники NVIDIA Джим Фан назвал Atlas крупным шагом в области Real-to-Sim. Сама Ли Фэйфэй считает модель рубежной и открывающей дорогу приложениям от визуальных эффектов до роботов. Сейчас Atlas доступен ранним партнёрам, обычным пользователям можно подать заявку на сайте World Labs.
Источник: www.qbitai.com
Поделиться