Amap выпустила потоковую 3D-модель ABot-Recon: без длинной п
новости
28.08.2026

Amap выпустила потоковую 3D-модель ABot-Recon: без длинной памяти, 12 кадров вместо 10 000

Amap выпустила потоковую 3D-модель ABot-Recon: без длинной памяти, 12 кадров вместо 10 000

28 августа компания Amap, входящая в группу Alibaba, официально представила модель ABot-Recon, которую называют первой потоковой 3D-моделью без долговременной зависимости для восстановления сцен из десятков тысяч кадров. Системе достаточно лишь 12 последовательных кадров, чтобы в реальном времени строить и обновлять пространственную модель, реализуя принцип «снимай и строй». На открытых бенчмарках KITTI, Oxford Spires и VBR модель показала минимальную ошибку и вышла в лидеры (SOTA).

Для автономного транспорта, воплощённого интеллекта и других приложений, работающих в открытой среде, важно не просто видеть, а понимать пространство в движении: где я, что вокруг и куда двигаться дальше. В торговых центрах, на складах и промышленных территориях, где сигнал навигации слаб и обстановка быстро меняется, рассчитывать на заранее построенную карту нельзя. Поэтому потоковая 3D-реконструкция становится ключевой технологией. Однако прежние методы использовали «якоря памяти» и вынуждены были постоянно сохранять, искать и сопоставлять исторические данные. Чем длиннее последовательность, тем ниже скорость, выше нагрузка на память и больше ошибок.

ABot-Recon выбирает другой путь — локальное предсказание позы и остаточную оптимизацию. Модель работает только с последними 12 кадрами, предсказывает локальное облако точек и относительное положение камеры между соседними кадрами, а затем постепенно собирает полную траекторию и трёхмерную сцену. Благодаря этому вычислительная сложность остаётся постоянной и не зависит от длины видео. Для борьбы с накоплением ошибок в модели предусмотрены механизмы коррекции и ограничения на этапе обучения.

В тесте Oxford Spires средняя ошибка траектории снизилась на 40,6 процента по сравнению с известным методом LingBot-Map. Относительная ошибка вращения составила 0,12 градуса — лучшее значение среди аналогичных потоковых подходов и примерно на 40 процентов ниже предыдущего рекорда. На наборе KITTI-02 скорость реконструкции достигает 24,45 кадра в секунду, что в 1,24 раза быстрее, чем у типичного представителя класса. Пиковое потребление памяти — около 6,71 ГБ, примерно треть от аналогов, поэтому модель запускается даже на одиночной видеокарте GTX 1080 Ti.

При этом ABot-Recon работает с видеосигналом с одной камеры, без дополнительных датчиков глубины и без заранее известных параметров камеры. Это делает модель пригодной для построения и обновления карт в закрытых пространствах, для систем воплощённого интеллекта, автономного вождения и генерации 3D-контента. Авторы подчёркивают неожиданный вывод: чтобы прокладывать путь на десятки тысяч кадров, не нужно запоминать всё подряд — модель, смотрящая лишь на 12 кадров, оказывается точнее, быстрее и экономичнее. Код, веса и материалы для оценки опубликованы на GitHub, также доступна демонстрационная площадка на ModelScope.

Источник: www.qbitai.com