Amap выпустила потоковую 3D-модель ABot-Recon: без длинной памяти, 12 кадров вместо 10 000
Для автономного транспорта, воплощённого интеллекта и других приложений, работающих в открытой среде, важно не просто видеть, а понимать пространство в движении: где я, что вокруг и куда двигаться дальше. В торговых центрах, на складах и промышленных территориях, где сигнал навигации слаб и обстановка быстро меняется, рассчитывать на заранее построенную карту нельзя. Поэтому потоковая 3D-реконструкция становится ключевой технологией. Однако прежние методы использовали «якоря памяти» и вынуждены были постоянно сохранять, искать и сопоставлять исторические данные. Чем длиннее последовательность, тем ниже скорость, выше нагрузка на память и больше ошибок.
ABot-Recon выбирает другой путь — локальное предсказание позы и остаточную оптимизацию. Модель работает только с последними 12 кадрами, предсказывает локальное облако точек и относительное положение камеры между соседними кадрами, а затем постепенно собирает полную траекторию и трёхмерную сцену. Благодаря этому вычислительная сложность остаётся постоянной и не зависит от длины видео. Для борьбы с накоплением ошибок в модели предусмотрены механизмы коррекции и ограничения на этапе обучения.
В тесте Oxford Spires средняя ошибка траектории снизилась на 40,6 процента по сравнению с известным методом LingBot-Map. Относительная ошибка вращения составила 0,12 градуса — лучшее значение среди аналогичных потоковых подходов и примерно на 40 процентов ниже предыдущего рекорда. На наборе KITTI-02 скорость реконструкции достигает 24,45 кадра в секунду, что в 1,24 раза быстрее, чем у типичного представителя класса. Пиковое потребление памяти — около 6,71 ГБ, примерно треть от аналогов, поэтому модель запускается даже на одиночной видеокарте GTX 1080 Ti.
При этом ABot-Recon работает с видеосигналом с одной камеры, без дополнительных датчиков глубины и без заранее известных параметров камеры. Это делает модель пригодной для построения и обновления карт в закрытых пространствах, для систем воплощённого интеллекта, автономного вождения и генерации 3D-контента. Авторы подчёркивают неожиданный вывод: чтобы прокладывать путь на десятки тысяч кадров, не нужно запоминать всё подряд — модель, смотрящая лишь на 12 кадров, оказывается точнее, быстрее и экономичнее. Код, веса и материалы для оценки опубликованы на GitHub, также доступна демонстрационная площадка на ModelScope.
Источник: www.qbitai.com
Поделиться