VLA на гуманоиде: реальные задержки и выбор платформы
новости
20.08.2026

VLA на гуманоиде: реальные задержки и выбор платформы

VLA на гуманоиде: реальные задержки и выбор платформы

На гуманоидных роботах всё чаще пытаются запускать VLA-модели локально, без облачных серверов. Один из инженеров, работавший над проектом с Jetson Orin на борту, решил проверить такую возможность. VLA, или Vision-Language-Action, объединяет обработку изображения и текста и выдаёт команды для приводов. Расчёт показал: теоретически локальный запуск возможен, однако от кадра до движения проходит 0,84 секунды. Этого достаточно, чтобы робот потерял равновесие, а пользователь решил, что система зависла.

После этого случая инженеру не раз поступали запросы на проектирование похожих систем. Но, как выяснилось, чаще требуется не VLA на человекоподобном роботе, а детекция на 30 FPS на плате за десять долларов или продвинутая языковая модель на устройстве. Главная сложность — документация, иногда только на китайском, которую приходится прогонять через переводчик. Кроме того, нужны подробные инженерные расчёты: пиковые тераоперации из даташита почти не влияют на фактическую задержку от кадра до движения. Важнее выстроить эффективный конвейер обработки данных и понять реальные узкие места.

Автор опыта приходит к выводу, что выбор платформы, модели и планировщика должен опираться на практические измерения и сценарий использования, а не на рекламные характеристики чипов. Реальные задержки определяются всей цепочкой: захват изображения, предобработка, инференс и планирование движений. Именно эти метрики стоит считать ещё до того, как робот окажется на испытательном стенде.

Источник: habr.com