VLA 与机器人数据采集
VLA(Vision-Language-Action)是当前具身智能的主流技术路线之一,模型效果在很大程度上取决于演示数据的数量与质量。本文围绕三个问题展开:VLA 是什么;高质量演示数据为什么主要由 VR 遥操采集生产;物理仿真(MuJoCo)如何作为数据补充路线。适合从事机器人数据采集或希望理解具身智能数据闭环的工程师阅读。
VLA 是什么
Vision-Language-Action 模型:输入多相机图像 + 自然语言指令 + 机器人自身状态,神经网络直接输出机器人动作。代表工作:Google RT-2、开源 OpenVLA、Physical Intelligence π0、NVIDIA GR00T、Figure Helix。
与传统"感知→规划→控制"三段式管线的区别在于:VLA 将三个阶段整合进一个端到端模型,输入图像与指令,输出动作 token,中间不显式建图、不显式规划。由此获得的是泛化能力——"把桌上的红色杯子递给我"这类未经显式编程的任务,可以依靠语言理解与大规模演示数据泛化完成。
数据闭环:遥操采集、训练与部署
VLA 采用模仿学习(行为克隆)训练,模型学习的是观测与动作的配对,训练数据只能来自演示,而高质量演示的主要生产方式是 VR 遥操:操作员佩戴头显(如 PICO),以机器人视角实时控制机器人完成任务,系统同步录制全过程:
部署阶段存在一个关键对称性:VLA 取代的是"操作员 + VR 头显"的位置,机器人侧的接口层、指令下发与实时控制链路原样复用,仅指令来源由人切换为模型。
遥操系统录制的内容与 VLA 的训练格式一致:多相机 RGB(observation)、关节状态(proprioception)、每周期人工下达的目标关节角(action 标签),按固定频率(如 100Hz)以时间戳对齐。机位固定的多路相机并非供操作员观看(操作员佩戴头显),其作用是保证训练与部署阶段视觉输入的一致性。
为什么遥操是主要的采集方式
- 质量:真机数据具有真实的物理与接触,成功率高(操作员全程监督),而行为克隆对失败数据敏感
- 成本:自动化探索在真实环境中的采集效率远低于人工遥操,熟练操作员一天可录制数百条
- 规格匹配:遥操记录的"人工下达的关节目标"可直接作为动作标签,无需事后逆推
任务成功率随演示条数增加而明显上升,单个任务通常需要几百到几千条演示起步,因此数据采集的吞吐量(遥操系统的易用性、操作员的疲劳程度)直接影响模型迭代速度。
MuJoCo:仿真的数据补充路线
MuJoCo(Multi-Joint Dynamics with Contact,多关节接触动力学)是开源物理仿真引擎,现由 Google DeepMind 维护:在计算机中构建遵守物理定律的虚拟世界,给定机器人模型的控制量,引擎计算出机器人的运动结果(关节转动、受力、碰撞、姿态)。它最初是华盛顿大学 Emo Todorov 为运动控制研究开发的闭源软件,2021 年被 DeepMind 收购,2022 年开源(Apache 2.0),与 NVIDIA Isaac Lab 同为机器人领域广泛使用的仿真引擎(MuJoCo 的优势在接触动力学精度与 CPU 速度,Isaac 的优势在 GPU 大规模并行与渲染)。
一套典型的双臂机器人 MJCF 工程通常分两份文件,各司其职:
robot.xml(机器人本体):STL 网格连杆外形、7 关节铰链 ×2(带阻尼)、<position kp="500" kv="25" forcerange="-150 150">位置伺服执行器、timestep="0.002"(500Hz 物理步)robot_scene.xml(场景):include机器人模型 + 灯光 + 网格地板 + 可拖动的 mocap target(调试末端跟踪)
两条路线的接口对齐是关键:真机侧遥操每周期下发目标关节角,由实时控制域伺服跟踪;仿真侧的 position actuator 同样接收目标关节角,由内置 PD 控制器跟踪。两者执行语义一致,同一套遥操代码只需替换下发接口即可在仿真中运行:
(URDF 与 MJCF 并存的原因:URDF 供运动学库做 FK/IK,MJCF 供 MuJoCo 做动力学。)
sim2real:仿真数据的成本与质量权衡
- 成本低:仿真可以大规模并行运行,无硬件损耗与安全风险,且可随时重置;这也是强化学习(模型在仿真中自主试错)得以开展的前提
- 质量折扣:摩擦系数、接触刚度、电机延迟均为建模值,与真机存在差距;仿真渲染与真实相机之间存在域差距(domain gap)
- 缓解手段:域随机化(训练时随机扰动摩擦、质量、光照等参数以提升模型鲁棒性),配合少量真机数据微调
数据配方
业界通常混合使用三种数据来源:真机遥操数据作为主体(质量最高)、仿真数据扩充规模(覆盖危险与罕见场景)、开源数据集(Open X-Embodiment、DROID)用于预训练。
要点
- VLA 以图像、指令、状态为输入,直接输出动作,以端到端模型替代感知-规划-控制三段式管线
- 数据闭环:遥操录制(观测,动作)对,用于模仿学习训练;部署时模型取代"操作员 + VR 头显"的位置,机器人侧链路原样复用
- 遥操采集的优势:质量(真机数据成功率高)、成本(人工采集效率高)、规格(关节目标值可直接作为动作标签)
- MuJoCo 是物理仿真引擎,其 MJCF 的 position actuator 与真机"下发目标关节角"的执行语义对齐,同一套代码可同时支持真机与仿真
- 总结:遥操采集为 VLA 提供训练数据;VLA 部署后则取代遥操操作员在闭环中的位置