技术摘要:上下文内 VLA (VLA-Talker)
问题陈述
视觉-语言-动作 (VLA) 模型已成为通用机器人操控的标准,通常通过行为克隆 (BC) 进行训练,以模仿基于静态图像和固定指令的专家动作块。虽然有效,但这些模型存在两个主要局限性:
- 不透明的调节 (Opaque Conditioning): 指令被视为记忆的字符串而非理解的概念;改写或使用未见过的同义词会导致性能下降。
- 被动感知 (Passive Perception): 策略通过单次前馈传递消费观测结果,缺乏在信息(如物体位置)并非立即可见时主动寻求缺失信息的能力。
解决这一问题的自然假设是注入显式的思维链 (CoT)。然而,作者证明了自由形式的生成式 CoT 对低层控制是有害的,原因有三:
- 接地差距 (Grounding Gap): 推理过程是从与动作头相同的静态特征中生成的,并未增加新的证据。如果模型幻觉出一个位置,它会主动误导动作头。
- 目标干扰 (Objective Interference): 在单一的自回归损失函数中,大量的语言 token(用于推理)在梯度信号上占据主导地位,压过了少量的动作 token,迫使策略变成一个“流利的叙述者”而非准确的执行者。
- 延迟与漂移 (Latency and Drift): 为每个决策生成数百个推理 token 会破坏闭环时序,且自回归前缀中的错误会传播到动作后缀中。
作者认为,VLA 不需要具备生成语言的能力,而是需要具备消费落地语言 (Grounded Language) 的能力。
方法论:VLA-Talker
本文引入了 VLA-Talker,该框架通过上下文内后训练 (In-context Post-training) 和 智能体工具使用 (Agentic Tool-use),赋予 VLA 模型语言能力,将证据获取与证据消费解耦。
1. 用于获取落地证据的智能体工具使用
系统并没有生成推理文本,而是将证据获取委托给一个外部智能体循环,该循环查询专门的工具来回答特定查询:机械臂夹持器和任务相关物体的图像空间位置及相对深度是多少?
- 深度与几何: 单目深度估计器提供相对深度顺序。
- 物体定位: 一个开放词汇检测器(如 GroundingDino)对物体进行定位。如果检测器不确定,智能体回退机制会查询视觉语言模型 (VLM) 以获取定性描述或近似坐标。
- 夹持器投影: 夹持器的世界位置(来自本体感受)利用相机内参被解析地投影到图像空间,从而提供精确的像素坐标而无需学习。
- 证据元组: 输出是一个包含坐标、深度和关系的结构化元组(例如,“杯子在夹持器右侧 42px 处且深 0.08m”)。
2. 多样化描述渲染
为了防止策略过拟合于单一模板,数据引擎将原始证据元组渲染为多样化、改写的自然语言描述。这些描述在以下方面各异:
- 模态: 绝对坐标 vs. 相对偏移 vs. 定性描述。
- 参考系: 自中心(从夹持器出发) vs. 他心/全局中心(从相机/桌面出发)。
- 词汇/句法形式: 物体和空间介词的同义词。
- 冗长程度: 短句 vs. 详细的多句描述。
至关重要的是,几何含义保持不变,而表面形式各异,从而迫使策略学习解释多样化的语言而非记忆模式。
3. 上下文内后训练
VLA 主干网络保持不变。在训练期间,渲染的证据被注入到提示词中,作为只读上下文(封装在 <spatial> 标签中),并与图像和指令一同输入。
- 监督: 损失函数仅应用于动作 token。证据 token 和指令被掩码处理。
- 效果: 模型学习根据注入的证据来预测动作,但永远不会学习生成证据本身。这消除了目标干扰和自回归延迟。
4. 轨迹级强化学习 (GRPO)
作为最后阶段,使用带有稀疏成功奖励的组相对策略优化 (GRPO) 对上下文内策略进行微调。
- 目标: 使工具调用与动作执行的时机与真实的任务成功对齐。
- 机制: 策略学习何时调用工具(例如,仅在需要重新落地时),而不是盲目调用,从而优化证据获取成本与任务成功之间的权衡。
核心贡献
- 对 CoT 的批判性分析: 本文提供了经验和分析性的证据,证明自由形式的生成式 CoT 会因为接地差距、目标干扰和延迟而损害低层控制,并将其与消费落地语言的益处进行了对比。
- VLA-Talker 框架: 一种新型架构,它将智能体工具使用(检测、深度、VLM 回退)与上下文内学习相结合,其中证据作为上下文注入而非作为 token 生成。
- 多样化落地语言: 一个将结构化证据渲染为多样化改写描述的数据引擎,在不牺牲落地性的前提下,教会策略对语言变化的鲁棒性。
- 两阶段训练: 一种结合了监督式上下文内后训练与轨迹级强化学习的方案,以将工具使用与任务结果对齐。
实验结果
该方法在三个模拟基准测试(LIBERO, RoboCasa-GR1, SimplerEnv)和 AgiBot G1 人形机器人的八个真实世界任务上进行了评估。
- 性能: VLA-Talker 在所有基准测试中均达到了 SOTA 水平。
- LIBERO: 平均成功率 97.4%(Gen-CoT 为 96.2%,VLA-Thinker 为 97.0%)。
- RoboCasa-GR1: 平均成功率 59.5%(Gen-CoT 为 46.5%)。
- SimplerEnv: 平均成功率 72.4%(Gen-CoT 为 54.7%)。
- 效率: 通过避免生成推理 token 的自回归过程,VLA-Talker 比基于 CoT 的方法降低了 4.6 倍 的单决策延迟(78ms vs. 359ms),从而实现了更高的控制频率(~12.8 Hz vs. 2.8 Hz)。
- 数据效率: 该方法在低数据量情况下显著优于标准 BC 和 Gen-CoT。在仅有 25 个演示样本时,VLA-Talker 的表现就超过了基于 50 个演示样本训练的 BC。
- 泛化能力: 该方法对未见物体、干扰物和改写后的指令表现出卓越的鲁棒性。当面对干扰物时,BC 和 Gen-CoT 性能显著下降,而 VLA-Talker 保持了高成功率,因为物体身份在到达策略之前已由工具循环解决。
- 真实世界部署: 在 AgiBot G1 上,VLA-Talker 在单任务策略上实现了 58.1% 的成功率,在多任务策略上实现了 45.0%,优于基线和 CoT 变体,尤其是在精细插入任务中。
意义与主张
论文声称,VLA 的语言能力源于对落地语言的理解,而非推理生成。 通过将范式从“思考”(生成文本)转向“感知”(消费工具衍生的证据),VLA-Talker 解决了语言生成与低层控制之间的根本冲突。
作者强调,其方法:
- 解耦了获取证据与使用证据的角色。
- 消除了自回归 CoT 固有的延迟和错误传播。
- 提高了数据效率,通过显式提供策略所需的几何事实,减轻了模型从像素中推断事实的负担。
- 证明了当通过上下文内学习而非生成式 CoT 集成时,智能体工具使用可以带来更鲁棒、更高效且更强大的机器人策略。
论文总结道,虽然 VLA-Talker 显著减少了落地和感知错误,但剩余的失败模式主要是控制精度误差(例如,紧凑的插入任务),这表明未来的改进应侧重于低层动作表示,而非进一步的推理生成。