想象一下,你正在教一个机器人制作三明治。
旧方法(显式思维链):
目前,大多数先进的机器人“大脑”运作方式,就像一个被强迫在采取任何行动之前,必须在日记中写下每一个念头的学生。
- 机器人看到: “我需要做一个三明治。”
- 机器人(大声)思考: “好的,首先我需要找到面包。我看到左边有一 loaf。现在我需要拿起刀。我看到刀在右边。我需要慢慢移动我的手臂……"
- 机器人行动: 只有写完整段文字后,它才会移动手臂。
问题: 这极其缓慢。等到机器人写完它的“日记条目”时,三明治已经凉了,或者机器人已经错过了抓取面包的机会。此外,用单词(离散标记)来书写对于需要以平滑、连续曲线移动手臂的机器人来说,显得有些笨拙。这就像只允许自己以 1 英寸的跳跃幅度来开车。
新方法(LaRA-VLA):
该论文介绍了 LaRA-VLA(潜在推理视觉语言动作模型)。这就像教机器人在脑海中思考,而无需写下任何东西。
机器人不再吐出一长段文字,而是将其推理内化为一种紧凑、连续的“感觉”或“氛围”(即潜在表示)。
- 机器人看到: “我需要做一个三明治。”
- 机器人(沉默地)思考: 它瞬间处理了面包的位置、刀的位置以及手臂需要采取的路径,所有这一切都在一个单一、流畅的思维快照中完成。
- 机器人行动: 它立即移动。
三步训练营(课程学习)
论文指出,你不能直接告诉机器人“要沉默地思考”。它需要一个包含三个阶段的训练营:
第一阶段:“展示你的工作”阶段。
机器人被迫写下它的想法(文本)并预测下一张图片的样子(视觉)。它通过明确陈述“我正在将杯子向左移动”来学习游戏规则。
第二阶段:“低语”阶段。
训练者开始用“低语”(潜在标记)替换机器人写出的句子。起初,机器人写下一半句子,然后低语剩下的部分。慢慢地,它写得越来越少,低语得越来越多。它学会将复杂的思维压缩成一个微小、高效的心理包裹。
第三阶段:“沉默大师”阶段。
机器人不再大声书写或低语任何东西。它已经完全内化了推理过程。它观察场景,在脑海中处理“低语”,并立即执行动作。
为什么这更好?
- 速度: 因为机器人不再浪费时间打日记条目,它的反应速度快了 90%。论文声称,这将思考时间从超过 7 秒降低到仅0.13 秒(135 毫秒)。这足以满足实时控制的需求。
- 流畅性: 由于机器人是用“连续的感觉”而非“离散的单词”来思考,它的动作更加流畅,更符合物理世界的实际运作方式。
- 鲁棒性: 论文在模糊或有噪声的摄像头输入(就像透过雾蒙蒙的窗户看东西)下测试了该机器人。“沉默思考者”(LaRA-VLA)比“日记写手”更好地处理了这些混乱情况,表明它们的内部心理模型更加稳定。
结果
在测试中,这种新方法击败了几乎所有其他顶级机器人模型。它在处理长而复杂的任务(如分拣水果或堆叠碗)方面表现更好,而且速度快得多。
简而言之: LaRA-VLA 教导机器人停止通过“说话”来完成任务,转而通过“感觉”来完成任务,从而造就了一个既是天才规划师又是闪电般快速执行者的机器人。
技术摘要:潜在推理 VLA(LaRA-VLA)
问题陈述
视觉 - 语言 - 动作(VLA)模型通过将多模态观测和语言指令映射到连续控制命令,展示了在可扩展机器人操作方面的巨大潜力。增强性能的一种主流策略是思维链(CoT)推理,它为任务分解和规划提供了结构化的中间步骤。然而,现有的 CoT 方法面临两个根本性局限:
- 高推理开销:基于文本的 CoT 方法需要在推理过程中生成大量的离散推理 token。这导致了巨大的计算成本、过度的 KV 缓存占用和高延迟,通常将控制频率降低至 5 Hz 以下,这对于实时机器人控制而言是不够的。
- 表征不匹配:大多数 CoT 公式依赖于离散表征(来自 VQ 基分词器的语言 token 或离散视觉 token)。这与机器人感知和动作空间固有的连续性不匹配。将推理限制在离散 token 可能会阻碍具身控制所需的流畅性。
方法论:LaRA-VLA
为了解决这些挑战,作者提出了潜在推理 VLA(LaRA-VLA),这是一个将多模态 CoT 推理内化到连续潜在表征中的统一框架。LaRA-VLA 不在推理时生成显式的推理轨迹,而是完全在潜在空间内进行推理和预测,从而与连续感知和控制保持一致。
1. 数据构建
作者开发了一个自动标注流水线,用于构建面向仿真和真实世界环境的结构化 CoT 数据集(LIBERO-LaRA 和 Bridge-LaRA)。该流水线采用“先锚定,后生成”的范式:
- 语义锚点:利用 Qwen3-VL 从初始帧和指令中提取被操作物体。
- 时间锚点:基于夹爪状态变化将机器人轨迹分割为原子阶段来生成。
- 标注:系统生成简洁的子任务描述、时间一致的目标物体边界框(通过 GroundingDINO 和 SAM3 实现),以及从末端执行器轨迹推导出的运动推理。
2. 模型架构
LaRA-VLA 使用 Qwen3-VL 作为骨干视觉 - 语言模型(VLM),继承其图像编码器以保持一致的视觉表征。
- 视觉目标潜在变量:引入专用的
<img next> token 来表示预测的视觉潜在变量,从而在训练早期阶段实现显式监督和对齐。
- 动作专家:在最后阶段,动作生成与自回归 token 解码解耦。一个 16 层的扩散 Transformer(Diffusion Transformer)充当动作专家,基于学习到的潜在表征进行条件化,以生成连续的动作轨迹。
3. 三阶段课程训练
训练范式遵循从显式推理到潜在具身推理的渐进过渡:
- 第一阶段:显式 CoT 微调。模型在带有显式文本 CoT 标注和视觉目标预测的数据集上进行微调。它学习自回归生成离散 CoT token,并使用指数移动平均(EMA)目标编码器对齐未来视觉潜在变量(zt+1),以防止表征坍塌。动作 token 也通过逆动力学目标进行训练。
- 第二阶段:基于课程的替换。离散 CoT token 被逐步掩蔽并替换为可学习的连续潜在表征。显式 token 的比例根据课程计划减少,而模型越来越依赖潜在推理,由视觉预测目标和动作信号引导。
- 第三阶段:基于流匹配的动作生成。移除显式 CoT 监督。模型利用流匹配目标适应连续控制。动作专家预测一个速度场,该速度场以多模态潜在上下文(当前视觉/文本输入、中间推理潜在变量和预测的未来视觉潜在变量)为条件,从而在不生成显式 CoT 的情况下生成连续动作轨迹。
4. 注意力机制
一种专门的注意力机制调节跨 token 的信息流。在第一和第二阶段,未来图像 token 因果性地关注文本和当前图像 token。在第三阶段,动作 token 被排除在注意力计算之外,模型仅在相同约束下基于文本和视觉 token 运行,以确保高效的推理。
主要贡献
- 潜在推理范式:本文提出了一种范式,将 CoT 推理内化到跨文本和视觉模态的连续潜在表征中,实现了与连续感知和控制相一致的推理高效性。
- LaRA-VLA 框架:一个统一的 VLA 模型,通过基于课程的训练策略实现该范式,从显式多模态 CoT 监督过渡到潜在具身推理,并通过基于 EMA 的视觉编码器保持稳定。
- 结构化数据集:构建了两个结构化 CoT 数据集(LIBERO-LaRA 和 Bridge-LaRA),包含用于具身操作的多模态推理标注(子任务分解、运动推理、目标定位)。
实验结果
作者在仿真基准(LIBERO, SimplerEnv)和长视野真实机器人操作任务上评估了 LaRA-VLA。
- 仿真性能:在 LIBERO 基准测试中,LaRA-VLA 实现了 97.9% 的先进平均成功率,优于无 CoT 基线(如 OpenVLA, π0)和显式 CoT 方法(文本和视觉)。在 SimplerEnv-WidowX 上,它达到了 68.8% 的最高平均成功率,展示了卓越的虚实泛化能力。
- 真实世界性能:在真实世界的长视野任务中(例如分拣水果、堆叠碗),LaRA-VLA 在比较方法(ACT, ECoT, GR00T N1.5)中取得了最高的平均成功率,特别是在需要多阶段推理和时间协调的任务中表现突出。
- 推理效率:与基于显式 CoT 的方法相比,LaRA-VLA 将推理延迟降低了高达 90%,在 NVIDIA A100 GPU 上实现了 135 ms 的 rollout 时间。这使得控制频率足以满足实时机器人的需求。
- 鲁棒性:与无潜在基线相比,该模型对视觉扰动(高斯噪声和模糊)表现出更强的鲁棒性,潜在表征在受损情况下仍保持语义一致性。
- 消融研究:结果证实,潜在 CoT 监督比显式文本 CoT 带来更大的提升。潜在文本和视觉 CoT 的结合产生了最佳性能,突显了多模态对齐的益处。
意义与主张
本文主张,LaRA-VLA 证明了具身代理的结构化推理可以在潜在空间中有效实现,而无需在推理时生成显式的思维链。通过将推理内化到连续潜在动力学中,该方法解决了离散 token 与连续控制之间的表征不匹配问题,同时显著降低了计算开销。作者认为,这种范式为高效、实时且鲁棒的机器人操作提供了一条可行路径,超越了冗长、离散推理轨迹的局限性。
作者承认了局限性,指出如果没有显式监督,潜在表征可能会遭受坍塌(此处通过限制潜在 token 和使用 EMA 来缓解),并且课程训练过程在过渡阶段会产生更高的成本。然而,这项工作为 VLA 模型中高效、面向动作的推理奠定了基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。