想象一下你拥有一个机器人助手。到目前为止,构建这个机器人就像雇佣了两位不同的专家:一位是走路(导航)方面的专家,但手脚笨拙;另一位是厨师(操纵)方面的专家,但无法穿过房间去拿食材。如果你想让机器人“走到厨房并将杯子放入微波炉”,你必须在两个不同的“大脑”之间进行切换,或者训练两个独立的模型。
这篇论文介绍了 OneVLA,它就像是雇佣了一位天生既擅长走路又擅长用手的“瑞士军刀”型员工,且这一切都集成在一个单一的大脑中。
以下是他们实现这一目标的简单分解:
1. “通用遥控器”(统一动作头)
大多数机器人都针对不同的工作拥有不同的“遥控器”。一个遥控器有前进或左转的按钮;另一个遥控器则有控制机械臂上下移动或旋转的滑块。
OneVLA 创建了一个单一的、通用的遥控器。
- 它将走路的按钮和手臂的滑块组合成一条长长的控制条。
- 当机器人收到指令如“走到门口”时,它只按下控制条上的“走路按钮”。
- 当指令是“拿起杯子”时,它只移动“手臂滑块”。
- 神奇之处: 机器人不需要更换它的“大脑”或“遥控器”。它只需根据任务知道该使用遥控器的哪一部分。
2. “三阶段训练营”(多阶段策略)
你不能直接把一个机器人扔进复杂的现实世界并期望它立即掌握一切。作者通过三个特定的阶段训练了 OneVLA,就像学生升学一样:
- 第一阶段:学习使用双手。 首先,他们教会机器人如何使用机械臂抓取、抬起和放置物体。他们还教会机器人观察图片并描述它们(以便它理解世界)。
- 第二阶段:学习走路。 接下来,他们加入了导航数据。现在机器人学会了如何从 A 点移动到 B 点。因为它已经通过第一阶段学会了如何“看”和“思考”,所以它学得更快、更聪明。
- 第三阶段:学习“大声思考”(思维链)。 最后,他们教会机器人“理清思路”。在行动之前,它会对自己说:“我在走廊里。我需要右转进入厨房。”这一步有助于机器人将所见、所需做以及如何移动之间的联系连接起来。
3. 结果:两种技能,一个大脑
论文声称,通过将这两项技能结合训练,它们实际上能让彼此变得更好。
- 类比: 想想看,就像一名既打篮球又踢足球的运动员。学习运球(操纵)可能会提高他们的脚步和平衡感,从而帮助他们在足球场上跑得更好(导航)。
- 证明: 在测试中,这个单一的机器人(OneVLA)击败了那些仅专门擅长走路或仅擅长用手的机器人。它也优于其他试图同时完成这两项任务、但仍需为每个任务设置不同“模式”或设置的“混合型”机器人。
总结
OneVLA 是一种新型的机器人大脑,当你要求它走路或要求它抓取东西时,它不需要重新编程。它使用一个统一的系统来理解语言、观察世界,并控制它的双脚和双手。作者展示了将这些技能结合在一起教学,会让机器人比分开教学时在两方面都变得更聪明。
技术摘要:OneVLA —— 一种用于具身任务的统一框架
问题陈述
当前的具身智能视觉-语言-动作(VLA)模型面临着一个根本性的架构限制:它们通常被局限于单一任务领域(导航或操作),或者需要针对不同任务使用特定的模型变体。虽然像 UniVLA 这样的跨任务模型尝试在不同的机器人形态之间进行知识迁移,但它们仍然依赖于独立的动作头或针对特定任务的模型配置。这种碎片化阻碍了开发能够无缝理解自然语言并在多样化领域中与物理环境进行交互的真正通用型机器人智能体的进程。本文确定了两个关键问题:(1) 是否可以有一种统一的 VLA 架构在无需任务特定变体的情况下同时执行导航和操作任务?(2) 这两项基本任务是否能通过联合训练实现相互获益,从而提升整体性能?
方法论
作者提出了 OneVLA,这是一种统一的 VLA 架构,旨在单个框架内为导航和操作生成语言响应和机器人动作。
1. 统一架构
- 统一视觉-语言编码器: 该模型利用一个共享的主干网络,包括一个 32 层的 Vision Transformer(处理多视图 RGB 图像)和一个 36 层的 Transformer 语言模型(使用 GQA)。视觉特征被投影到语言模型的隐藏维度(dh=2048)中,以创建统一的多模态表示。
- 基于 Token 的解码: 为了处理双重输出,词表进行了扩展,增加了特殊标记
<text>...</text> 和 <action>...</action>。这使得模型能够在单次前向传播中,自回归地生成解释任务理解的文本响应,随后生成动作序列。
- 统一动作头: 核心创新在于一个单一的动作头,它将导航和操作的动作维度连接成一个 11 维的统一空间:
- 导航 (anavi∈R4): 用于指令的离散概率分布(前进、左转、右转、停止)。
- 操作 (amani∈R7): 连续的 7 自由度末端执行器控制(Δx,Δy,Δz,Δroll,Δpitch,Δyaw,g)。
- 流匹配机制(Flow-Matching Mechanism): 动作头采用流匹配扩散过程来预测未来的动作序列。它通过最小化流匹配目标函数来学习预测速度场,该过程使用动作编码器、带有交叉注意力的 DiT 主干网络以及动作解码器。
- 任务特定权重: 为了适应异构动作空间,模型在训练期间使用任务特定的权重掩码。这些掩码确保只有相关的动作维度对给定样本的损失计算有贡献,从而实现无需架构切换的同步学习。
2. 多阶段渐进式训练策略
为了促进强力的正向迁移和相互增强,作者采用了三阶段训练策略:
- 第一阶段(操作基础): 仅在操作数据集和通用 VQA 数据上进行训练,以建立鲁棒的操作技能和视觉-语言理解能力。
- 第二阶段(跨任务迁移): 在保持操作和 VQA 数据的同时,引入导航数据进行联合训练。此阶段利用统一的动作头同时学习两项任务,实现领域间的知识迁移。
- 第三阶段(推理增强): 集成思维链(CoT)数据,以优化模型的推理能力和决策质量。
3. 损失函数
模型使用复合损失函数进行端到端训练:
Ltotal=λvlmLvlm+λtextLtext+λactionLaction
- Lvlm:用于通用视觉-语言对齐的标准交叉熵损失。
- Ltext:用于推理文本阶段(包括边界标记)的下一 Token 预测损失。
- Laction:通过任务特定权重掩码计算的流匹配损失,用以处理异构输出。
核心贡献
- 统一架构: 提出了 OneVLA,这是第一个无需任务特定变体或独立动作头即可执行导航和操作任务的 VLA 框架。
- 创新组件: 引入了带有流匹配技术的统一动作头以及促进不同任务领域有效相互增强的多阶段渐进式训练策略。
- 相互获益的实证证据: 通过综合实验证明,对导航和操作进行联合训练相比于单任务训练,能显著提升两者的整体性能。
- 新范式: 打破了独立任务领域之间的架构壁垒,为通用型机器人系统建立了新的范式。
实验结果
作者在模拟和真实世界基准测试中对 OneVLA 进行了评估,并将其与专门的单任务模型及现有的跨任务模型进行了对比。
模拟基准测试:
- 导航 (VLN-CE): OneVLA 取得了最先进(SOTA)的性能,在 R2R 数据集上达到 68.6%,在 RxR 数据集上达到 58.2%。这显著优于 UniVLA(分别为 47.1% 和 26.3%)以及专门的导航模型如 StreamVLN。
- 操作 (SimplerEnv): OneVLA 实现了 64.5% 的平均成功率,超过了 UniVLA-Mani (35.4%) 和 SOTA 操作模型 π0-Fast (48.3%)。
- 效率: 值得注意的是,拥有 3B 参数的 OneVLA 模型超越了所有 7B 参数的任务特定模型,展示了统一设计的效率。
真实世界实验:
- 使用 Franka Research 3 机械臂和移动机器人平台,OneVLA 在操作任务中实现了 78.8% 的成功率,在导航任务中实现了 77.5% 的成功率。
- 这些结果代表了在真实环境下相比 UniVLA 分别提升了 16.3% 和 35.0%,证实了该模型超越模拟环境进行泛化的能力。
消融研究:
- 多阶段训练: 与单阶段训练相比,三阶段策略使 R2R 性能提升了 12.5%,SimplerEnv 性能提升了 18.3%。
- 联合训练: 联合训练相比单任务训练分别提升了 7.3% (R2R) 和 5.5% (SimplerEnv),验证了共享表示对两个领域都有益的假设。
- 动作时界(Action Horizon): 研究发现 5 个时间步的动作时界在时间建模与预测准确性之间达到了最佳平衡。
重要性与主张
论文声称 OneVLA 通过将核心具身能力(导航和操作)统一到一个凝聚的框架内,为实现真正的通用机器人系统铺平了道路。作者断言,这种方法不仅在架构上更加优雅——消除了对任务特定变体的需求——而且在性能上也更为卓越。通过证明联合训练可以带来性能的相互提升,这项工作表明,统一的方法对于推动具身智能迈向通用人工智能(AGI)至关重要。该模型和源代码已公开发布,以支持该方向的进一步研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。