← 最新论文
💻 computer science

OneVLA: A Unified Framework for Embodied Tasks

OneVLA 引入了一个统一的框架,该框架通过共享动作头和多阶段渐进式训练策略,将导航与操作集成到单一架构中,在模拟和真实环境中均实现了最先进的性能,从而推动了通用机器人智能体的发展。

原作者: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一个机器人助手。到目前为止,构建这个机器人就像雇佣了两位不同的专家:一位是走路(导航)方面的专家,但手脚笨拙;另一位是厨师(操纵)方面的专家,但无法穿过房间去拿食材。如果你想让机器人“走到厨房并将杯子放入微波炉”,你必须在两个不同的“大脑”之间进行切换,或者训练两个独立的模型。

这篇论文介绍了 OneVLA,它就像是雇佣了一位天生既擅长走路又擅长用手的“瑞士军刀”型员工,且这一切都集成在一个单一的大脑中。

以下是他们实现这一目标的简单分解:

1. “通用遥控器”(统一动作头)

大多数机器人都针对不同的工作拥有不同的“遥控器”。一个遥控器有前进或左转的按钮;另一个遥控器则有控制机械臂上下移动或旋转的滑块。

OneVLA 创建了一个单一的、通用的遥控器。

  • 它将走路的按钮和手臂的滑块组合成一条长长的控制条。
  • 当机器人收到指令如“走到门口”时,它只按下控制条上的“走路按钮”。
  • 当指令是“拿起杯子”时,它只移动“手臂滑块”。
  • 神奇之处: 机器人不需要更换它的“大脑”或“遥控器”。它只需根据任务知道该使用遥控器的哪一部分。

2. “三阶段训练营”(多阶段策略)

你不能直接把一个机器人扔进复杂的现实世界并期望它立即掌握一切。作者通过三个特定的阶段训练了 OneVLA,就像学生升学一样:

  • 第一阶段:学习使用双手。 首先,他们教会机器人如何使用机械臂抓取、抬起和放置物体。他们还教会机器人观察图片并描述它们(以便它理解世界)。
  • 第二阶段:学习走路。 接下来,他们加入了导航数据。现在机器人学会了如何从 A 点移动到 B 点。因为它已经通过第一阶段学会了如何“看”和“思考”,所以它学得更快、更聪明。
  • 第三阶段:学习“大声思考”(思维链)。 最后,他们教会机器人“理清思路”。在行动之前,它会对自己说:“我在走廊里。我需要右转进入厨房。”这一步有助于机器人将所见、所需做以及如何移动之间的联系连接起来。

3. 结果:两种技能,一个大脑

论文声称,通过将这两项技能结合训练,它们实际上能让彼此变得更好。

  • 类比: 想想看,就像一名既打篮球又踢足球的运动员。学习运球(操纵)可能会提高他们的脚步和平衡感,从而帮助他们在足球场上跑得更好(导航)。
  • 证明: 在测试中,这个单一的机器人(OneVLA)击败了那些仅专门擅长走路或仅擅长用手的机器人。它也优于其他试图同时完成这两项任务、但仍需为每个任务设置不同“模式”或设置的“混合型”机器人。

总结

OneVLA 是一种新型的机器人大脑,当你要求它走路或要求它抓取东西时,它不需要重新编程。它使用一个统一的系统来理解语言、观察世界,并控制它的双脚和双手。作者展示了将这些技能结合在一起教学,会让机器人比分开教学时在两方面都变得更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →