← 最新论文
💻 computer science

From Foundation to Application: Improving VLA Models in Practice

本文介绍了 LingBot-VLA 2.0,这是一种通过大规模多具身预训练增强泛化能力、扩展动作空间以支持全身操控、并通过预测动力学建模提升时间推理能力,从而弥合实验室研究与现实世界应用之间差距的 VLA 基础模型。

原作者: Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan
发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢的机器人学生,他们曾在完美受控、安静的教室(即“实验室”)里苦读多年。他们在灯火通明、桌面整洁且老师给出精确指令时,非常擅长解决谜题。但一旦你把他们带进一个繁忙、嘈杂的厨房去实际做晚餐,他们就会陷入僵局。他们不知道如何应对摇晃的椅子、湿滑的勺子或移动的地板。

这篇论文介绍了 LingBot-VLA 2.0,这是一个重大的升级,旨在将那个“教室机器人”转变为“厨房就绪型机器人”。作者认为,要让机器人对现实世界有用,我们需要解决三个特定问题:多样性、运动能力和预见性。

以下是他们是如何实现的,通过简单的类比来解释:

1. “超级学生”训练营(泛化能力)

问题: 之前的机器人是在非常具体、有限的数据上进行训练的。这就像是教一个学生只在一条单一、空旷的赛道上开车。他们无法处理不同的车或雨中的路面。
解决方案: 团队建立了一个规模宏大的“训练营”,拥有 60,000 小时 的视频素材。

  • 混合构成: 他们不仅仅使用一种类型的机器人。他们收集了来自 20 种不同机器人躯体 的数据(有些只有一个手臂,有些有两个,有些有轮子,有些有腿)。
  • 人类触感: 他们还加入了 10,000 小时 从人类视角拍摄的视频(就像戴在头上的 GoPro),展示了人类如何自然地移动双手和身体来完成任务。
  • 结果: 通过喂给机器人这种“多样化的饮食”,它学会了成为一名通才。它不再是某个房间里的专才,而是一个能够适应不同机器人躯体和复杂环境的杂家。

2. “全身舞步”(扩展动作空间)

问题: 大多数机器人的训练目标仅限于移动手臂,就像一个人坐在椅子上,双手被固定在桌子上。它们无法转动头部观察四周、扭转腰部、在轮子上滚动或使用灵巧的手指。
解决方案: LingBot-VLA 2.0 学会了控制其全身。

  • 类比: 想象一位钢琴家,此前只被允许用手指按键。现在,他还可以站起来,走到钢琴旁,调整凳子,转头阅读乐谱,甚至用脚趾敲击节奏。
  • 能力: 新模型可以控制机器人的头部、腰部、移动底座(轮子)以及灵巧的手部。这使得机器人能够处理需要协调能力的复杂工作,比如走近冰箱、打开门并抓取一个瓶子,并完成一连串流畅的动作。

3. “水晶球”(预测动力学)

问题: 旧的机器人只能对它们“当下”看到的东西做出反应。如果一个球开始滚动,它们会等到球撞到它们时才做出反应。它们缺乏“时间推理”能力——即思考“接下来会发生什么”的能力。
解决方案: 团队教会了机器人预测未来。

  • 类比: 机器人不再只是看着棋盘移动棋子,而是正在玩一场游戏,在做出移动之前,它必须猜出三步之后棋盘会是什么样子。
  • 运作方式: 他们使用了两位“老师”来帮助机器人学习:
    1. 深度老师: 向机器人展示物体距离有多远(几何结构)。
    2. 视频老师: 向机器人展示事物随时间变化的规律(因果关系)。
  • 结果: 机器人现在可以“想象”场景的未来状态。它知道如果它推一下杯子,杯子会滑动;如果它打开门,门会摆动。这有助于它提前规划,而不是仅仅做出反应。

证明:通过“现实世界考试”

为了测试这些变化是否奏效,研究人员让机器人参加了一系列被称为 GM-100 基准测试 的困难挑战。

  • 任务: 这些不是像“拿起一个方块”这样简单的任务,而是复杂的、多步骤的工作,例如“将零食分类放入容器”、“从盘子里捡起玩具骨头”或“从微波炉里取出碗”。
  • 结果: LingBot-VLA 2.0 的表现显著优于之前的版本和其他顶尖模型。它不仅完成任务的成功率更高,而且能更好地处理混乱的现实世界变化。它还展示了自己能够处理长序列、复杂的任务(例如从一个房间移动到另一个房间去清理炉灶)而不会迷失方向。

总结

简而言之,LingBot-VLA 2.0 是一个经过升级的机器人大脑,使其变得:

  1. 更具适应性(经过 20 种不同机器人类型和人类视频的训练)。
  2. 更具移动性(可以移动全身,而不只是手臂)。
  3. 更具前瞻性(可以预测世界在接下来的几秒钟内会如何变化)。

该论文声称,这使机器人智能从“实验室成功”迈向了“实际应用”,使它们准备好真正进入我们的家庭和工作场所提供帮助。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →