← 最新论文
💻 computer science

Native Video-Action Pretraining for Generalizable Robot Control

LingBot-VA 2.0 是一款从底层开始为机器人具身设计设计的视频-动作基础模型,其特点是具有语义视觉-动作分词器、因果预训练、稀疏混合专家(MoE)骨干网络以及异步推理方案,从而在现实环境中实现鲁棒且少样本泛化的控制。

原作者: Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Gua
发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试教一个机器人玩电子游戏。如今大多数人尝试的方法是,拿一个超级聪明的电影制作 AI,给它增加几个额外的按钮,比如“向左移动”或“捡起”,然后寄希望于它能自己悟出剩下的部分。然而,这篇论文的作者认为,这种做法就像是仅仅给一条鱼绑上一个马鞍,就试图教它骑自行车一样。这是用错了工具。

相反,他们构建了 LingBot-VA 2.0,这是一个从底层开始设计、专门用于理解物理世界如何运动和反应的机器人大脑。不要把它看作是一个电影导演,而要把它看作是一个“预见未来”的教练:它观察一个场景,精准预测下一秒场景会如何变化,并告诉机器人该做些什么来让那个未来发生。

为什么旧的方法行不通

论文明确反对目前将视频生成器进行“挪用”的趋势。这些旧模型的设计初衷是制作看起来逼真的漂亮电影。它们是“双向的(bidirectional)”,这意味着它们可以利用未来来帮助预测过去,这对于剪辑电影很棒,但对于一个必须仅根据“现在所见”来决定“现在行动”的机器人来说却很糟糕。

作者发现了旧方法存在的三个大问题:

  1. 太注重美观,不够物理化: 旧模型专注于让像素看起来好看,而不是理解如果你推一下杯子,它会滑动。它们并不真正理解因果关系。
  2. 速度太慢: 真实的机器人需要每秒思考数百次。旧模型在“去噪(denoise)”视频帧时耗时过长,导致机器人出现冻结或延迟。
  3. 会忘记规则: 试图强迫一个电影制作者去学习机器人动作,往往会导致它忘记从数十亿小时互联网视频中学到的通用知识。

新的秘诀:四个神奇技巧

为了解决这些问题,团队利用四个巧妙的设计原则构建了 LingBot-VA 2.0:

1. “意义翻译官”(语义分词器 - Semantic Tokenizer)
想象你有一个翻译官,他不仅翻译文字,还能翻译句子的“感觉”。旧模型将视频翻译成一堆细小的像素块。LingBot-VA 2.0 使用了一种新的“分词器”,将视频转化为一种紧凑的高级摘要,能够理解事物“是什么”以及它们“如何运动”。它将机器人的视觉与一个庞大的、预训练的“视觉大脑”对齐,从而让机器人理解“杯子”是一个杯子,而不仅仅是一堆色彩的集合。至关重要的是,它还学习了“潜动作(latent actions)”——这是一种代表两个时刻之间“变化”的秘密代码,例如手抓取杯子时那股看不见的力,而无需人类为每一个动作进行标注。

2. “单行道”(因果预训练 - Causal Pretraining)
电影编辑可以前后跳转时间。但机器人不行。作者在严格的“单行道”(因果)路径上训练他们的模型。它只学习从过去来预测未来。他们不仅仅是微调了一个旧模型,而是从零开始在网络规模的数据上训练了整个系统。这确保了机器人的大脑天生就是为了向前思考而设计的,避免了当你试图强迫一个“向后看”的模型“向前看”时所发生的“失忆”现象。

3. “忙碌的小蜜蜂”网络(稀疏混合专家模型 - Sparse MoE)
为了让机器人足够快,能接住飞来的球,该模型使用了“混合专家(MoE)”骨干网络。想象一个巨大的图书馆,与其让所有的图书管理员都去读每一本书,不如只请出完成特定任务所需的专家。这使得模型虽然规模巨大且聪明(拥有 130 亿个参数!),但在每一步中只需“唤醒”其大脑的一小部分(约 19 亿参数)。这让它在保持极高智能的同时,依然能保持闪电般的速度。

4. “水晶球式”推理(预见性推理 - Foresight Reasoning)
这是最酷的部分。通常情况下,机器人会等待计算机完成思考,然后移动,接着等待摄像头更新,然后再思考。这太慢了。LingBot-VA 2.0 使用了“预见性推理”。当机器人的手臂正在物理执行“任务 A”时,计算机已经在后台预测“任务 B”了。
但这里有一个安全网:如果机器人的预测偏离了(比如它以为杯子还在桌子上,但实际上杯子已经在地板上了),系统会立即利用最新的真实相机图像进行“重定位(re-grounding)”。这就像飞行员驾驶飞机时,既通过窗外观察,又同时检查仪表盘,一旦现实与预测不符,便能瞬间修正航向。

它到底表现如何?

作者不仅提出了这些构想,还进行了严格测试。

  • 在现实世界中: 他们将机器人置于实验室环境中,执行诸如水果分类、收集笔和整理抽屉等任务。LingBot-VA 2.0 显著超越了之前的顶尖模型(如 π0.5\pi0.5 和原始的 LingBot-VA)。例如,在“水果分类”任务中,它的成功率达到了 77%,而排名第二的模型为 64%。
  • 在模拟环境中: 他们在一个名为 RoboTwin 的复杂双臂机器人模拟器中对其进行了测试。它达到了 93.6% 的成功率,击败了所有竞争对手。
  • 速度: 得益于其速度优化技巧,该机器人可以达到 225 Hz 的峰值频率进行决策。这意味着每秒超过 200 次——足以应付打气垫枕(air hockey)或接住掉落的物体。
  • 快速学习: 该机器人可以用极少的示例学习新任务。在一项测试中,它在仅观看 15 次演示 后就能学会整理盘子和杯子,并且仅通过观看人类视频,它甚至能泛化到从未见过的物体组合上(这种技术被称为“上下文学习/in-context learning”)。

核心结论

这篇论文表明,要构建一个真正的通用机器人,我们不能只是把旧的视频工具“补丁”到机器人手臂上。我们需要构建一种全新的大脑,这种大脑既能理解物理规律,又能快速反应,并能同时从海量的互联网视频和真实的机器人数据中学习。LingBot-VA 2.0 证明了这是可能的,它展示了机器人可以既是快速的思考者,又是精准的执行者,准备好仅凭几条指令就能应对杂乱的现实世界琐事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →