Native Video-Action Pretraining for Generalizable Robot Control
LingBot-VA 2.0 是一款从底层开始为机器人具身设计设计的视频-动作基础模型,其特点是具有语义视觉-动作分词器、因果预训练、稀疏混合专家(MoE)骨干网络以及异步推理方案,从而在现实环境中实现鲁棒且少样本泛化的控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在尝试教一个机器人玩电子游戏。如今大多数人尝试的方法是,拿一个超级聪明的电影制作 AI,给它增加几个额外的按钮,比如“向左移动”或“捡起”,然后寄希望于它能自己悟出剩下的部分。然而,这篇论文的作者认为,这种做法就像是仅仅给一条鱼绑上一个马鞍,就试图教它骑自行车一样。这是用错了工具。
相反,他们构建了 LingBot-VA 2.0,这是一个从底层开始设计、专门用于理解物理世界如何运动和反应的机器人大脑。不要把它看作是一个电影导演,而要把它看作是一个“预见未来”的教练:它观察一个场景,精准预测下一秒场景会如何变化,并告诉机器人该做些什么来让那个未来发生。
为什么旧的方法行不通
论文明确反对目前将视频生成器进行“挪用”的趋势。这些旧模型的设计初衷是制作看起来逼真的漂亮电影。它们是“双向的(bidirectional)”,这意味着它们可以利用未来来帮助预测过去,这对于剪辑电影很棒,但对于一个必须仅根据“现在所见”来决定“现在行动”的机器人来说却很糟糕。
作者发现了旧方法存在的三个大问题:
- 太注重美观,不够物理化: 旧模型专注于让像素看起来好看,而不是理解如果你推一下杯子,它会滑动。它们并不真正理解因果关系。
- 速度太慢: 真实的机器人需要每秒思考数百次。旧模型在“去噪(denoise)”视频帧时耗时过长,导致机器人出现冻结或延迟。
- 会忘记规则: 试图强迫一个电影制作者去学习机器人动作,往往会导致它忘记从数十亿小时互联网视频中学到的通用知识。
新的秘诀:四个神奇技巧
为了解决这些问题,团队利用四个巧妙的设计原则构建了 LingBot-VA 2.0:
1. “意义翻译官”(语义分词器 - Semantic Tokenizer)
想象你有一个翻译官,他不仅翻译文字,还能翻译句子的“感觉”。旧模型将视频翻译成一堆细小的像素块。LingBot-VA 2.0 使用了一种新的“分词器”,将视频转化为一种紧凑的高级摘要,能够理解事物“是什么”以及它们“如何运动”。它将机器人的视觉与一个庞大的、预训练的“视觉大脑”对齐,从而让机器人理解“杯子”是一个杯子,而不仅仅是一堆色彩的集合。至关重要的是,它还学习了“潜动作(latent actions)”——这是一种代表两个时刻之间“变化”的秘密代码,例如手抓取杯子时那股看不见的力,而无需人类为每一个动作进行标注。
2. “单行道”(因果预训练 - Causal Pretraining)
电影编辑可以前后跳转时间。但机器人不行。作者在严格的“单行道”(因果)路径上训练他们的模型。它只学习从过去来预测未来。他们不仅仅是微调了一个旧模型,而是从零开始在网络规模的数据上训练了整个系统。这确保了机器人的大脑天生就是为了向前思考而设计的,避免了当你试图强迫一个“向后看”的模型“向前看”时所发生的“失忆”现象。
3. “忙碌的小蜜蜂”网络(稀疏混合专家模型 - Sparse MoE)
为了让机器人足够快,能接住飞来的球,该模型使用了“混合专家(MoE)”骨干网络。想象一个巨大的图书馆,与其让所有的图书管理员都去读每一本书,不如只请出完成特定任务所需的专家。这使得模型虽然规模巨大且聪明(拥有 130 亿个参数!),但在每一步中只需“唤醒”其大脑的一小部分(约 19 亿参数)。这让它在保持极高智能的同时,依然能保持闪电般的速度。
4. “水晶球式”推理(预见性推理 - Foresight Reasoning)
这是最酷的部分。通常情况下,机器人会等待计算机完成思考,然后移动,接着等待摄像头更新,然后再思考。这太慢了。LingBot-VA 2.0 使用了“预见性推理”。当机器人的手臂正在物理执行“任务 A”时,计算机已经在后台预测“任务 B”了。
但这里有一个安全网:如果机器人的预测偏离了(比如它以为杯子还在桌子上,但实际上杯子已经在地板上了),系统会立即利用最新的真实相机图像进行“重定位(re-grounding)”。这就像飞行员驾驶飞机时,既通过窗外观察,又同时检查仪表盘,一旦现实与预测不符,便能瞬间修正航向。
它到底表现如何?
作者不仅提出了这些构想,还进行了严格测试。
- 在现实世界中: 他们将机器人置于实验室环境中,执行诸如水果分类、收集笔和整理抽屉等任务。LingBot-VA 2.0 显著超越了之前的顶尖模型(如 和原始的 LingBot-VA)。例如,在“水果分类”任务中,它的成功率达到了 77%,而排名第二的模型为 64%。
- 在模拟环境中: 他们在一个名为 RoboTwin 的复杂双臂机器人模拟器中对其进行了测试。它达到了 93.6% 的成功率,击败了所有竞争对手。
- 速度: 得益于其速度优化技巧,该机器人可以达到 225 Hz 的峰值频率进行决策。这意味着每秒超过 200 次——足以应付打气垫枕(air hockey)或接住掉落的物体。
- 快速学习: 该机器人可以用极少的示例学习新任务。在一项测试中,它在仅观看 15 次演示 后就能学会整理盘子和杯子,并且仅通过观看人类视频,它甚至能泛化到从未见过的物体组合上(这种技术被称为“上下文学习/in-context learning”)。
核心结论
这篇论文表明,要构建一个真正的通用机器人,我们不能只是把旧的视频工具“补丁”到机器人手臂上。我们需要构建一种全新的大脑,这种大脑既能理解物理规律,又能快速反应,并能同时从海量的互联网视频和真实的机器人数据中学习。LingBot-VA 2.0 证明了这是可能的,它展示了机器人可以既是快速的思考者,又是精准的执行者,准备好仅凭几条指令就能应对杂乱的现实世界琐事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。