← 最新论文
💻 computer science

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

本文提出了 DUST,一种双流扩散框架,通过引入世界模型增强视觉 - 语言 - 动作模型,以克服模态鸿沟并提升机器人策略学习,借助跨模态因果学习与异步采样,在模拟和真实世界任务中均实现了显著的性能提升。

原作者: John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做饭。你希望它不仅能听从你的语音指令(“把洋葱切碎”),还能理解切碎洋葱后会发生什么。洋葱会飞起来吗?它会留在碗里吗?

目前的机器人“大脑”(称为视觉 - 语言 - 动作模型,或 VLAs)在听和看方面表现出色,但它们往往像只盯着汽车正前方道路的司机。它们知道如何转动方向盘,但并没有真正“想象”未来的景象。它们难以预测自己的行动将如何改变周围的世界。

其他研究人员试图通过强迫机器人在同一时刻预测未来并决定行动来解决这个问题,使用同一个“大脑”。但这就像试图用同一只手同时绘制一幅细致的风景画和写一首诗;这两项任务截然不同,以至于它们会互相干扰。机器人在手臂平滑、简单的动作与视频图像中混乱、复杂的细节之间感到困惑。

现在出现了DUST(双流扩散),这是作者提出的一种新框架。以下是其工作原理,使用简单的类比:

1. 双轨列车系统(双流)

DUST 没有强迫机器人在一个巨大的大脑中完成所有事情,而是为它提供了两条独立的轨道

  • 轨道 A(动作流): 这条轨道处理机器人的运动。它就像一位指挥家,管理着平滑、有节奏的舞蹈。它不需要担心桌面的纹理或房间的灯光;它只需要知道如何移动。
  • 轨道 B(视觉流): 这条轨道处理“未来的画面”。它就像一位电影导演,想象接下来几秒钟的场景会是什么样子。它处理复杂、高清的细节。

通常,这两条轨道并行运行。但 DUST 拥有一座特殊的桥梁(称为“跨模态注意力”层)将它们连接起来。这使得“电影导演”可以告诉“指挥家”:“嘿,如果你把杯子移到那里,它可能会洒出来!”而指挥家可以回答:“好的,我会慢一点移动。”它们在分享知识的同时不会互相纠缠。

2. “噪声”游戏(解耦训练)

为了训练这两条轨道协同工作,研究人员使用了一种涉及噪声(静电或杂讯)的巧妙训练游戏。

  • 想象一下,你试图同时教某人识别一张脸(视觉)和一个声音(动作)。
  • 在旧方法中,你会以完全相同的方式在同一时间模糊人脸并扭曲声音。
  • DUST中,他们玩一种“混合与匹配”的游戏。有时他们展示一张清晰的脸,但声音完全被扰乱;其他时候,他们展示清晰的声音,但人脸模糊。
  • 这迫使机器人深入理解因果关系。它学会了:“如果我看到这个特定的动作,我就应该预期那个特定的视觉结果”,即使数据很混乱。它教会机器人理解世界的物理规律,而不仅仅是记忆模式。

3. 异步之舞(推理时的扩展)

当机器人实际执行任务(推理)时,这两条轨道不需要以相同的速度移动。

  • 视觉很复杂。它就像绘制一幅杰作;需要许多微小、细致的笔触才能确保细节正确。
  • 动作更简单。它就像轻敲一下鼓;不需要那么多步骤就能把握节奏。
  • DUST 允许视觉轨道进行更多步骤来细化其对未来的预测,而动作轨道则进行较少步骤来决定做什么。这就像一场舞蹈,其中一位舞伴进行缓慢、复杂的旋转,而另一位则进行快速的步伐。这节省了时间,使机器人更聪明,而不会过度减慢其速度。

他们发现了什么?

作者在三个方面测试了这种"DUST"机器人:

  1. 在模拟中(RoboCasa 和 GR-1): 他们将机器人放入虚拟厨房和虚拟人形身体中。DUST 以显著优势(高达 6% 的提升)击败了所有之前的最佳机器人,尤其是在给予其较少的学习数据时。
  2. 在现实世界中(Franka 机械臂): 他们将机器人安装在真实实验室中的真实金属机械臂上。DUST 在抓取物体和使用工具等任务上的成功率比竞争对手高出 10%
  3. 从视频中学习: 他们向 DUST 展示了数千小时的视频,这些视频没有包含任何机器人动作(只有人们在移动物体)。DUST 从这些视频中学习,然后将这些知识迁移到真实机器人上,使其工作表现大幅提升。

结论

DUST 是一种教机器人“提前思考”的新方法。它没有将所有内容塞进一个混乱的大脑,而是为机器人提供了两个专门的助手——一个负责移动,一个负责想象未来——它们不断相互沟通。这使得机器人能够更好地理解物理世界,减少错误,并加快学习速度,无论是在计算机模拟中还是在现实世界的厨房里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →