← 最新论文
💻 computer science

Flash-WAM: Modality-Aware Distillation for World Action Models

Flash-WAM 是一种模态感知型步进蒸馏框架,它通过采用针对视频和动作流的不同噪声机制而定制的差异化一致性参数化方法,实现了世界动作模型(World Action Models)的实时单步推理,从而在保持高任务成功率的同时实现了 23 倍的加速。

原作者: Arman Akbari, Ci Zhang, Arash Akbari, Lin Zhao, Yixiao Chen, Weiwei Chen, Xuan Zhang, Geng Yuan, Yanzhi Wang

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Arman Akbari, Ci Zhang, Arash Akbari, Lin Zhao, Yixiao Chen, Weiwei Chen, Xuan Zhang, Geng Yuan, Yanzhi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人完成一项复杂的任务,比如拿起一个瓶子并把它放入杯中。为了做到这一点,机器人使用了一个“世界-动作模型”(World-Action Model,简称 WAM)。你可以把这个模型想象成一位极其专业的导演,他需要同时完成两件事:

  1. 预演未来的电影: 他要想象出场景在接下来的几秒钟内看起来会是什么样子。
  2. 编写剧本: 他要决定机器人的手臂需要做出哪些精确的物理动作,来创造出这段视频。

问题所在:机器人太慢了

目前的这个“导演”虽然非常严谨,但速度慢得令人痛苦。为了生成仅仅一瞬间的视频和动作,该模型需要进行一个被称为“去噪”(denoising)的复杂数学过程大约 75 次(视频 25 次,动作 50 次)。

  • 类比: 想象一下,你试图通过从一个混乱的涂鸦开始,然后慢慢擦掉错误来画出一幅完美的画。每帧画面都要重复这个过程 75 次,这意味着机器人仅为了规划一个微小的瞬间就需要 8.1 秒
  • 后果: 实时控制需要在约 0.5 秒 内完成。而在 8.1 秒的延迟下,机器人实际上处于“冻结”状态,无法对移动的世界做出反应。

失败的捷径:“一刀切”的方法

科学家们尝试使用一种叫做“蒸馏”(distillation)的技术来加速这一过程。这就像是带一个学生,训练他通过仅仅 一步 就能模仿出老师的最终答案,而不是像老师那样走 75 步。

然而,当他们尝试在视频和动作上同时使用这种标准的“一刀切”捷径时,完全失败了

  • 为什么? 视频和动作在本质上是不同的。
    • 视频 就像一幅模糊的高分辨率绘画。它有很多细节,但具有容错性;即使出一点小错,你依然能认出画的是什么。
    • 动作 则像是外科医生的手部动作。它们极其微小且精准。如果偏差了一毫米,任务就会失败。
  • 错误之处: 标准的捷径将外科医生的手与那幅模糊的绘画同等对待。它使用了一种对“绘画”效果极佳、但完全忽略了“外科医生”的数学公式。结果是,机器人学会了如何制作精美的动作视频,却忘记了如何实际移动它的手臂。成功率从 91% 骤降至 24%

解决方案:Flash-WAM(特种教练)

作者创建了 Flash-WAM,这是一种全新的训练方法,它像一位知道视频和动作需要不同教学风格的特种教练。

Flash-WAM 不再对两者使用同一套规则,而是使用了 两种不同的规则

  1. 针对视频(绘画): 它使用了一种专为高噪声、复杂数据设计的处理方法。这保证了视频看起来既美观又稳定。
  2. 针对动作(手术): 它使用了完全不同的、专为低噪声、高精度数据设计的数学公式。这确保了机器人在学习动作的微小关键细节时,不会丢失其“信号”。

通过针对每个“流”的具体需求量身定制训练,Flash-WAM 让机器人能够在仅用 一步 的时间内,同时学会老师的视频生成和动作控制技能。

结果:从“冻结”到“实时”

这一改变带来了巨大的影响:

  • 速度: 规划一次动作所需的时间从 8.1 秒 降至 0.35 秒(348 毫秒)。这是 23 倍的加速,终于让机器人能够实现实时移动。
  • 性能:
    • 在计算机模拟中,机器人保持了极高的成功率(约 85-95%),而“一刀切”的方法则让成功率崩塌到了 24%
    • 在一台真人大小的机器人(Unitree G1)上,Flash-WAM 在实际任务中达到了 60% 的成功率。相比之下,如果只是简单地加速旧模型而不进行这种特殊训练,成功率会降至 23%;而使用标准捷径,成功率则降至 43%

总结

把 Flash-WAM 想象成意识到:你不能用同样的方式去训练马拉松选手和走钢丝的人,尽管他们都是运动员。通过给予他们各自所需的特定训练,机器人终于可以像在现实世界中互动一样,既能思考得快,又能动得快,同时还不失完成任务的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →