← 最新论文
💻 computer science

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

Discrete-WAM 引入了一个统一的离散潜在框架,通过一个共享的离散扩散过程共同建模世界动力学与决策策略,从而对齐视觉与动作标记,以实现自动驾驶中的组合因果推理、可控生成以及反事实规划。

原作者: Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人开车。目前大多数方法就像是通过向学生展示一段完美驾驶员的视频,然后告诉他:“完全模仿你看到的一切。”机器人学会了模仿动作,但它并不真正理解驾驶员为什么要转动方向盘,或者这个转向如何改变接下来的情况。它只是在记忆一种模式。

其他方法试图构建一个“世界模型”——即对未来的心理模拟。但这些方法通常就像是试图用一片模糊、连续的数据云来预测天气。很难将这片云拆解成具体的、逻辑性的步骤,比如“如果我左转,旁边的车就会向右移动”。

Discrete-WAM(来自小米)是一种尝试解决这两个问题的新方法。以下是它的工作原理,用简单的语言解释如下:

1. “乐高”法(离散标记/Discrete Tokens)

与其将世界视为一段平滑、模糊的视频或一个复杂的数学方程,Discrete-WAM 将一切分解为乐高积木(称为“离散标记”)。

  • 视觉: 相机图像的每一部分都被转化为特定的乐高积木。
  • 动作: 汽车进行的每一次移动(加速、转向)也是特定的乐高积木。
  • 神奇之处: 因为图像和动作都是由同类型的乐高积木构成的,AI 可以轻松地将它们进行混合与搭配。它可以观察一段道路图像,拿起一个“左转”积木,并将其“卡”在图像上,从而看到未来的样子。

2. “编辑”按钮(统一生成/Unified Generation)

把这个 AI 想象成不是一个仅仅预测未来的机器,而是一个拥有“查找并替换”工具的编辑人员。

  • 过程: AI 从一个关于未来景象的粗略草稿开始(对道路和车辆路径的一个模糊猜测)。
  • 迭代优化: 然后,它会像作家修改故事一样,对这个草稿进行多次迭代。在每一轮中,它会观察那些看起来有误或不确定的“乐高积木”,并将它们替换为更好的积木。
  • 为什么有效: 这让 AI 可以尝试不同的“假设如果……”的情景。它可以问:“如果我在这里左转会怎样?”并立即编辑未来的图像以显示结果;接着它又可以问:“如果我右转会怎样?”并再次编辑那个场景。它不需要立即做出唯一的决定。

3. “船长与船员”(分层规划/Hierarchical Planning)

论文介绍了一种聪明的决策方式,将任务分成了两个角色:

  • 船长(高层决策): 这部分 AI 做出宏观、简单的选择:“我要变道了,”或者“我要停车了。”这就像船长下达一个总体的指令。
  • 船员(底层动作): 一旦船长下达指令,船员就会负责实现该指令的具体、细腻的动作。他们处理具体的转向和速度调整。
  • 益处: 这防止了 AI 产生混乱。如果它试图同时处理每一个微小的轮轴运动,它可能会陷入停滞。通过将“大想法”与“细节”分离,它能保持稳定与安全。

4. “安全模拟器”(反事实推理/Counterfactual Reasoning)

由于 AI 可以如此轻松地编辑未来,它就像是汽车的飞行模拟器。

  • 它可以运行一个汽车正常行驶的模拟,看看是否安全。
  • 然后,它可以“编辑”这个模拟过程,来询问:“如果行人突然横穿马路怎么办?”或者“如果我刹车太晚了怎么办?”
  • 如果模拟显示发生了碰撞(即 AI 没预料到的“意外”),系统就知道这条路径是危险的。这有助于汽车在实际发生事故前,先在脑海中测试危险场景,从而避免事故。

结果

研究人员在巨大的真实驾驶场景数据集上测试了这个系统。

  • 性能: 它的表现与当前顶尖系统持平,甚至更优。
  • 安全性: 它在避免碰撞和遵守交通规则方面表现更好。
  • 创造性: 不同于那些只会复制所见内容的系统,这个系统能够生成从未见过的、安全的驾驶路径,证明它真正理解了交通规则。

简而言之: Discrete-WAM 教会了一辆自动驾驶汽车用“乐高积木”进行思考。这让它能像视频编辑一样编辑未来,将宏观决策与微观细节分离,并在实际行动前通过心理模拟来检查动作是否安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →