← 最新论文
💻 computer science

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM 引入了一种统一的概率世界模型,通过生成对齐的全景多模态视频,同时解决了状态、动作和奖励维度的问题,通过几何动作编码实现精确的零样本轨迹控制,并从 3D 占据空间中推导出内在的稠密奖励,以进行鲁棒的闭环规划评估。

原作者: Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人开车。为了安全起见,你不能只给它看几段视频;你需要在计算机内部构建一个虚拟世界,让机器人在其中练习驾驶、犯错,并从错误中学习,而不会撞毁一辆真实的汽车。

这篇论文介绍了一种名为 OmniNWM 的新型“虚拟驾驶模拟器”,它比以往的版本要聪明得多。作者称其为“全知”(Omniscient)世界模型,因为它不仅是在猜测道路的样子,它还同时理解道路、车辆的运动以及其行为所带来的后果。

以下是它的工作原理,通过三个日常类比将其拆解为三个简单的部分:

1. “全能之眼”(状态/State)

问题: 旧的模拟器就像是一个戴着眼罩的人,一次只能看到一件东西。它们可能会生成一段道路视频,但如果它们试图猜测树木的距离或标志牌的颜色,这些猜测往往与视频内容不符。这就像在看一部背景随机变化的电影。

OmniNWM 的解决方案: OmniNWM 就像一位大师级的画家,在同一块画布上同时绘制四个不同版本的场景

  1. 照片 (RGB): 摄像头看到的画面。
  2. 地图 (语义/Semantics): 物体是什么(例如:“那是一辆车”、“那是一条路”)。
  3. 尺子 (深度/Depth): 物体有多远。
  4. 3D 模块 (占用/Occupancy): 一个实体的 3D 模型(空间里是空气还是墙壁?)。

因为它是同时绘制这四种视图的,所以它们能够完美对齐。如果机器人在“深度”版本中认为一辆车在 10 米处,那么“照片”版本中的车也会呈现出正确的尺寸。这确保了虚拟世界的物理一致性。

2. “万能遥控器”(动作/Action)

问题: 在旧的模拟器中,教机器人左转就像是用一个只能控制特定品牌电视的遥控器来教它开车。如果你更换了摄像头设置(即换了一台“电视”),遥控器就会失效。机器人会感到困惑,因为它学到的是摄像头的“形状”,而不是“转向”这个概念本身。

OmniNWM 的解决方案: 作者发明了一个被称为**“归一化全景射线图”(Normalized Panoramic Ray-map)“万能遥控器”**。

  • 想象你有一张城市地图。无论你是从北向南看,还是从南向北看,甚至是倒过来观察,城市的布局都不会改变。
  • OmniNWM 将每条驾驶指令(如“左转”或“直行”)转化为这种通用的地图语言。
  • 这意味着机器人可以在一个城市(使用一套特定的摄像头)中学习驾驶,然后立即在另一个拥有不同摄像头的完全不同的城市中驾驶,而无需重新学习任何东西。它理解的是转向的几何逻辑,而不只是摄像头的角度。

3. “天生的良知”(奖励/Reward)

问题: 通常,为了教机器人,你需要一个人类老师在它每做一个动作后说:“做得好!”或“做得不好!”。在计算机模拟中,这个老师通常是一个独立的、黑盒化的程序,它可能会出错或表现得前后不一。

OmniNWM 的解决方案: OmniNWM 给机器人赋予了一个内置的良知

  • 因为模拟器创建了一个完美的 3D 世界模型(即前面提到的“占用”模型),机器人可以立即检查:“我是不是撞墙了?”或者“我是不是开上人行道了?”
  • 计算机根据物理规律自动计算“得分”(奖励)。如果机器人开进了虚拟的树木,它会受到惩罚;如果它保持在车道内,它会获得奖励。
  • 这创造了一个闭环:机器人驾驶,世界检查其安全性,给出评分,然后机器人利用该评分来规划下一步行动。这就像玩电子游戏,游戏引擎本身就会告诉你是在赢还是在输,而不需要一个人类裁判。

为什么这很重要?

论文声称,由于 OmniNWM 结合了这三点(清晰地观察一切、理解通用运动、自动判断安全性),它可以:

  • 驾驶时间更长: 它不会像旧模型那样在行驶几秒钟后就感到困惑或“偏离”路线。
  • 处理新情况: 它可以驾驶在从未见过的城市中(如 nuPlan 数据集),因为它理解驾驶的通用规则,而不仅仅是它所训练的具体数据。
  • 模拟交互: 如果机器人试图切入一辆卡车的前面,模拟器会自然地让卡车“减速”或“让行”,因为模拟器学习了真实驾驶员如何反应,而不是靠程序脚本来设定。

简而言之,OmniNWM 是一个自给自足的高保真驾驶学校,机器人可以在其中练习数小时,从自己的错误中学习,并成为一名安全的驾驶员,而无需人类时刻在旁指导,也不需要特定的摄像头设置也能正常工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →