← 最新论文
🤖 AI

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation

本文介绍了 DRIVE-CHOREO,一种由大语言模型(LLM)编排的多智能体世界模型,它通过共享的潜在标记序列(latent token sequence)和协同压缩策略,将异构驾驶控制与多视图几何统一起来,实现了最先进的一致性,并证明了其在自动驾驶任务中的显著下游效用。

原作者: Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan, Miao Zhang

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan, Miao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向机器人展示驾驶视频来教它如何开车。机器人需要同时理解三件事:驾驶员在说什么(语言)、车辆和道路在哪里(几何结构),以及摄像机实际看到了什么(像素)。

长期以来,AI 研究人员一直难以让这三者顺畅地协同工作。这就像是在指挥一个管弦乐团,但小提琴手在读乐谱,鼓手在听播客,而歌手在即兴发挥,且没有指挥。其结果往往是一场混乱的演出:车可能会突然瞬间移动,天空在不同摄像机之间变换颜色,或者机器人忽略了交通灯。

这篇论文介绍了 OMNIDRIVE,它是一个全新的系统,扮演着首席电影导演的角色来解决这一混乱局面。以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:“脱节”的剧组

目前的驾驶视频 AI 模型通常将“是什么”(语言)和“在哪里”(地图)与“看起来像什么”(视频)分开处理。

  • 问题在于: 它们试图在视频基本生成之后,再将这些独立的部件粘合在一起。这就像是在电影已经开始播放后,才试图把一张地图贴在电影屏幕上。其结果往往会出现“漂移”现象,例如左侧摄像机看到的是一棵树,但右侧摄像机看到的却是一栋建筑,或者汽车发生了奇怪的跳跃。

2. 解决方案:“三智能体”导演

OMNIDRIVE 用一个由三个专业 AI 智能体(由大语言模型驱动)组成的团队取代了混乱的胶水,这些智能体在视频创建之前和期间协同工作。把它们想象成一个电影制作团队:

  • 建筑师(编剧): 你给它一个简单的提示词,比如“在雨夜的城市中穿行”。建筑师会将此转化为一份严格、结构化的剧本,称为 WORLDSCRIPT(世界剧本)。它会详细列出天气情况、自车(你的车)的行驶方向以及其他车辆的位置。
  • 制图师(场景设计师): 这个智能体获取剧本并绘制出一张“蓝图”或稀疏地图。它并不绘制整个视频,而只是画出道路线条、车道以及围绕其他车辆的方框。它将文本转化为与摄像机视角相匹配的视觉地图。
  • 审计员(质量控制检查员): 在视频生成过程中,这个智能体负责观察不同的摄像机视图。如果前置摄像机看到的是一辆红车,而侧面摄像机看到的却是蓝车,审计员就会大喊:“嘿,这不对劲!”并指示系统立即修正。

3. 核心秘诀:“潜空间共压缩”(Latent Co-Compression)

这是该论文中最具技术性但也最关键的创新。通常情况下,AI 会分别观察汽车上的六个摄像机,就像是一个接一个地通过六扇不同的窗户看出去。

OMNIDRIVE 的做法不同。它将来自六个摄像机的视频和来自制图师的“蓝图”全部提取出来,在 AI 开始生成视频之前,就将它们缝合成一个单一的、长条状的数据块

  • 类比: 想象你有六块不同的拼图碎片。与其在涂完色后再尝试将它们拼凑在一起,不如先将它们全部粘贴在一块大板上。然后,你一次性为整块板涂色。因为它们在板上是物理连接在一起的,所以油漆(视频)会自然地从一个摄像机流向下一个,不会出现间隙或错误。
  • 结果: AI 将其视为一个统一的 3D 物体,而不是六张独立的 2D 图片。这确保了如果一辆车在左边,它也必然在右边,且位置完全准确。

4. 结果:一部完美对齐的电影

由于语言、地图和视频从第一步起就是“编排”在一起的:

  • 不再有重影: 车辆不会在不同摄像机视图之间消失或瞬间移动。
  • 完美的连贯性: 所有六个摄像机之间的光照和阴影都能完美匹配。
  • 现实应用: 论文表明,如果仅使用由 OMNIDRIVE 生成的视频来训练自动驾驶汽车的大脑,那么这辆车在现实世界中的驾驶表现实际上比仅用真实素材训练的汽车更好。

总结

OMNIDRIVE 就像是自动驾驶视频生成的超级导体。它不再让语言、地图和摄像机彼此争吵,而是强迫它们坐在同一张桌子旁,使用同一种语言,并保持完美的同步。其结果是一个如此逼真且连贯的驾驶模拟系统,以至于它真的可以教会真实的汽车如何安全驾驶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →