WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving
该论文引入了 WA-JEPA,这是一种通过采用混合未来掩码预训练和条件流匹配来生成合理未来潜变量,从而在 NAVSIM 和 HUGSIM 等基准测试中实现自动驾驶规划领域最先进性能的新型世界-动作模型,重新思考了 Video JEPA 范式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
自动驾驶汽车长期以来一直依赖于模块化方法,即一个软件部分负责观察道路,另一个部分决定做什么,第三个部分则负责转向车辆。这种分离往往会导致错误不断累积,就像一场“传声筒”游戏,信息在每一次传递中都会发生扭曲。为了解决这个问题,研究人员一直在开发端到端系统,让系统直接从摄像头图像学习驾驶,从而转化为转向指令,就像人类驾驶员看到情况后直接做出反应,而不需要在意识中将其拆解成具体步骤一样。然而,这些系统在面对稀有或复杂的场景时往往表现挣扎,因为它们缺乏真正“预判”下一步会发生什么的思考能力。它们能清晰地看到当下,却难以想象未来,而这种想象力对于安全导航至关重要。
一个充满前景的新方向涉及“世界模型”(world models),这是一种旨在预测场景随时间如何变化的计算机程序。通过学习预测视频接下来的几秒钟,这些模型可以理解交通的动态变化,并利用这种预见性来规划自身的行动。然而,强大的视频预测技术与自动驾驶的具体需求之间仍存在显著差距。许多现有方法试图随机填补视频中缺失的部分,这对于理解过去很有帮助,但对于预测未来却效果不佳。另一些方法则依赖于简化的、压缩后的世界表征,这会导致丢失过多细节,从而无法用于复杂的决策。挑战在于,如何创建一个既能理解道路丰富、详细的现实,又能可靠地生成合理的未来场景的系统。
来自 Afari Intelligent Drive 及多所大学的研究人员通过重新思考一种被称为“视频联合嵌入预测架构”(V-JEPA)的特定架构,解决了这一问题。这项技术旨在从视频中学习深层、有意义的模式,而无需人工标签,但在其原始形式中,它是为了补全视频中缺失的部分,而非向时间维度向前看。团队意识到,对于一辆汽车要实现自动驾驶,它需要向前看,而不仅仅是填补空白。他们开发了一个名为 WA-JEPA 的新系统,将 V-JEPA 强大的学习能力专门适配于驾驶任务。WA-JEPA 不再是随机猜测视频中缺失的部分,而是通过观察当前的道路来预测未来的场景景象,同时决定汽车应该采取何种行动。
其创新的核心在于如何教导模型去思考时间。在训练的第一阶段,系统会被展示一段来自汽车多个摄像头的视频帧序列。随后,它被要求想象在最后一个可见时刻之后的未来帧。与以往可能尝试猜测视频中间缺失帧的方法不同,该模型被强制要求严格向前看,从而学习交通中的因果关系。为了使这些预测更加真实,研究人员用一种称为“流匹配”(flow matching)的技术取代了标准的数学方法。这使得模型能够生成一条平滑、连续的未来可能性路径,而不是仅仅猜测一个单一的静态结果。这一点至关重要,因为未来很少是一个固定的点,而是一系列车必须应对的可能性范围。
在第二阶段,研究人员将这种预见未来的能力直接与汽车的控制系统相连。他们构建了一个统一的系统,能够同时预测未来的道路外观和汽车未来的动作。通过将这两个任务结合起来训练,模型学习到世界的变化与汽车的移动方式直接相关。如果汽车转弯,视野会以特定的方式改变;如果汽车停止,世界表现出的行为也会不同。这种紧密的耦合意味着模型不仅是在观察世界,它还理解自己的行动如何塑造那个世界。其结果是,该系统可以通过在脑海中模拟未来,来对复杂的交通状况进行推理。
团队在名为 NAVSIM 的标准基准测试上测试了他们的系统,该测试使用真实的驾驶数据来评估自动驾驶车辆的导航能力。在 NAVSIM-v2 测试中,WA-JEPA 取得了 91.7 的得分,超越了现有的最佳端到端驾驶方法和其他世界模型方法。这一进步表明,该系统在避免碰撞和遵守交通规则方面表现得更好。更令人印象深刻的是,研究人员在另一个完全不同的闭环模拟器 HUGSIM 上测试了该模型,且没有给予其针对该环境的任何额外训练。在这种“零样本”(zero-shot)测试中,汽车必须持续驾驶并实时对自身错误做出反应,WA-JEPA 取得了 0.4462 的高分,以显著优势超越了所有其他方法。这表明,将预测未来与规划行动结合在一起的能力,创造了一种能够很好地迁移到新场景和未知情况下的鲁棒理解力。
研究结果表明,提升自动驾驶水平的关键可能不在于增加更多的传感器或更复杂的规则,而在于教导系统更准确地想象未来。通过将重心从单纯地完成缺失的视频数据转向主动预测接下来的情况,并将这种预测与汽车的决策直接挂钩,研究人员创造了一个具有更具人类特征的前瞻性模型的系统。这种方法弥合了理解视觉世界与采取行动之间的鸿沟,为实现能够以更高信心和安全性应对现实道路不可预测性的车辆提供了一条路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。