From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving
本文研究了视觉语言模型与纯视觉编码器在端到端驾驶中的表示与行为互补性,证明了利用两者在简单与复杂场景中各自优势的混合架构,相比于单一基准模型,能显著提高准确性与效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人开车。很长一段时间,工程师们试图用两种不同的“大脑”来教这个机器人。其中一个大脑是纯视觉(Vision-Only)模型,它就像一位观察力极强的摄影师。它能清晰地看到道路、标线和车辆,但它并不真正理解这些事物在更广泛语境下的含义。另一个大脑是视觉-语言模型(VLM),它就像一位既是摄影师又是哲学家的人。它看到了同样的道路,但它还能读懂路标,理解复杂的社交暗示(比如行人犹豫是否过马路),并利用语言进行“如果……会怎样”的逻辑推理。
一段时间以来,自动驾驶领域的一个重大问题是:“我们是否需要那个昂贵且沉重的哲学家大脑,还是说锐利的摄影师大脑就足够了?”有人认为哲学家绝对更好,也有人希望摄影师能做得更快、更便宜。但没有人真正知道,一旦这两个大脑开始做出驾驶决策时,它们究竟有何不同,或者它们是否只是以不同的方式在表达同样的东西。这篇论文深入探讨了这个谜团,将机器人的决策过程视为一场侦探故事,以观察这两类大脑究竟是冗余的(做同样的事),还是在特定情况下拥有各自的秘密超能力。
侦探工作:两个大脑,一条路
研究人员设计了一个受控实验,让这两类“大脑”在名为 NAVSIM 的数字驾驶赛道上进行对决。他们不仅让它们驾驶,还在它们的神经元上安装了“麦克风”,以监听它们在两个关键时刻的想法:首先,当它们仅仅在观察道路时(骨干网络/backbone 层级),其次,就在它们决定转向方向之前(决策/decision 层级)。
以下是他们的发现,这有点像是一个剧情反转。
1. 起点不同,但它们学会了达成共识(基本如此)。
当机器人第一次观察道路时,“哲学家”(VLM)和“摄影师”(纯视觉)看到的景象非常不同。它们的内部地图截然不同。然而,一旦开始学习驾驶(策略学习阶段),它们开始在很大一部分道路上达成一致。这就像两个人学习跳舞;他们可能有不同的风格,但很快就能一起掌握基本的舞步。研究人员发现,大约 54% 的决策空间在它们之间是共享的。
2. 但它们从未变得完全相同。
这是至关重要的一点:即使在学习驾驶之后,它们也没有坍缩成完全相同的机器人。它们保留了一个属于各自的“残差”部分,即独特的思维。研究人员使用了一种被称为 Shared–Unique SAE 的特殊工具(可以将其想象为一个神奇的过滤器,能够分离出两个个体共有的东西与独特的东西)来证明这一点。他们发现,虽然它们共享了许多驾驶方面的“常识”,但每个大脑仍然拥有无法被对方复制的独特“秘方”。
3. “秘方”并非随机,而是取决于情境。
这是故事最精彩的部分。研究人员问道:“哲学家何时获胜,而摄影师何时获胜?”
- 摄影师(纯视觉)是简单几何道路的冠军。如果任务只是在晴朗天气里保持在直车道上,摄影师通常表现得更加稳健且守规矩。
- 哲学家(VLM)在混乱中脱颖而出。当道路变得古怪时——比如带有令人困惑的锥桶的施工区、没有清晰标线的狭窄小巷,或者需要猜测行人行为的繁忙路口——哲学家的独特“语言与推理”大脑就会接管。在这些“长尾”(罕见且棘手)场景中,哲学家的表现明显更好。
4. 你无法仅仅通过猜测来决定使用哪一个。
团队尝试构建一个简单的开关,该开关会观察机器人的“想法”并决定:“好吧,这看起来是一条简单的路,让我们使用摄影师,”或者“这看起来很复杂,切换到哲学家。”他们尝试了多种基于机器人内部信号的切换方式。结果失败了。 论文明确排除了这样一种观点,即仅通过观察原始数据就能可靠地预测哪个大脑更好。信号太杂乱了。区别不在于它们“看到了什么”,而在于它们“如何行动”。
解决方案:“快-慢”组合队
由于他们无法完美地预测该使用哪一个大脑,研究人员设计了一个巧妙的系统设计,称为 HybridDriveVLA 和 DualDriveVLA。
他们没有选择其中一个并寄希望于好运,而是决定同时运行两者。
- HybridDriveVLA 让摄影师和哲学家并行运行。然后,它获取这两个不同的驾驶路径,并创建一个包含混合路径在内的“菜单”。一个智能评分器随后会从这个菜单中选出绝对最佳的路径。这种方法在 NAVSIM 测试中获得了 92.10 的分数,相比于仅使用哲学家(得分为 90.80)有了显著提升。
但运行两个大脑既昂贵又缓慢。因此,他们创建了 DualDriveVLA,一个“快-慢”系统。
- 在这个版本中,机器人默认使用快速的摄影师。它一边驾驶一边检查自己的置信度得分。如果道路看起来很简单且得分很高,它就继续行驶。
- 然而,如果道路看起来很复杂或得分下降,它会立即召唤缓慢的哲学家来进行复核并提供更好的路径。
- 结果是?这个系统仅在约 15% 的驾驶场景中调用了昂贵的哲学家。它仍然将分数提高到了 91.00,但它使汽车的速度提高了近 1.9 倍(将延迟从约 280 毫秒 降低到 150 毫秒),相比于始终使用哲学家。
总结
这篇论文表明,在自动驾驶的世界里,我们不应该仅仅问:“大的语言模型更好吗?”答案是:“视情况而定。”大模型和小视觉模型是互补的,而非冗余的。它们在不同的驾驶时段展现出不同的优势。最好的策略不是选出一个赢家,而是建立一个团队,让快速、简单的脑承担重活,而聪明、复杂的脑则准备好在道路变得古怪时随时介入。这种“两全其美”的方法为如何让自动驾驶汽车既聪明又快速提供了一条途径,而无需等待一个单一、完美的脑被发明出来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。