← 最新论文
💻 computer science

Latent Chain-of-Thought World Modeling for End-to-End Driving

本文介绍了 LCDrive,这是一种端到端的自动驾驶模型,它通过使用在潜空间中交织动作提议与世界模型标记的方式,取代了自然语言思维链推理,并通过冷启动监督和闭环强化学习,实现了更优的轨迹质量和推理速度。

原作者: Shuhan Tan, Kashyap Chitta, Yuxiao Chen, Ran Tian, Yurong You, Yan Wang, Wenjie Luo, Yulong Cao, Philipp Krahenbuhl, Marco Pavone, Boris Ivanovic

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuhan Tan, Kashyap Chitta, Yuxiao Chen, Ran Tian, Yurong You, Yan Wang, Wenjie Luo, Yulong Cao, Philipp Krahenbuhl, Marco Pavone, Boris Ivanovic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

驾驶汽车是一个持续预测的过程。在人类驾驶员转动方向盘之前,他们已经在想象接下来会发生什么:前方的车可能会刹车,行人可能会走下路缘,或者车流中的间隙可能会关闭。这种对未来的心理模拟正是让我们保持安全的原因。几十年来,工程师们一直试图教会计算机也这样做,构建能够观察道路并决定转向位置的系统。这些最先进的系统被称为端到端自动驾驶,它们试图一次性学习整个过程,将原始摄像头图像直接映射为转向指令,而不依赖于人工制定的规则。最近,研究人员尝试通过赋予这些系统一种“声音”来改进它们,允许计算机在采取行动之前用自然语言进行“大声思考”,就像人类驾驶员叙述自己的想法一样。

然而,一项新研究表明,对于机器而言,用句子进行表达并不是最高效的思考方式。研究人员利用来自 NVIDIA 和德克萨斯大学奥斯汀分校的数据发现,强迫一辆自动驾驶汽车生成一段文本流来解释其推理过程会降低其反应速度,甚至会导致错误。相反,他们开发了一个名为 LCDrive 的系统,该系统在由数字和模式组成的沉默、内部语言中进行思考。这个系统不会写出像“前方的车正在减速”这样的文字。相反,它会在一个紧凑的数学空间内瞬间模拟其行为产生的未来后果,从而使其能够做出更安全、更快速的决策。

这项工作的核心思想是用一种精简、沉默的过程取代传统人工智能那种喋喋不休、冗长的推理。过去,研究人员曾试图通过让汽车在做出驾驶动作之前生成一段文本链——即用英语书写的“思维过程”——来辅助其驾驶。虽然这模仿了人类的对话,但研究人员认为这并不适用于驾驶所需的瞬时需求。自然语言生成速度慢,且往往无法精准捕捉道路的几何形状或多辆车之间复杂的互动舞蹈。一段描述转弯的句子可能无法与汽车实际需要采取的转向角度完美对齐,从而在计算机所说与所做之间产生差距。

为了解决这个问题,团队创建了一个在“潜空间”(latent space)中进行推理的模型,这是一个存储信息的隐藏层,其中的信息是以稠密模式而非文字的形式存在的。在这个新系统中,汽车不会讲述关于道路的故事。相反,它会快速循环执行一系列内部步骤:它提出一个可能的动作(例如轻微转向),并立即模拟如果采取该动作,世界在一秒钟后会是什么样子。然后,它再提出另一个动作,并同样模拟那个未来。这一切都在极短的时间内发生,计算机通过比较这些沉默的模拟过程来决定哪条路径最安全。该系统被训练为直接从当前场景预测这些未来结果,有效地学会了在无需开口说话的情况下,“梦见”前方的道路。

研究人员在包含超过 1,700 小时复杂城市环境真实驾驶日志的海量数据集上测试了这种方法。他们将这种沉默的潜空间推理模型与另外两种类型的系统进行了对比:一种是在没有任何推理的情况下做出决策的系统,另一种是使用传统的基于文本推理的系统。结果显示,这种沉默的思考模型明显更快且更准确。它生成的行驶路径更接近人类专家的驾驶方式,在位置偏差、偏离可行驶车道或与其它车辆碰撞方面的错误率也更低。

或许最重要的一点是,这种沉默推理系统在应用强化学习技术时表现出了更强的适应性。在这个阶段,计算机在一个循环中进行练习,接收关于其表现好坏的反馈,并调整其内部逻辑以做得更好。基于文本的系统在练习过程中难以进步,因为它经常无法将其口头表达的思想与其实际驾驶动作联系起来。相比之下,沉默系统则蓬勃发展,利用其内部模拟来优化决策,变得更加安全和精准。研究发现,这种方法显著缩小了汽车路径与理想路径之间的平均距离,尤其是在汇入车流或通过繁忙路口等困难情境下。

这种方法的成功表明,对于机器而言,最高效的思考方式不是交谈。通过剥离语言的低效性,并直接在机器自身预测的语言中进行推理,该系统实现了言行之间一种文本模型无法比拟的高度协调。研究人员指出,尽管该系统非常有效,但它目前依赖于一个需要关于其他车辆位置精确数据的训练过程,而这类数据在大规模采集方面具有挑战性。他们也承认,由于推理发生在隐藏的数学空间内,人类很难窥视系统内部并看清它究竟在想什么,这与可以打印出其逻辑依据的文本系统不同。

尽管存在这些局限性,但这些发现为自动驾驶的未来指明了清晰的方向。研究表明,自动驾驶汽车最先进的推理方式可能完全不像人类的对话。相反,它更像是一种快速、沉默的可能性计算,车辆不断地根据道路的现实情况来核查自身的未来。这种从“说话”到“模拟”的转变,使汽车能够以一种镜像人类本能驾驶的方式进行反应,证明了有时解决复杂问题的最佳方式是停止交谈,开始用那唯一真正重要的语言进行思考:即未来本身。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →