← 最新论文
💬 NLP

Beyond Textual Chain-of-Thought: A Survey on Action-Grounded Reasoning in Autonomous Driving

本综述通过分析171篇论文,提出了一种面向自动驾驶中动作驱动推理的以表示为中心的分类法,将方法分为四类,并指出对具备现实世界落地性、实时耦合性和安全性可验证性的中间表示的迫切需求。

原作者: Zhengxu Tang, Xiaozhou Zhang, Guofeng Cui, Ziyu Gong, Zi Wang, Yunfei Shi, Ruifeng Deng, Chengzhi Qi, Ke Chen, Sachin Patil, Tianjun Xiao, Langechuan Liu, Pichao Wang

发布于 2026-09-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengxu Tang, Xiaozhou Zhang, Guofeng Cui, Ziyu Gong, Zi Wang, Yunfei Shi, Ruifeng Deng, Chengzhi Qi, Ke Chen, Sachin Patil, Tianjun Xiao, Langechuan Liu, Pichao Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

自动驾驶长期以来一直是教机器如何应对人类交通中混乱且不可预测的流动的探索。多年来,最成功的系统依赖于一种“黑盒”方法:传感器将数据输入计算机,计算机立即输出转向指令或制动信号。虽然这种方法很有效,但它几乎无法提供关于汽车为何做出特定选择的洞察,导致在出现问题时难以进行调试或建立信任。最近,研究人员开始借鉴人工智能中的一种技术,称为“思维链”(chain-of-thought),该技术要求模型在给出答案之前,先逐步解释其推理过程。在聊天机器人中,这可能表现为对数学题的文本解释。但在汽车中,“答案”不是一句话,而是通过空间的物理运动。这产生了一个独特的挑战:汽车不能在决定停车前,花费数分钟去写一段关于行人的文字。推理必须实时发生,必须基于道路的物理几何结构,并直接影响车辆的运动。

来自英伟达(NVIDIA)及其他机构的研究人员的一项新调查研究了该领域如何应对这一挑战。他们分析了171篇近期的论文,以绘制出从简单的基于文本的解释向他们所称的“动作驱动推理”(action-grounded reasoning)转变的轨迹。研究团队发现,要使自动驾驶汽车真正安全可靠,其内部的“想法”不能仅仅是文字。它们必须采取与物理世界相匹配的形式,例如道路未来的预测图像、追踪运动的隐藏数学状态,或者直接访问交通规则和地图。研究人员将这些新方法归纳为四个不同的家族,揭示了自动驾驶的未来不在于让汽车说话更多,而在于使其内部决策过程变得可见、可验证,并与实际驾驶行为紧密耦合。

该调查首先承认,虽然基于文本的推理易于人类阅读,但对于以高速行驶的车辆来说,往往过于缓慢且不精确。对汽车位置的文本描述是一种“有损”媒介;它会丢失安全停车所需的精确距离和速度数据。因此,研究人员观察到一种向视觉空间推理(visual-spatial reasoning)的转变。与其写下“前面有一辆车”,一些系统现在会生成一秒钟后道路看起来怎样的心理图像,或者高亮显示摄像头视图中的特定区域,例如行人周围的边界框。这些方法使汽车能够在行动前“看到”未来或聚焦于关键细节。例如,一项具有代表性的研究使用了一个检索并裁剪视觉证据来引导决策的系统,在要求汽车在没有人工干预的情况下导航模拟环境的闭环测试中,实现了54.62%的成功率。

除了汽车能看到的内容之外,该调查还强调了一类日益增长的方法,即通过“潜动力学”(latent dynamics)进行推理。这些是关于世界如何运动的内部数学表示,虽然人类无法直接读取,但对计算机而言效率极高。可以将这些理解为汽车内在的物理感官,将复杂的运动压缩成紧凑的代码,使其能在眨眼之间模拟数千种可能的未来。虽然这些“黑盒”想法更难被人类检查,但它们在规划平滑、安全的轨迹方面通常更有效。例如,一个名为“World4Drive”的方法利用这些内部模拟进行导航,无需对每个物体进行显式标注,在严格测试中达到了85.1的规划得分。研究人员指出,虽然这些“黑盒”想法功能强大,但也带来了一个新问题:我们如何验证汽车不可见的推理是否真的安全?

第三个重大转变涉及“外部化推理”(externalized reasoning),即汽车跳出自身的“大脑”去咨询外部来源。这些系统不再试图记住每一条交通规则或罕见的道路布局,而是可以从数据库中检索特定的法律,检查地图中的车道拓扑结构,甚至与其他车辆通信以协商优先通行权。这种方法将推理视为一个协作过程。一项名为“DiLu”的研究将检索到的过往驾驶经验注入汽车的决策过程中,结果显示,随着系统对类似情况记忆的增加,其成功率也随之提高。另一种方法“CoLMDriver”允许车辆交换自然语言信息以协调行动,在复杂的交互场景中取得了88.53的驾驶得分。然而,调查警告说,依赖外部工具会引入新的风险,例如通信延迟或检索到过时信息,这些都必须得到仔细管理。

研究人员总结道,没有任何一种推理类型是万能灵丹。最有前景的系统似乎是那些能够适应变化的系统,即在常规驾驶时切换到快速、反应式的控制,而在情况不确定或危险时切换到更深层、更审慎的推理。他们发现,该领域正在远离那种让汽车不断进行冗长、繁琐表达的想法。相反,目标是建立一个知道何时进行深度思考、何时快速行动的系统,并根据时机使用合适的推理形式。该调查强调,最终的测试标准不是汽车能否用英语解释其选择,而是其中间步骤——无论是图像、数学状态还是检索到的事实——是否能够被信任,从而在现实且混乱的道路世界中保障乘客的安全。他们认为,自动驾驶的未来属于那些能够将其推理植根于驾驶物理现实中的系统,确保每一次“思考”都能直接转化为安全的行动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →