← 最新论文
💻 computer science

CoLT-Drive: Counterfactual Long-Tail Benchmarking and Knowledge-Preserving Adaptation for Driving Affordance Prediction

本文介绍了用于评估驾驶可达性预测的反事实长尾基准测试 CoLT-Drive,并提出了 KPA,一种知识保持自适应框架,该框架在显著提升小型视觉语言模型在罕见驾驶场景中性能的同时,能够保持其领域内能力。

原作者: Zhengxu Tang, Guofeng Cui, Ziyu Gong, Xiaozhou Zhang, Ruifeng Deng, Chengzhi Qi, Ke Chen, Sachin Patil, Tianjun Xiao, Langechuan Liu, Pichao Wang

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengxu Tang, Guofeng Cui, Ziyu Gong, Xiaozhou Zhang, Ruifeng Deng, Chengzhi Qi, Ke Chen, Sachin Patil, Tianjun Xiao, Langechuan Liu, Pichao Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

自动驾驶汽车在应对日常世界方面已经变得非常熟练。它们可以处理高速公路上的稳定车流,在雨中跟随车道线,并应对城市路口的规律节奏。然而,当面对异常情况时,这些系统往往会出错:例如被吹进路上的购物车、倒下的树木,或者看起来像岩石的塑料袋。多年来,工程师们一直将这些失败视为简单的识别错误,认为如果汽车的计算机能正确命名那个奇怪的物体,它就会知道该怎么做。但这种观点忽略了一个关键步骤。识别一个物体仅仅是开始;真正的挑战在于理解那个物体对汽车下一步行动意味着什么。一个塑料袋可能可以安全地驶过,而一棵倒下的树则要求立即停车。区别不在于物体的名称,而在于它为行动留下的空间。

NVIDIA 的一个研究小组提出了一种新方法来测试并改进这种特定的技能,他们称之为“驾驶可操作性”(driving affordance)。他们不再仅仅要求计算机识别一个罕见物体,而是要求它决定车辆实际上被允许进行下一步动作。为此,他们创建了一个名为 CoLT-Drive 的专门测试基准。该基准选取了 29 个标准的驾驶场景,并在其中插入了 50 种不同类型的罕见障碍物,从而创造了数千个受控场景。研究人员随后要求各种人工智能模型预测正确的逻辑高层动作,例如减速、变换车道或停车。其目标是观察模型是否能够将视觉上出现的奇异物体与安全、逻辑性的驾驶决策联系起来,而不是仅仅卡在对物体的陌生感上。

测试结果揭示了一个显著的问题。当研究人员在海量常规驾驶数据上训练小型 AI 模型,以使其更好地处理常规任务时,这些模型在处理这些罕见、异常情况时的表现反而变差了。通过过度学习如何在典型条件下驾驶,模型忘记了如何对意外情况进行推理。它们变得过于专注于道路的常见模式,以至于当规则发生变化时便无法应对。这种被称为“过度专业化”(over-specialization)的现象意味着,一个模型可以在模拟正常交通的环境中驾驶得完美无瑕,但当出现单个异常物体时,就会陷入恐慌或做出危险的错误。

为了解决这个问题,研究人员开发了一种名为 KPA 的新适配方法。这种方法旨在教导模型如何在不抹除其已拥有的广泛通用知识的情况下,学习如何在罕见情况下安全驾驶。该过程分为三个阶段。首先,团队通过仔细融合经过驾驶数据训练的模型与原始预训练模型的权重,创建一个“保守”的起点。这确保了系统保留了对物体和场景的通用理解。接着,他们添加了一个专门的模块,使模型能够根据遇到的情境类型切换其行为。如果汽车只是在高速公路上巡航,系统使用一套决策规则;如果探测到需要突然停车或变换车道的危险,则激活另一套规则。这使得模型能够在不丢失其基础知识的前提下,具备灵活性和上下文感知能力。

在 CoLT-Drive 基准测试中,这种新方法显示出了明显的进步。即使经过驾驶数据训练,标准模型在面对这些罕见物体时,也只能在约 32% 的情况下预测出正确的动作。原始的未训练模型表现稍好,达到了 50%,这仅仅是因为它还没有丧失其通用的推理能力。然而,新的 KPA 方法将成功率提高到了近 61%。它证明了通过保留模型的“开放世界”知识,并添加特定的、灵活的决策工具,系统可以更有效地应对意外情况。研究人员还发现,这种方法在小型、高效的模型上表现良好,这类模型可以实际运行在汽车的计算机上,而不需要庞大且耗电的服务器。

这项研究还强调了如何测试这些系统的重要性。研究人员为每个测试场景创建了两个版本:一个包含所有周围交通状况,另一个则移除了背景车辆。他们发现,一些模型过度依赖其他车辆的行为来做出决策。如果前车减速,模型也会跟着减速,而没有真正理解原因。新方法更加稳定,其决策是基于障碍物本身,而不是仅仅模仿周围交通的行为。这表明,为了实现真正的自动驾驶安全,系统必须能够将其决策扎根于道路的物理现实中,即理解一个罕见物体对于自身的路径究竟意味着什么,而不受其他驾驶员行为的影响。

虽然研究结果令人鼓舞,但研究人员也谨慎地指出了其工作的局限性。该基准使用的是通过数字编辑插入障碍物的图像,这意味着系统是在接受一种受控的诊断性测试,而非完整的、现实世界的碰撞或复杂交通流的模拟。该研究衡量的是模型能否选择正确的高层动作(如“减速”),但并未模拟该动作产生的物理后果,也未模拟车辆在闭环系统中如何与其他智能体互动。其目标是识别模型在处理罕见事件时推理能力的特定差距,并提供一个修复工具。研究结果表明,通往更安全自动驾驶之路,不仅在于看到更多的物体,更在于理解这些物体为车辆移动所留下的特定空间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →