← 最新论文
💻 computer science

RedLight-VLA: Models for traffic-rule grounding and behavioral emphasis in driving policies

RedLight-VLA 是一种用于视觉-语言-动作(Vision-Language-Action)驾驶策略的新型训练目标,它结合了基于轨迹的行为重加权和并行辅助头,以提高在信号灯路口的规则落地与行为强调能力,在无需额外人工规则标注的情况下,显著减少了红灯闯越和轨迹误差。

原作者: Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das, Rahul Ahuja, Meda Lazar, Ashish Garg, Pratik Likhar, Senthil Yogamani

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das, Rahul Ahuja, Meda Lazar, Ashish Garg, Pratik Likhar, Senthil Yogamani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在城市中驾驶汽车是一场在平滑、可预测的运动与突然、关键的停顿之间进行的持续博弈。在大多数情况下,车辆在高速公路上巡航或在车流中轻巧地穿梭,保持稳定的速度。这些常规驾驶的时刻构成了汽车在道路上度过的大部分时间。然而,真正考验驾驶员技能与安全性的时刻是那些罕见的例外情况:行人突然出现时的急刹车、红绿灯起步时的突然加速,或是面对红灯时的谨慎停顿。当工程师通过向计算机展示数千小时的真人驾驶记录来教会计算机驾驶时,计算机看到的主要是那些简单、枯燥的部分。它学会了如何良好地巡航,但往往在处理那些罕见的高风险动作时感到吃力,因为这些动作在数据中出现的频率极低。这种不平衡造成了一个盲点,导致计算机可能会无法进行足够的重刹,或者在重新起步时犹豫不决,从而导致在交叉路口出现不安全行为。

高通(Qualcomm)和 Arriver 的研究人员开发了一种新方法来解决自动驾驶软件中的这一特定弱点,即视觉-语言-动作(Vision-Language-Action,简称 VLA)模型。这些系统旨在理解视觉世界、解读交通规则并决定车辆如何移动。由 Bala Murali Manoghar Sai Sudhakar 及其同事领导的团队意识到,仅仅向计算机展示更多的驾驶数据是不够的。相反,他们创建了一种训练方法,迫使计算机额外关注那些罕见的、困难的时刻,同时还教它明确识别交通信号和停止线。他们将该系统称为 RedLight-VLA。通过调整计算机如何从错误中学习,并赋予其一种专门“阅读”交通灯的方式,他们成功地让车辆在停止于红灯和在绿灯时起步方面表现得显著更好,而无需在训练视频中手动标注每一条交通规则。

研究人员解决的核心问题是,标准的训练将每一秒的驾驶视频视为同等重要。在一个典型的数据集中,一辆车可能在 98% 的时间里都在巡航,而仅在 2% 的时间里进行剧烈刹车。如果计算机被训练为最小化所有这些秒数内的平均误差,那么罕见的刹车事件就会被成千上万秒的平稳驾驶所淹没。计算机学会了处理平均情况,却在关键的边缘案例上失败了。为了解决这个问题,团队引入了一种称为“行为重加权”(behavioral reweighting)的技术。想象一位正在批改学生作业的老师,他决定做对一道难题所获得的得分与做对十道简单题所获得的得分一样多。同样地,研究人员对系统进行了编程,使其对罕见的重刹和快速加速时刻分配更高的重要性。当计算机在这些关键时刻犯错时,它会感受到更强的“推力”来纠正自己。这种调整是通过分析记录中专家驾驶员的速度和加速度自动完成的,因此不需要人工去标记哪些片段是重要的。

解决方案的第二部分解决了另一个问题:计算机需要知道为什么要停止。在许多现有系统中,停止的决策仅仅是车辆试图遵循的路径的一个副产品。研究人员希望计算机能明确理解交通灯的状态和停止线的位置。他们创建了一个系统,让计算机在其内存中保留几个特定的内部“插槽”来存储这些信息。在计算机观察摄像头图像和地图后,它会将答案填入这些插槽,例如“是否有红灯?”以及“距离停止线有多远?”。系统的另一个独立的小部分会根据已知的交通规则检查这些插槽中的答案是否正确。这迫使计算机建立一个清晰的交通规则内部表示,而不仅仅是猜测车辆的路径。至关重要的是,这个过程不需要计算机通过说话或书写文字来解释其推理过程,从而保持了过程的快速与高效。

当研究人员在大量的真实驾驶记录上测试这种结合方法时,结果显示在安全关键行为方面有了明显的改善。使用这种额外关注罕见动作和显式规则检查的系统,将车辆在红灯时越过停止线的次数从 7.3% 降低到了 6.8%。它还将车辆接近停止线时的速度误差降低了近 13%。或许最重要的一点是,该系统在整体预测车辆未来路径方面变得更好,减少了车辆预测位置与实际所需位置之间的平均距离。然而,研究人员指出存在一种权衡:在努力提高红灯安全性时,系统变得稍微更加谨慎,导致在绿灯时进行不必要停顿的情况略有增加。虽然结合后的方法比单独使用其中任一技术更能处理这种权衡,但这凸显了提升系统安全性往往涉及平衡不同类型的误差。

这项研究表明,提高自动驾驶汽车的可靠性不仅可以通过喂给它们更多数据,还可以通过教它们如何比对待常见的、安全的时刻更重视那些罕见的、危险的时刻。通过自动识别驾驶员何时进行重刹或从停止处起步,并迫使系统显式追踪交通信号,研究人员创建了一个行为更像理解交通规则的人类的模型。这项工作表明,自动驾驶的未来在于精炼机器如何从其经验的边缘进行学习,确保那些最重要的时刻是它们学得最好的时刻。这种方法不需要新的传感器或对交通规则进行手动标注,为开发能够应对城市驾驶不可预测性的、更安全、更鲁棒的自动驾驶汽车迈出了务实的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →