← 最新论文
💻 computer science

In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing

本文通过对自动驾驶系统(ADS)专家的访谈进行了一项多公司研究,综合了当前的测试实践与挑战,识别了如场景真实性和覆盖率等关键行业障碍,并提出了一个以证据为中心的闭环测试框架,旨在指导未来的自动驾驶系统验证。

原作者: Qunying Song, Yuan Gao, Johannes Betz, Dietmar Pfahl, Mohammad Reza Mousavi, Federica Sarro

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Qunying Song, Yuan Gao, Johannes Betz, Dietmar Pfahl, Mohammad Reza Mousavi, Federica Sarro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人开车。你不会只是把钥匙交给它并说:“出发!”你需要进行练习。但棘手的部分在于:你不能只是在社区里到处乱转。你需要测试机器人在每一种可能发生的情况下的表现——下雨、下雪、小松鼠横穿马路、施工区域,或者一辆形状奇特的卡车。这就是自动驾驶系统(ADS)的世界。它们是自动驾驶汽车背后的“大脑”。为了确保安全,工程师必须进行成千上千次的测试。他们使用模拟器(看起来像真实世界的计算机世界)、测试场(可以安全碰撞的封闭赛道)以及真实道路(由人类随时准备接管驾驶的实际行驶)。大家都在问的一个大问题是:“我们如何知道这个机器人真的准备好独自驾驶了?”这就像是在不知道考试题目具体是什么的情况下,试图证明一名学生已经准备好参加期末考试一样。

一组研究人员决定揭开这层神秘的面纱。他们没有仅仅观察代码或运行自己的模拟实验;他们直接走向了源头。他们采访了来自六个国家、九家不同公司九位专家,这些人每天都在实际构建和测试这些自动驾驶系统。把他们想象成自动驾驶联赛中的主教练和明星球员。研究人员想知道:这些公司实际上在做什么?哪些噩梦让他们彻夜难眠?以及他们认为这项运动的下一步会走向何方?

现实检查:专家们正在做什么

研究人员发现,目前的行业正处于一场大规模、多层次的训练营中。这不仅仅是一个大测试,而是一个流水线。

首先,他们从模拟器开始。这就像是一款视频游戏,汽车可以在一小时内行驶一百万英里而不会留下任何划痕。他们利用这一点来测试数百万种“如果……会怎样”的情景。然后,他们转向硬件在环(Hardware-in-the-Loop)车辆在环(Vehicle-in-the-Loop)测试。想象一下,将汽车的大脑放入一个真实的汽车底盘中,但让轮子留在跑步机上,或者将整辆车放在一个封闭的赛道上。最后,他们进入真实道路阶段。这是“最终大魔王”级别,汽车在现实世界中行驶,通常会有一名安全员坐在座位上,准备在情况出错时抓起方向盘。

专家们告诉研究人员,他们主要使用基于场景的测试(Scenario-Based Testing)。这意味着他们不仅仅是随机驾驶;他们会创造特定的故事或“场景”来进行测试。例如,“如果一个球滚进街道,紧接着跟着一个小孩,会发生什么?”或者“汽车如何处理雨中的陡坡?”他们还使用数据驱动的方法,即提取真实的驾驶日志数据并反复重放,以观察汽车是否会犯同样的错误。

重大障碍:当理论遇到现实

尽管进行了如此多的测试,专家们承认系统中仍然存在严重的故障。

1. “虚假与真实”的差距(Sim-to-Real Gap):
这是最大的头痛点。模拟器就像一部非常好的电影,但它终究是一部电影。专家们表示,模拟相机如何观察潮湿的路面,或者传感器如何对闪亮的玻璃建筑做出反应,是非常困难的。如果模拟不够完美,汽车可能会在游戏中开得完美无瑕,但在现实生活中却发生碰撞。这就像是在完美的仿真草坪上练习足球赛,然后出现在一个泥泞的球场上;你的肌肉反应可能会完全不同。

2. “看不见”的问题:
专家们担心场景覆盖率(Scenario Coverage)。道路上可能发生的事情太多了,以至于不可能测试到所有情况。如果一只黑色的猪跑过高速公路怎么办?或者一个人抱着一辆巨大的自行车怎么办?专家指出,虽然汽车在应对正常的车辆和行人方面做得很好,但当它们看到奇怪或罕见的事物时,有时会失效。他们称之为“分布外(out-of-distribution)”问题。

3. “是否足够好?”之谜:
最令人困惑的部分之一是何时停止测试。专家们表示,对于**验收标准(Acceptance Criteria)**并没有明确的规则手册。你需要驾驶多少英里才能证明汽车是安全的?10万英里够了吗?100万英里呢?研究人员发现,各公司并没有一个统一的答案。有些公司依赖于“数据饱和”(直到他们感到自信为止),而另一些则寻找特定的安全指标,比如“零碰撞”。但目前还没有一个公认的标准能说:“好了,你通过了。”

4. AI 的“黑箱”问题:
许多现代自动驾驶系统使用**人工智能(AI)端到端(End-to-End)**学习。这意味着汽车通过观察道路并决定该做什么来学习,有点像人类的学习方式,而不是遵循一份严格的规则清单。问题在于,很难解释 AI 为什么 做出某个决定。如果汽车发生了碰撞,工程师可能无法确切知道原因。这使得向监管机构提供安全性论证变得非常困难。

未来:接下来会发生什么?

那么,这一切将走向何方?专家们持乐观但现实的态度。

  • AI 将辅助测试 AI: 他们认为**生成式 AI(Generative AI)**将被用于创造新的、疯狂的测试场景,甚至包括人类尚未想到的场景。想象一下,一个 AI 专门发明一种新型的交通拥堵,只为了看看汽车能否应对。
  • 世界模型(World Models): 他们对“世界模型”感到兴奋,这就像是汽车的内部想象力。汽车不再仅仅是对所见之物做出反应,而是尝试预测接下来会发生什么,就像棋手在思考三步之后的招式一样。
  • 更高的透明度: 目前,每家公司都对自己的测试数据保密。专家们希望未来公司能分享更多的基准测试和数据,就像电子游戏开发者分享高分排行榜一样,这样每个人都能看到谁才是真正的佼佼者。
  • 自动化测试: 他们设想了一个汽车能够自我测试的未来。汽车在行驶过程中发现问题,报告问题,并在无需人类按下按钮的情况下更新自身的软件。

提出的解决方案:闭环框架

基于所有这些访谈,研究人员提出了一种新的思考测试的方式,他们称之为以证据为中心的闭环框架(Evidence-Centered Closed-Loop Framework)

想象一个巨大的循环:

  1. 从声明开始: 在测试之前,你必须明确陈述你试图证明的内容(例如,“这辆车可以在狭窄的空间内安全停车”)。
  2. 建立场景库: 收集所有你需要测试的可能情况,从枯燥的场景到惊险的场景。
  3. 规划测试路径: 决定在哪里测试每个场景。你会先在视频游戏中测试停车位吗?然后在测试场测试?最后在真实街道上测试?
  4. 收集证据: 运行测试并收集数据。
  5. 守门人: 根据严格的规则检查证据。汽车通过了吗?如果是,进入下一阶段;如果不是,返回并修复它。
  6. 循环: 一旦汽车上了路,收集现实世界的数据。如果它看到了新事物或犯了错,将这些数据反馈回循环的起点,以创建新的测试场景。

这个框架被设计为一个持续的循环,而不是一条直线。它确保了随着汽车的学习和世界的变化,测试也会随之演进。

总结

本文并未声称自动驾驶问题已经解决。事实上,它强调我们仍处于“学习阶段”。专家们正在努力工作,结合使用模拟器、真实驾驶和新的 AI 工具,但他们仍在努力应对现实世界混乱且不可预测的事实。研究人员指出,虽然我们对于“如何测试”有了清晰的概念,但我们仍需弄清楚“测试多少”才算足够,以及如何确保我们的计算机测试能真正匹配现实。

给好奇青少年的启示是:自动驾驶汽车就像是在为一个非常难的考试做准备的学生。他们在图书馆学习(模拟器),做练习测验(测试场),并进行实地考察(真实道路)。但在他们能够证明自己能应对世界抛给他们的每一个意外,并且在我们所有人对“及格线”达成共识之前,他们仍会在安全员的注视下驾驶。旅程很长,但路线图正变得越来越清晰。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →