← 最新论文
💻 computer science

Collaborative Multi-Agent Testing for Emergent Failure Discovery in Autonomous Driving Systems

本文介绍了 CREAD,这是一个协作式多智能体测试框架,它通过一个共享黑板协调扰动生成、行为验证和搜索探索,与单智能体及非协作基准相比,显著提高了发现自动驾驶系统中涌现故障的能力。

原作者: Ruizhen Gu, Konstantinos Koufos, Donghwan Shin, Vahid Garousi, Mehrdad Dianati

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruizhen Gu, Konstantinos Koufos, Donghwan Shin, Vahid Garousi, Mehrdad Dianati

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一座由自动驾驶汽车组成的庞大且复杂的城市中,寻找隐藏的“坑洼”。你知道,这些汽车发生碰撞不仅仅是因为某个部件(比如摄像头)坏了,还可能是因为不同的部件(比如摄像头、大脑和刹车)之间产生了误解。

这篇论文介绍了一种测试这些汽车的新方法,叫做 CREAD。你可以把 CREAD 想象成不仅仅是一个单一的检查员,而是一支在共享办公室里协同工作的专业侦探团队,旨在发现这些隐藏的碰撞问题。

旧方法的缺陷

以前,测试自动驾驶汽车就像是一个人在试图同时完成以下任务:

  1. 发明一个棘手的驾驶场景。
  2. 让汽车驶过该场景。
  3. 判断汽车是否发生了碰撞。
  4. 立即忘记所有信息并重新开始。

这种“单人秀”模式经常会错过细微的问题,因为生成测试的人和检查结果的人之间并没有沟通。他们处于孤立状态,就像一位厨师做完了一顿饭,然后在品尝之前立刻忘记了自己做了什么。

CREAD 的解决方案:智能体团队

CREAD 改变了游戏规则,它使用三个“智能体”(软件程序)作为一个协调的团队,通过一个数字黑板(共享便签本)来传递信息。

以下是这个团队的工作方式:

  1. “感知模糊器”(恶作剧者):

    • 角色: 这个智能体是富有创造力的捣蛋鬼。它获取一个正常的驾驶场景,并加入“噪声”或故障,比如模拟浓雾、大雨或模糊的摄像头。它会问:“如果汽车的眼睛现在有点模糊,会发生什么?”
    • 类比: 想象一下舞台工作人员,他们偷偷调暗灯光或在演员面前喷洒一些水雾,以观察演员的反应。
  2. “蜕变验证器”(侦探):

    • 角色: 这个智能体是细心的观察者。它对比两个版本的同一次驾驶:一个是视野完美的版本,另一个是“恶作剧者”制造的“模糊”视觉版本。它寻找其中的差异。汽车是刹车晚了?还是在不该转向的时候转向了?
    • 类比: 这就像一名电影剪辑师,通过对比“清晰版”和“雾气版”的镜头,来发现演员在哪里踉跄了一下。
  3. “编排器”(经理):

    • 角色: 这个智能体阅读黑板上的笔记。如果侦探在雾天场景中发现了碰撞,经理就会说:“太棒了!让我们在这个特定区域尝试更多雾天场景。”它决定团队下一步应该把精力集中在哪里。
    • 类比: 这就像是一位导演,看到排练中的一个有趣失误后,会说:“让我们再演一遍那个场景,但这次加点雨,看看错误是否会变得更严重,或者是否会揭示出新的问题。”

他们如何协同工作

他们并非进行线性工作,而是形成了一个闭环

  • 恶作剧者创造一个棘手的场景。
  • 侦探检查汽车是否失效。
  • 他们都将发现记录在黑板上。
  • 经理阅读黑板,并告诉恶作剧者:“去尝试一下类似上次那个场景!”

这种不断的对话使他们能够发现“涌现性”故障——即那些只有当汽车的不同部件以奇特的方式相互作用时才会发生的问题。

实验结果显示

研究人员在两个模拟环境中测试了这个团队:一条笔直的高速公路和一个繁忙的环岛

  • 在高速公路上: 团队表现得极其出色。当他们协同工作(使用黑板)时,在 100 次测试运行中发现了 52 次失效。而当他们不进行沟通(只是顺序运行这些智能体)时,仅发现了 14 次失效。这种协作帮助他们挖掘得更深。
  • 在环岛中: 结果褒贬不一。团队发现了 52 次失效,而无协作版本发现了 58 次。在这里,额外的沟通并没有帮助他们找到更多的碰撞,但确实帮助他们找到了更广泛的碰撞类型

核心结论

论文得出结论,将测试视为不同专业角色之间的协作对话,是发现自动驾驶汽车危险漏洞的一种极具前景的方法。在像高速公路这样复杂的直线型环境中,这种方法效果尤为显著,这证明了当“恶作剧者”、“侦探”和“经理”共享一块黑板时,他们能发现那些孤独的检查员会错过的危险。

注:作者强调,这是在计算机模拟环境(HighwayEnv)中结合简化版汽车控制器的测试。他们目前尚未在真实的道路上测试真实的汽车,但该方法的设计初衷是未来可以扩展到更真实的模拟环境中的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →