← 最新论文
🤖 AI

Coverage Aware Active Evaluation for Failure Discovery with Paired Systems

本文提出了一种自适应故障发现方法,该方法利用代理系统评估,通过受控制变量启发的风险预测和支持感知互信息来引导目标系统测试,在自动驾驶、机械臂操作和四足机器人任务中,有效地发现了比随机采样或主动学习基准方法显著更多样化且更严重的故障。

原作者: Anjali Parashar, Rachel Luo, Apoorva Sharma, Sushant Veer, Edward Schmerling, Carson Sobolewski, Mingxin Yu, Chuchu Fan, Marco Pavone

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Anjali Parashar, Rachel Luo, Apoorva Sharma, Sushant Veer, Edward Schmerling, Carson Sobolewski, Mingxin Yu, Chuchu Fan, Marco Pavone

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名负责管理由自动驾驶汽车、机器狗和机械臂组成的未来主义车队的安全检查员。你的职责是找出这些机器何时可能发生故障或表现出危险行为。问题在于,在现实世界中进行测试既昂贵、缓慢,有时甚至很危险。如果机器狗在测试中从悬崖上摔下去,你无法仅仅通过修复机器人并立即重试;你可能会损坏机器人,或者破坏悬崖。因此,工程师们通常使用“廉价代理”——比如视频游戏模拟器,或者更简单、质量较低的机器人版本——来快速进行成千上万次的测试。

然而,这里有一个陷阱:仅仅因为机器人在视频游戏中失败了,并不意味着它在现实生活中也会失败。游戏中的物理规则可能与现实世界完全不同,或者机器人在模拟器中表现得过于完美。这被称为“模拟与现实的差距”(sim-to-real gap)。如果你只信任游戏,你可能会把时间浪费在那些实际上是安全的场景上,或者更糟的是,你可能会错过那些只在混乱、不可预测的现实世界中才会发生的真实危险故障。核心问题是:如何利用这些廉价、快速的游戏测试来指导那些昂贵、缓慢的现实世界测试,从而在不浪费预算的情况下找到真正的危险?

这篇题为《用于故障发现的配对系统覆盖感知主动评估》(Coverage Aware Active Evaluation for Failure Discovery with Paired Systems)的论文提出了一种巧妙的新方法来解决这个谜题。来自麻省理工学院(MIT)和英伟达(NVIDIA)的研究团队建议,他们的方法将廉价的模拟测试视为一个有用的、尽管带有一定偏差的“提示”,而不是最终答案。他们称这种方法为“自适应故障发现”法。该系统不是盲目地猜测要测试哪些场景,而是通过学习少量的现实世界测试,来修正模拟器的错误。

以下是该方法的工作原理,我们用一个简单的类比来说明:想象你正在试图在一座巨大的岛屿上寻找隐藏的宝藏,但你拥有的用于挖掘的金币数量有限。你有一张地图(代理系统)显示了宝藏可能出现的位置,但这张地图很陈旧且存在一些错误。如果你只是照着地图挖,你可能会挖错地方。相反,作者的方法就像一个聪明的侦探。它观察地图,然后派遣一些侦察兵去特定的地点挖掘,以观察实际的地表情况。通过比较地图的预测与侦察兵的报告,侦探学会了如何“局部修正”地图。如果地图说“在这里挖”,而侦察兵说“这里只是沙子”,侦探就会学会暂时忽略地图的这一部分。

论文引入了两个主要技巧来使这一切成为可能。首先,他们使用了一种“控制变量”(control-variate)技术。你可以将其理解为一种数学方式,用来表达:“地图通常是正确的,但让我们根据刚刚学到的现实情况来调整它的评分。”这有助于他们预测现实系统可能在哪里失效,即使模拟器在那个特定点上是错误的。其次,他们使用了一种“支持感知互信息”(support-aware mutual information)策略。这是一种高级说法,意思是:“不要只挖你认为有宝藏的地方;也要在那些你尚未观察过的地方挖掘,以确保你不会错过一整类全新的宝藏。”这确保了他们能发现各种各样的故障,而不只是重复同一种故障。

研究人员在三种截然不同的机器人类型上测试了这种方法:自动驾驶汽车(使用 nuPlan 数据集)、抓取物体的机械臂(使用 SIMPLER 任务)以及追踪移动目标的四足机器人狗(使用四足机器人任务)。在每种情况下,他们都将自己的方法与随机猜测和其他标准测试工具进行了对比。结果非常理想:他们的方法发现的现实世界故障数量比其他方法多出高达两倍。例如,在自动驾驶汽车测试中,他们发现了更多车辆碰撞或过于接近其他车辆的场景。在机器狗测试中,他们发现了更多导致狗踉跄或失去平衡的情况,其中包括一些其他方法完全错过的严重故障。

至关重要的是,论文反对“你可以直接信任模拟器”或“你应该只在没有引导的情况下测试现实世界”的观点。他们表明,忽视模拟会浪费时间,但盲目信任模拟则是危险的。他们的方法处于两者之间,利用廉价测试来引导昂贵的测试。他们还发现,只要可以将场景配对起来进行学习,即使模拟与现实之间存在很大差异,他们的方法依然有效。

作者谨慎地指出,这并不是解决所有测试问题的“万灵药”。他们承认,该方法仍然需要通过现实世界的测试来进行学习,并且在场景可以用计算机理解的方式(例如描述环境的一组数字)进行描述时效果最好。然而,他们的研究结果表明,通过将廉价代理与智能自适应学习相结合,我们可以更高效、更快速地发现危险故障。这意味着未来的机器和汽车会更加安全,因为我们可以比以前更快、更高效地找到那些“边缘案例”——即那些出错的奇特、罕见情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →