← 最新论文
🤖 machine learning

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks

本文提出了 SeFar,这是一个利用层次化概念建模和生成式人工智能来系统性地测试深度神经网络语义鲁棒性的新颖框架,该框架通过生成逼真的、保持需求的扰动,并通过自适应反馈过程来识别导致失效的特征。

原作者: Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人开车,或者在像火星这样多岩石的星球上导航。你给了机器人一套规则,比如“如果前面有车,不要加速”。但问题在于,机器人是通过看图片来学习的,而且它们有时会表现得非常傻气。如果前面的车是蓝色的而不是红色的,或者天空变成了尘土飞扬的橙色,它们可能会感到困惑。这就是**深度神经网络(Deep Neural Networks)**的世界——它是自动驾驶汽车和太空探测器背后的“聪明”软件。虽然这些系统在完美条件下表现出色,但当世界变得古怪、黑暗或仅仅是与它们在学校里学到的样子不同时,它们往往会发生碰撞或犯错。

为了让这些机器人保持安全,我们不能只用随机噪声来测试它们,而需要使用语义特征(semantic features)。把这些特征想象成图片中有“意义”的部分:汽车的颜色、天气类型或岩石的形状。研究人员提出的核心问题是:“如果我们改变了汽车的颜色,但保持‘不要加速’这一规则仍然成立,机器人还会惊慌失措吗?”本文介绍了一种回答该问题的新方法,它超越了仅仅微调像素,而是以一种受控且智能的方式,真正改变了图片的“故事”。


机器人的“如果……会怎样?”机器

见见 SeFAr(语义特征感知鲁棒性测试)。你可以把 SeFAr 想象成一位非常有创意、甚至带点恶作剧精神的机器人艺术老师。它的工作是获取机器人的“规则”和一系列遵循这些规则的照片,然后问道:“如果我们只改变照片中的某一个东西,比如把轿车变成卡车,或者把天气变成沙尘暴,同时保持场景的其他部分完全不变,会发生什么?”

以往测试机器人的方式就像是在它们的眼睛里撒沙子或模糊它们的视线。这并没什么帮助,因为现实生活不仅仅是模糊,而是充满了特定的变化,比如绿灯变红灯,或者行人出现。SeFAr 则不同。它使用了一个特殊的“层级概念模型”,这就像是思想的“家族树”。在顶层,你有像“车辆”或“天气”这样宽泛的类别。随着你沿着分支向下走,你会变得更加具体:“车辆”会分为“卡车”或“轿车”,“颜色”会分为“蓝色”、“绿色”甚至“青绿色”。

SeFAr 使用强大的 AI 工具——扩散模型(diffusion models)(可以把它们想象成超级聪明的数字画家)来重绘图片。如果你告诉它,“把车改成一辆蓝色的卡车”,它会将一辆蓝色卡车画入场景中,而不会弄乱道路、天空或其他车辆。然后,它会检查机器人是否仍然遵守规则。如果机器人因为车现在变蓝了就突然决定加速,SeFAr 就会抓住它!

侦探工作

最酷的部分在于 SeFAr 如何找到机器人失败的确切原因。有时,机器人失败可能是因为某种特定的颜色,比如“青绿色”,而机器人的创造者甚至从未想到过要测试它。SeFR 扮演着侦探的角色。它观察失败的图片,并使用另一种 AI 工具(视觉语言模型)来描述发生了什么变化。它可能会说:“嘿,车变成了青绿色,这就是机器人惊慌的原因。”

论文在三个不同的场景中测试了这一点:

  1. 自动驾驶汽车 (SGSM): 测试规则如“如果前方有车在 10 米处,不要加速”。
  2. 校园漫游车 (RRAV): 测试它是否能识别交通锥和行人。
  3. 火星探测器 (AI4MARS): 测试它是否能识别火星表面巨大的岩石。

他们的发现

研究人员发现 SeFAr 是一个非常出色的艺术家。当它改变图片时,平均有 93.4% 的时间保持了规则的真实性。这意味着它成功地改变了汽车的颜色或天气,而没有意外破坏规则(比如让汽车消失)。

但真正的惊喜在于那些失败案例。SeFAr 发现机器人其实非常脆弱。

  • 在驾驶测试中,将汽车颜色改为绿色会导致机器人约 39.7% 的时间失败。将车改为卡车会导致 10.5% 的失败。
  • 更有趣的是,当它们结合变化时——比如一辆绿色的卡车——失败率跃升至 25.5%
  • 对于火星探测器,沙尘暴是一个主要问题,导致了失败,而其他的天气变化则没那么困扰它。

论文指出,这些失败之所以发生,是因为机器人依赖于“伪相关”(spurious correlations)——它们根据一些不该重要的东西进行猜测,比如特定的蓝色阴影或树木的影子,而不是基于实际的规则。

总结

SeFAr 不仅仅告诉我们机器人失败了;它通过寻找导致机器人大脑失效的特定“特征”来告诉我们为什么。它发现机器人通常是非常脆弱的,当遇到像青色汽车或沙尘暴这样具体的、现实的变化时,即使这些变化并没有违反安全规则,它们也会失败。

作者们确信这种方法非常有效,可以用于发现这些隐藏的弱点。他们证明了通过系统地探索这些“如果……会怎样”的情景,我们可以发现标准测试所忽略的故障。虽然他们并未声称已经永久解决了机器人安全问题,但他们展示了 SeFAr 是一个强大的新工具,能确保我们的未来机器人不会仅仅因为颜色的改变或一场突如其来的沙尘暴就陷入恐慌。这是迈向确保当我们把方向盘交给机器人时,它不会仅仅因为天空看起来有点不一样就惊慌失措的一大步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →