Discovery and Spatial Characterisation of Multiple Shortcut Groups for Auditing Vision Model Bias
本文介绍了一种利用聚类技术将单张图像归因图分组为循环空间捷径模式的方法,从而能够识别出具有高错误率的特定图像子集,并开发针对性的干预措施以减少视觉模型的性能差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个孩子识别不同类型的动物。你给他看一张在绿草地上奶牛的照片,他学会了“奶牛”意味着“在田野里的带斑点动物”。接着,你给他看一张在雪地谷仓里的奶牛,他感到很困惑,因为“田野”这个部分不见了。这正是某些人工智能(AI)模型发生的情况。它们非常擅长发现模式,但有时会变得“偷懒”。它们并没有学习识别事物的真正特征(比如奶牛的形状),而是抓住了容易获得的、偶然出现的线索(比如绿色的草地),这些线索恰好出现在它们的训练照片中。在计算机科学领域,这被称为“捷径学习”(shortcut learning)。这就像一个学生没有真正学习数学,而是背下了答案集的字体风格。问题在于,这些捷径在测试内容发生变化时(比如奶牛出现在谷仓里)表现得非常好,但一旦变化,AI 就会失败;如果这些失败更多地发生在特定群体身上(比如来自某个特定医院的患者),AI 就会变得不公平或产生偏见。
这篇论文介绍了一种捕捉这些“懒惰捷径”的新方法,以防止它们造成麻烦。研究人员构建了一个工具,充当 AI 的“空间侦探”。他们不仅仅观察最终答案,还会窥视模型的大脑内部,看看 AI 究竟在图像中的哪个位置进行观察。他们发现,AI 模型通常会针对不同的图片使用多种不同的、截然不同的“捷径”。有些图片可能会触发基于背景的捷径,而另一些图片则可能依赖于摄像机的某种奇怪伪影。通过将这些不同的捷径模式组合在一起,研究人员可以准确识别出哪些图像最有可能出错,甚至可以在运行时修复模型,即告诉它忽略捷径,专注于真正的线索。
侦探工作:寻找捷径
来自伦敦国王学院的研究团队致力于解决一个特定的谜题:现有的方法可以告诉你 AI 正在 使用捷径,但无法告诉你它 如何 以及 在哪里 使用捷径,从而无法帮助修复特定群体的错误。想象一下,你想通过一张所有犯罪行为的模糊平均地图来寻找城市里的窃贼。你会知道犯罪确实发生了,但你不知道那个窃贼是在公园里的扒手,还是郊区的窃贼。旧的方法就像那张模糊的地图;它们把所有的图像混在一起,掩盖了不同图片拥有不同种类捷径的事实。
该团队开发了一种拆解这种现象的方法。首先,他们为 AI 看到的每一张照片观察了三个不同的“视角”:
- 任务视角(Task View): AI 认为对完成任务重要的部分(例如,识别肿瘤)。
- 捷径视角(Shortcut View): AI 认为对敏感特征重要的部分(例如,照片来自哪个医院,或者人的性别)。
- 公平视角(Fair View): 一个经过训练以实现公平、忽略敏感特征的参考模型。
通过比较这些视角,他们为每一张图像创建了一个“贡献图”(contribution map)。这张地图突出了 AI 用来做出决策的具体像素。如果 AI 正在使用捷径,地图会在背景或特定的伪影处亮起,而不是在实际的目标物体上。
模式分组
这里是奇迹发生的地方。研究人员将这些成千上万的个体地图通过一种数学排序技术(称为 K-means 和非负矩阵分解)分组为“捷径组”(Shortcut Groups)。可以把这想象成将一大堆混合在一起的拼图碎片根据碎片上的图案分类放入不同的盒子里。
他们发现,捷径并不是一个巨大的坏行为集合,而是存在几种截然不同的“个性化”捷径。例如,在一个鸟类照片的数据集上,他们发现了一组 AI 观察水面背景的捷径,以及另一组 AI 观察陆地背景的捷种。在一个胸部 X 光片的数据集上,他们发现了一些关注乳房阴影或肺部下部的捷径,而“好的”任务聚焦区域则位于肺部的正中间。
这些分组非常有用。研究人员发现,如果他们只查看属于“高风险”捷径组的前 20% 的图像,就能找到模型总错误中的绝大部分。在某些情况下,比如使用鸟类数据集,这个小群体包含了模型犯下的近 74% 的错误。这意味着审计人员不需要检查每一张图像;他们只需要检查特定的“捷径组”就能快速找到问题。
“重来”按钮:修复模型
这篇论文最令人兴奋的部分在于,他们不仅发现了问题,还尝试在不重新训练整个模型的情况下实时修复问题。他们在图像上测试了两种类型的“干预”:
- 输入掩蔽(Input Masking): 他们直接遮盖了图像中 AI 用作捷径的部分。
- 特征空间干预(Feature Space Intervention): 他们进入模型的内部处理过程,并告诉它“调低”捷径信号的音量,同时“调高”真实任务信号的音量。
结果非常有趣。当他们掩蔽“捷径”区域时,模型的性能通常保持不变,甚至略有提升,这证明了那些区域对于完成任务其实并非必要。然而,当他们掩蔽“任务”区域(真实的线索)时,模型的性能崩溃了,这证实了那些部分才是重要的。
真正的胜利来自于一种结合的方法:抑制捷径的同时放大真实的任务。 当他们这样做时,不同群体(如不同性别或不同医院)之间的性能差距显著缩小了。例如,在 CelebA 人脸数据集中,这种方法将性能差距缩小了约 7.8 个百分点。在 CheXpert 胸部 X 光数据集上,这种差距缩小了惊人的 20.3 个百分点。
这意味着什么
论文指出,通过对这些空间捷径进行分组,我们可以更清晰地了解 AI 模型在哪里失败。这不仅仅是说“这个模型有偏见”,而是说“这个模型通过观察以下几种特定模式的背景来使用捷径”。
研究人员表明,这些分组是稳定且可靠的。即使他们重新训练用于检测捷径的辅助模型,这些分组仍然保持一致。他们还在不同的 AI 架构(如 ResNet 和 ViT)以及不同类型的数据集(从皮肤病变到鸟类照片)上进行了测试,结果证明该方法具有普适性。
然而,作者也谨慎地指出,这并不是解决一切问题的万灵药。在某些复杂的医学案例中,例如组织病理学切片中,“捷径”是来自特定实验室的细微染色差异,仅仅抑制空间区域不足以修复这种偏见。但在许多其他情况下,这种寻找、分组并抑制空间捷径的方法,为审计和改进 AI 提供了一种强大的新途径,使 AI 在无需从头开始的情况下变得更加公平和可靠。它将 AI 偏见的模糊地图变成了能够修复错误的详细且可操作的指南。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。