← 最新论文
🤖 AI

ConceptSMILE: Auditing the Trustworthiness of Concept-Based Explainable AI

本文介绍了 ConceptSMILE,这是一个与模型无关的审计框架,通过扰动输入以衡量概念响应的变化并拟合代理模型,来评估基于概念的可解释人工智能的可信度,并证明了其在比较视网膜眼底图像中视觉概念路径与语义概念路径的可靠性方面的有效性。

原作者: Mohadeseh Mollapour, Koorosh Aslansefat, Zeinab Dehghani, Bhupesh Kumar Mishra, Tejal Shah, Zhibao Mian

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohadeseh Mollapour, Koorosh Aslansefat, Zeinab Dehghani, Bhupesh Kumar Mishra, Tejal Shah, Zhibao Mian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你制造了一个超级聪明的机器人医生,它可以通过观察眼睛的照片来判断是否有异常。你问它:“你为什么觉得这只眼睛有病?”它回答道:“因为我看到了一个病灶、一条血管和一个视盘。”听起来很棒,对吧?它正在使用人类的语言!但转折在于:仅仅因为机器人它看到了一个病灶,并不意味着它真的在看一个病灶。它可能是在“作弊”,盯着相机镜头的奇怪污点或者照片上的日期戳。

这正是 ConceptSMILE 这篇论文所研究的问题。作者们就像是 AI 的“信任侦探”。他们引入了一个名为 ConceptSML(基于概念层级的统计模型无关局部解释)的新框架,旨在审计这些“人类语言”形式的解释究竟是真正可靠,还是仅仅在编造华丽的谎言。

核心理念:不要相信语言,要测试反应

该论文反对一个普遍的假设:即如果一个 AI 的解释使用了我们理解的词汇(如“病灶”或“血管”),那么它就自动具备了可靠性。作者们说:“不!”一个模型可以给出一个听起来完美的答案,但实际上却依赖于隐藏的诡计,比如注意到照片上某个特定的 Logo 或拍摄方式产生的奇怪伪影。

为了抓住这些诡计,ConceptSMILE 玩了一场“如果……会怎样?”的游戏:

  1. 设定: 他们拍下一张眼睛的照片,并询问 AI:“你看到了什么?”
  2. 转折: 他们秘密地篡改照片。他们遮盖图像的部分区域(比如在血管上方放一个黑色补丁)或者添加虚假内容(比如日期戳或 Logo)。
  3. 测试: 他们再次询问 AI:“好吧,既然我把血管遮住了,你还觉得它在那里吗?”
    • 如果 AI 说:“噢,你把它遮住了?那我看不见它了。”这说明 AI 表现良好。这意味着 AI 确实是在观察血管。
    • 如果 AI 说:“我仍然能看到血管!”即便它已经被遮住了,那说明 AI 表现糟糕。这意味着 AI 在瞎猜,或者在看完全不同的东西。

两大竞争者:“地图绘制者” vs. “故事讲述者”

为了测试他们的想法,作者在两种不同的眼底图像解释方式之间进行了一场对决:

  1. 地图绘制者 (MedSAM): 这个 AI 会绘制一张地图。它像拼图一样切分出血管和视盘。它非常擅长知道事物位于哪里
  2. 故事讲述者 (VLM): 这个 AI 观察照片并写出一句描述所见内容的句子。它擅长使用语言,但在精确位置上可能显得有些模糊。

作者通过 ConceptSMILE “酷刑测试”,将两者置于四个不同公开数据集(HRF, APTOS, ODIR, 和 IDRiD)的 40 张视网膜图像中进行检验。

结果如何(计分板)

结果既有“哇,真酷”的惊喜,也有“喔,要小心”的警示。

  • 地图绘制者 (MedSAM) 在精准度上胜出: 在精准定位事物位置方面,地图绘制者是冠军。它在衡量其内部逻辑与图像变化匹配程度的得分非常高。具体而言,对于“血管”和“视盘”这两个概念,它的代理保真度(衡量简单模型预测其行为能力的指标)达到了 R² = 0.8503R²w = 0.8465。这表明当地图绘制者说它看到了血管时,它通常确实是在看血管。
  • 故事讲述者 (VLM) 在血管的“忠实度”上胜出: 令人惊讶的是,在处理血管时,故事讲述者的“忠实度”反而更高。这意味着当研究人员干扰图像中的血管部分时,故事讲述者的回答会以一种非常一致且符合逻辑的方式发生变化。其相关性得分(衡量忠实度的指标)范围在 r = 0.5794r = 0.7133 之间,具有统计学显著性。
  • “稳定性”的惊喜: 作者测试了如果在照片中添加虚假的日期或医院 Logo 会发生什么。
    • 地图绘制者 在观察视盘(眼睛中心)时表现得极其稳定。即使有虚假 Logo,它在某些数据集上识别视盘的准确率仍高达 98%
    • 故事讲述者 在谈论病灶(眼部斑点)时表现出了惊人的稳定性。即使添加了虚假日期,它依然保持冷静,在某些数据集上的稳定性得分甚至达到了 1.00(完美稳定性)。

局限性:它不是万灵药

论文非常谨慎,并未声称这是一个已解决的问题。作者明确指出,没有任何一种方法在所有类别中都成为了赢家。

  • 有时地图绘制者擅长寻找血管,但在病灶方面表现不稳定。
  • 有时故事讲述者擅长保持一致性,但在定位方面表现不佳。
  • “解释的可信度”完全取决于你讨论的是哪个概念以及你使用的是哪个数据集。

作者还指出,他们的测试是一个使用有限图像集(来自 4 个数据集,每个数据集 10 张)的“概念验证”。他们还没有在成千上万的患者或真实的医院环境中进行测试。他们也承认,他们这种“遮盖”图像部分(掩码)的方法带有一定的实验性质,可能无法完美模拟现实世界中的眼疾。

总结

ConceptSMILE 并不是在告诉我们哪种 AI “最好”。相反,它提供了一份成绩单,清晰地展示了每种 AI 的强项所在,以及它们在哪里可能在“吹牛”。

主要的启示很简单:仅仅因为一个 AI 使用了我们的语言,并不意味着它理解我们。 在你信任它的诊断之前,你必须去戳它、试探它,并观察它的反应。作者建议,在医疗这类高风险领域,我们需要这种“审计层”,以确保 AI 不仅仅是在编造一些听起来非常有说服力的内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →