Scaling Vision Models Does Not Consistently Improve Localisation-Based Explanation Quality
本研究证明,扩展计算机视觉模型并不能一致地提升其基于定位的解释质量,因为较小的架构往往能取得与较大模型相当甚至更优的表现,这凸显了在安全关键应用中,除预测准确性外,还需对可解释性进行明确评估的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在招募一支侦探团队来破解一个谜案。你有三种不同类型的嫌疑人:1. 新手:一个小型、简单的侦探,带着一本基础笔记本。2. 老手:一个中型侦探,经验丰富,笔记本更大。3. 超级天才:一个庞大、极度复杂的侦探,拥有图书馆般的知识库和超级计算机般的大脑。在人工智能(AI)的世界里,这些侦探就是“模型”。长期以来,一条普遍的经验法则是:“越大越好。”人们假设,如果你给侦探更多的脑力、更多的数据和更大的笔记本,他们不仅会更擅长破解谜案(预测答案),还会更擅长解释他们是如何破解的。这篇论文就像一次现实检验,它说:“且慢。”### 实验:“找不同”测试研究人员设计了一项测试,以验证“超级天才”侦探是否真的比“新手”更擅长指出线索。* 谜案:他们使用了三种不同类型的谜题:在 X 光片中识别疾病(例如在肺部发现阴影)、在照片中识别特定动物,以及在胸部扫描中发现肺炎。* 线索:对于每个谜题,他们都拥有一张由人类专家绘制的“黄金标准”地图(真实掩膜),精确标出了图像中重要部分的位置。* 测试:他们要求侦探绘制一张“热力图”(聚光灯),显示他们认为图像的哪些部分很重要。* 评分:他们测量了两件事:1. 他们是否指向了正确的位置?(相关性排名准确性)2. 他们是否避免了指向错误的东西?(双极性精度)——这就像检查侦探是否也正确地忽略了背景噪音。### 重大惊喜结果出乎意料。1. 规模不等于清晰度“超级天才”模型(巨大的深度神经网络)并没有比“新手”产生更好的解释。事实上,在许多情况下,更小、更简单的模型指出正确线索的能力与庞大的模型一样好,甚至更好。* 类比:这就像拥有一本庞大复杂的百科全书,它给你一个模糊、令人困惑的答案,而一张小巧、组织有序的名片却直接给出了确切的页码。更大的工具并没有让解释变得更清晰。2. “预训练”效应有些模型经过了“预训练”,这意味着在针对这些特定谜题进行测试之前,它们已经学习了数百万张其他图片。* 有帮助吗? 有时是,有时不是。* 陷阱:虽然预训练通常有助于模型得出正确的答案,但它并不能保证解释会更好。一个经过预训练的模型可能完美地解开谜题,但其聚光灯仍然指向图像的错误部分。3. “聪明但具有欺骗性”的问题这是最关键的发现。在其中一个医学数据集(气胸胸部 X 光片)上,模型在预测疾病方面表现非常出色(高准确率)。然而,当被要求显示疾病位于何处时,它们的热力图几乎完全错误(对齐度接近零)。* 类比:想象一个学生在数学考试中得了"A",但当被要求展示解题过程时,却画出了一团随机的涂鸦。他们得到了正确答案,但实际上并没有理解步骤。AI 很可能是在“作弊”,它关注的是 X 光机或背景中的奇怪伪影,而非实际疾病,却依然得出了正确的诊断。### 这对你的意义论文得出结论:我们不能假设更大、更昂贵的人工智能模型会自动更加透明或可信。* 不要只追逐规模:更大的模型并不能可靠地提供更好的解释。* 检查工作:你不能只看最终得分(准确率)。你必须检查“聚光灯”(解释),以确认模型是否真的在关注正确的东西。* 小模型可能更聪明:有时,一个更小、更简单的模型在解释其推理方面与庞大的模型一样出色,但运行成本更低。简而言之:仅仅因为一个模型是“超级天才”,并不意味着它能解释它的作业。 事实上,有时“新手”侦探头脑更清晰,地图更准确。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。