← 最新论文
🤖 AI

Rethinking Global Average Pooling: Your Classifier Is Secretly a Multi-Instance Learner

本文将使用全局平均池化的标准图像分类器重新诠释为多实例学习器,证明了它们在逻辑值(logits)中本质上保留了可恢复的空间类别证据,并由此实现了一种用于提取该信息以改进多目标场景分析的后验诊断方法。

原作者: Aray Karjauv

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Aray Karjauv

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看一张繁忙公园的照片。照片中,一只金毛寻回犬正在玩飞盘,还有一个红色的长凳,背景中还有一些绿树。

长期以来,现代 AI 图像分类器就像是一个非常严厉、缺乏耐心的管理者。当它们观察这张照片时,会采用一种“全局平均池化”(Global Average-Pooling, GAP)的方法。你可以把这想象成管理者要求公园里的每一个人(图像中的每一个微小区域)都大声喊出他们看到了什么,然后管理者将所有这些喊叫声进行平均,从而做出一个最终决定。

如果狗喊了 10 次“狗!”,长凳喊了 5 次“长凳!”,树喊了 5 次“树!”,管理者可能会感到困惑。如果因为狗比较小导致“狗”的喊叫声比“树”的喊叫声小一点,那么平均值最终可能会倾向于“树”或“公园”。管理者会对整张图片做一个单一的猜测,往往忽略了那里其实有一只狗的事实。

重大发现
这篇题为《重新思考全局平均池化》(Rethinking Global Average Pooling)的论文指出,这些 AI 模型实际上比我们认为的要聪明得多。作者发现,即使 AI 只给出一个最终答案(比如“这是一个公园”),它在将所有信息平均化之前,实际上已经在为它看到的每一个部分记录一份详细的日记。

作者称之为**多实例学习(Multiple Instance Learning, MIL)**视角。与其将图像视为一个巨大的整体,不如将其视为一个“实例包”(bag of instances)。

  • 旧方法: “这张整张图是什么?” -> “是一个公园。”
  • 新方法: “这个角落里有什么?一只狗。那个角落里有什么?一个长凳。天空里有什么?树木。”

“秘密日记”类比
想象一下,AI 模型拥有一组覆盖在照片上的微型间谍网格。

  1. 旧观点: 我们只听取最后那位“总监间谍”的汇报,由他将一切总结成一句话。如果总监间谍的总结错了,我们就认为整个团队都失败了。
  2. 新观点: 作者意识到,我们可以窥视每一位间谍在向总监汇报之前的笔记。

通过这种方式,他们发现了一个惊人的事实:即使总监间警给出了错误的结论,间谍们的笔记往往也是正确的。

他们的发现
研究人员在著名的 AI 模型(如 ResNet、Swin 和 ConvNeXt)上,使用标准数据集(如 ImageNet)进行了测试。以下是他们的观察结果:

  • 隐藏的成功: 在许多 AI 说“这是一只猫”但实际照片里是一只狗的情况下,AI 在狗所在特定区域的“间谍笔记”其实正确地识别出了“狗!”。最终错误的答案仅仅是因为将“狗”的笔记与过多的“背景”笔记进行了平均。
  • “园蛛”之谜: 他们观察了一张关于园蛛在蛛网上活动的图片。AI 的最终猜测是“园蛛”。但当他们查看间谍笔记时,发现显示“蛛网”部分的图像正确识别了“蜘蛛网”,而显示“蜘蛛”部分的图像则识别出了“园蛛”。模型知道两者都在那里,它只是将它们平均成了一个标签。
  • 鲁棒性: 他们在 ImageNet-A(一组标准 AI 会表现糟糕的棘手自然图像集,其准确率仅约 20%)上进行了测试。然而,当他们查看“间谍笔记”(空间网格)时,发现模型在正确位置识别出正确物体的频率实际上达到了 50-60%。失败的原因并不是 AI “看不见”物体,而是“平均化”这一步骤冲淡了证据。

为什么这很重要(根据论文观点)
论文指出,问题不在于 AI 对复杂场景中的物体是“盲目”的。问题在于用于结合证据的数学规则(全局平均池化)。

  • 缺陷: 平均化就像是用红漆混合白漆来得到粉红色。如果你只有一小滴红漆(物体)和一大桶白漆(背景),结果几乎就是粉红色。你会丢失红色。
  • 解决方案: 论文建议,我们不应该再将图像视为一个单一的问题。相反,我们应该承认 AI 已经在扮演一个“多实例学习者”的角色——它已经在观察一个包含多种物体的“包”了。

他们并没有声称的内容
重要的是要紧扣论文的原意:

  • 他们没有说这让 AI 变得完美,或者说它现在可以取代人类医生或自动驾驶汽车。
  • 他们没有声称我们需要从头开始重新训练所有这些模型来解决问题。
  • 他们没有说这些“间谍笔记”是能够绘制精确物体轮廓的完美地图(其分辨率仍然是模糊且粗糙的)。

核心启示
这篇论文是一个“诊断工具”。它表明我们现有的 AI 模型在寻找特定位置的物体方面,实际上在暗中做得非常出色。我们看到的“错误”往往只是由于一种笨拙的平均过程,这种过程掩盖了模型已经在做的出色工作。通过观察“间谍笔记”(空间网格)而不是仅仅看最终的总结,我们可以看到 AI 比它表现出来的要博学得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →