Sparse Attention for Dense Open-Vocabulary Prediction in CLIP
本文提出通过将 CLIP 最终视觉自注意力层中的标准 softmax 替换为稀疏 -entmax 变换,以消除来自无关标记的噪声,从而显著提升在语义分割和细粒度检索等密集开放词汇预测任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:过度热情的 AI
想象你有一个非常聪明的 AI 助手(叫做 CLIP),它读过数百万本书,也看过数百万张照片。它非常擅长理解图像的整体“氛围”。如果你给它看一张马的照片,它知道:“啊,这是一匹马!”
然而,这篇论文指出一个特定的问题:CLIP 太“礼貌”了。
当 AI 观察图像以寻找特定细节(比如“马蹄的具体位置在哪里?”)时,它试图同时关注图像中的所有内容。这就像一个正在参加考试的学生,不去专注于具体的题目,而是试图同时阅读教科书里的每一个字。结果呢?重要的细节被淹没在由无关背景噪声(如天空、草地或骑手)组成的海洋中。
问题所在:“Softmax”式的人群控制
在 AI 的大脑中,有一个名为 Softmax 的机制。把 Softmax 想象成一位严厉的老师,她强迫 AI 将其“注意力点”(比如 100 美元的预算)分配到图像的每一个部分。
- 问题在于: 即使图像中的某一块只是蓝天的一片模糊区域,老师也会说:“你必须至少给它一分钱的注意力。”
- 结果: AI 的注意力变得“弥散”了。它把钱分得太薄,以至于根本无法真正专注于马蹄。信号在噪声中丢失了。
解决方案:“Entmax”过滤器
作者提议用一个新的规则替换掉那位严厉的老师(Softmax),这个新规则叫做 -entmax(或者简称 Entmax)。
把 Entmax 想象成一个聪明的保安或一副降噪耳机。
- 它不再强迫 AI 关注所有事物,而是观察需要关注的对象列表。
- 它会说:“好吧,这块蓝天部分的得分非常低。它不重要。零注意力。”
- 它完全切断了那些低相关性项的“尾巴”。
- 然后,它将原本浪费在背景上的所有注意力点重新分配给那些真正重要的事物(即那匹马)。
神奇之处在于: 这一切都是自动发生的。AI 不需要重新训练或学习新课。我们只是改变了它在思考过程最后阶段分配注意力的规则。
类比:“嘈杂的房间” vs. “安静的图书馆”
- 旧方法 (Softmax): 想象你在一个嘈杂的房间里试图听朋友说话。每个人都在说话,房间里非常吵,以至于你听不清朋友的声音。你试图听清所有人,结果什么也没听清。
- 新方法 (Entmax): 现在,想象有一个过滤器,能瞬间让除了你朋友以外的所有人都保持沉默。突然间,房间安静下来,你朋友的声音变得清晰无比。你并没有改变你的朋友,你只是移除了背景噪声。
他们的研究发现了什么?
研究人员在两个主要任务上测试了它:
- 逐像素绘画(分割): 尝试精确地涂色,标出物体的确切位置。
- 细粒度搜索: 根据微小的细节寻找特定物体(例如,“红色的马”对比“棕色的马”)。
结果:
- 当 AI 感到困惑时,效果最好: 如果 AI 本身已经把注意力分散到了到处都是(像一个乱糟糟的房间),Entmax 能完美地清理它,让 AI 更擅长寻找物体。
- 如果 AI 已经很专注,则帮助不大: 如果 AI 本来就在看正确的地点,使其变得更“稀疏”并不会带来太多帮助。
- 越大越好: 图像越详细(分辨率越高),“噪声”就越多。Entmax 在高分辨率图像上表现最为出色,因为那里有更多的噪声可以被剔除。
“自相关”的转折
论文还尝试了一个聪明的技巧。他们不再问 AI:“这个区域与其它所有区域相比看起来如何?”(这会导致噪声),而是问:“这个区域与其自身及邻近区域相比看起来如何?”
当他们将这种“自我聚焦”的视角与新的“Entmax”过滤器结合时,结果变得更加出色。这就像是在告诉 AI:“不要看整个人群;只看你自己的群体,然后忽略其他人。”
总结
这篇论文表明,少即是多。通过强制 AI 忽略无关的背景噪声,并只关注图像中最重要的部分,我们可以让它在寻找特定物体或绘制精确轮廓等细节任务上表现得更好——而且无需重新训练 AI 或在其大脑中添加任何新的组件。我们只是改变了“音量旋钮”,调低了静电噪音。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。