← 最新论文
💻 computer science

DnA: Denoising Attention for Visual Tasks

本文介绍了去噪注意力(Denoising Attention, DnA),这是一种通过利用正向和负向查询将交互投影到不同子空间中,从而减轻视觉任务中噪声注意力模式的新颖机制,进而实现在图像和视频理解基准测试中的性能提升。

原作者: Ron Campos, Subhajit Maity, Xin Li, Srijan Das, Aritra Dutta

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ron Campos, Subhajit Maity, Xin Li, Srijan Das, Aritra Dutta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在嘈杂拥挤的房间里寻找一个特定的人。这本质上就是计算机视觉模型观察图像时的做法:它们试图识别出主要物体(比如“胸甲”或“野兔”),同时忽略背景中的杂乱信息(比如站在旁边的“人”或角落里的“猫”)。

这篇论文介绍了一种名为 DnA (去噪注意力,Denoising Attention) 的新方法,旨在帮助这些计算机模型更好地完成这项工作。以下是其原理的简单解释:

问题所在:“大嗓门”问题

目前大多数 AI 模型使用一种叫做 Softmax 的标准工具来决定应该关注什么。你可以把 Softmax 想象成房间里的扩音系统。如果有一个人很大声地喊叫(高分),系统就会过度放大那个声音,从而淹没了其他所有人的声音。

  • 问题在于: 虽然这有助于模型专注于“最响亮”的事物,但也制造了一个问题。如果有两个非常相似的东西(比如野兔和猫,或者头盔和胸甲),扩音器可能会产生混乱。它可能会放大错误的人,或者因为背景噪音而分心,因为它只知道如何调节单一的“音量”旋钮。它很难做到说:“这是好的信号,而那个是坏的信号”,因为它只知道如何把音量调

解决方案:“双通道”系统

作者提出的 DnA 就像是一位拥有两个独立通道而非单一通道的高级音响工程师。

  1. 通道 1(正向查询/Positive Query): 这个通道在问:“这里应该有什么?”它寻找符合正确答案的特征(例如:“这绝对是一个胸甲”)。
  2. 通道 2(负向查询/Negative Query): 这个通道在问:“什么东西看起来很像但并不属于这里?”它主动寻找那些“冒充者”特征(例如:“那个头盔看起来像胸甲,但它其实是个头盔”)。

魔法技巧:分离房间

在旧的模型中,“好”特征和“坏”特征被混合成了一大堆信息。这就像是在试图把红蓝两种颜色的弹珠从同一个桶里进行分类。

DnA 使用了一个聪明的技巧:它将“好”特征投影到一个房间,将“坏”特征投影到另一个完全不同的房间。

  • 类比: 想象你有一个存放“真相”的房间和一个存放“干扰”的独立房间。
  • 正向通道将相关的特征放入“真相”房间。
  • 负向通道将那些令人困惑、无关的特征放入“干扰”房间。
  • 因为这两个房间在数学意义上相距很远(它们之间具有“大的主角度”),模型可以清晰地辨别差异。它可以保留有用的信息,并在不误删好东西的前提下丢弃噪声。

为什么这很重要(实验结果)

作者在多个任务上测试了这个新系统:

  • 图像识别: 在观察动物或物体的照片时,DnA 更擅长忽略背景并专注于主体。在标准的 ImageNet 测试中,与标准模型相比,它的准确率提升了 0.8%
  • 视频理解: 它在动态图像(视频)上的表现甚至更好。
    • 在一个识别智能家居视频的任务中,准确率提升了 4.0%
    • 在一个识别人类动作的任务中,准确率提升了 1.2%
    • 它还帮助“视频大语言模型”(Video LLM,一种能理解视频的聊天机器人)更好地回答问题,准确率提升了 0.5%

“去噪”效应

作者称之为“去噪”,因为它就像一副降噪耳机。它不仅仅是让信号变得更大声,而是主动识别出“静电噪声”(那些令人困惑的背景物体)并将其减去,从而留下一个关于主要物体的清晰画面。

总结

简而言之,DnA 是 AI 观察图像的一种新方式。它不再只是喊着“看那个最响的东西!”,而是会问两个问题:“什么是正确的东西?”以及“什么是看起来像正确东西的错误东西?”通过将这两个问题的答案保存在两个独立的心理“房间”里,AI 能够更出色地忽略干扰并看清真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →