想象一下,你正试图在嘈杂拥挤的房间里寻找一个特定的人。这本质上就是计算机视觉模型观察图像时的做法:它们试图识别出主要物体(比如“胸甲”或“野兔”),同时忽略背景中的杂乱信息(比如站在旁边的“人”或角落里的“猫”)。
这篇论文介绍了一种名为 DnA (去噪注意力,Denoising Attention) 的新方法,旨在帮助这些计算机模型更好地完成这项工作。以下是其原理的简单解释:
问题所在:“大嗓门”问题
目前大多数 AI 模型使用一种叫做 Softmax 的标准工具来决定应该关注什么。你可以把 Softmax 想象成房间里的扩音系统。如果有一个人很大声地喊叫(高分),系统就会过度放大那个声音,从而淹没了其他所有人的声音。
- 问题在于: 虽然这有助于模型专注于“最响亮”的事物,但也制造了一个问题。如果有两个非常相似的东西(比如野兔和猫,或者头盔和胸甲),扩音器可能会产生混乱。它可能会放大错误的人,或者因为背景噪音而分心,因为它只知道如何调节单一的“音量”旋钮。它很难做到说:“这是好的信号,而那个是坏的信号”,因为它只知道如何把音量调大。
解决方案:“双通道”系统
作者提出的 DnA 就像是一位拥有两个独立通道而非单一通道的高级音响工程师。
- 通道 1(正向查询/Positive Query): 这个通道在问:“这里应该有什么?”它寻找符合正确答案的特征(例如:“这绝对是一个胸甲”)。
- 通道 2(负向查询/Negative Query): 这个通道在问:“什么东西看起来很像但并不属于这里?”它主动寻找那些“冒充者”特征(例如:“那个头盔看起来像胸甲,但它其实是个头盔”)。
魔法技巧:分离房间
在旧的模型中,“好”特征和“坏”特征被混合成了一大堆信息。这就像是在试图把红蓝两种颜色的弹珠从同一个桶里进行分类。
DnA 使用了一个聪明的技巧:它将“好”特征投影到一个房间,将“坏”特征投影到另一个完全不同的房间。
- 类比: 想象你有一个存放“真相”的房间和一个存放“干扰”的独立房间。
- 正向通道将相关的特征放入“真相”房间。
- 负向通道将那些令人困惑、无关的特征放入“干扰”房间。
- 因为这两个房间在数学意义上相距很远(它们之间具有“大的主角度”),模型可以清晰地辨别差异。它可以保留有用的信息,并在不误删好东西的前提下丢弃噪声。
为什么这很重要(实验结果)
作者在多个任务上测试了这个新系统:
- 图像识别: 在观察动物或物体的照片时,DnA 更擅长忽略背景并专注于主体。在标准的 ImageNet 测试中,与标准模型相比,它的准确率提升了 0.8%。
- 视频理解: 它在动态图像(视频)上的表现甚至更好。
- 在一个识别智能家居视频的任务中,准确率提升了 4.0%。
- 在一个识别人类动作的任务中,准确率提升了 1.2%。
- 它还帮助“视频大语言模型”(Video LLM,一种能理解视频的聊天机器人)更好地回答问题,准确率提升了 0.5%。
“去噪”效应
作者称之为“去噪”,因为它就像一副降噪耳机。它不仅仅是让信号变得更大声,而是主动识别出“静电噪声”(那些令人困惑的背景物体)并将其减去,从而留下一个关于主要物体的清晰画面。
总结
简而言之,DnA 是 AI 观察图像的一种新方式。它不再只是喊着“看那个最响的东西!”,而是会问两个问题:“什么是正确的东西?”以及“什么是看起来像正确东西的错误东西?”通过将这两个问题的答案保存在两个独立的心理“房间”里,AI 能够更出色地忽略干扰并看清真相。
技术摘要:用于视觉任务的去噪注意力机制 (DnA)
1. 问题陈述
视觉 Transformer (ViT) 及其他视觉感知模型中的标准注意力机制依赖于 softmax 激活函数来进行注意力权重的归一化。虽然 softmax 在最大熵原理上具有理论依据,但作者认为它在视觉任务中引入了特定的局限性:
- 不对称性与噪声: Softmax 会放大主导的正向得分,同时将负向或低幅度的得分压缩至零附近。这种不对称性会抑制具有信息量的“负向”交互(例如,那些与目标物体密切相关但属于不同对抗性类别的特征)。
- 注意力分配失当: 由于将所有交互都视为单一子空间内的处理,标准注意力往往会将相关的特征与噪声上下文混合。例如,在识别主要物体时,模型可能会无意中关注到次要的、具有对抗性的物体(例如,在识别胸甲时,由于 softmax 机制无法明确区分“相关特征”与“紧密相关但不相关”的特征,导致模型可能关注到人或头盔)。
- 子空间局限性: 理论分析表明,分类误差与类子空间之间的主角度成反比。标准注意力将所有交互投影到一个单一的值子空间 (V) 中,限制了实现正向和负向 Token 交互之间几何分离所需的判别能力。
2. 方法论:去噪注意力 (DnA)
作者提出了 去噪注意力 (Denoising Attention, DnA) 机制,该机制通过两个截然不同的、准正交的子空间来显式建模正向和负向的 Token 交互,从而取代传统的多元头自注意力 (MHSA)。
核心设计原则
- 双重查询机制: DnA 不再使用单一查询,而是针对相同的 Key 使用两组查询:
- 正向查询 (Q+): 识别属于正确类别的特征。
- 负向查询 (Q−): 识别与正确类别紧密相关但属于无关项的特征(对抗性或干扰性特征)。
- 双重激活函数:
- 正向分支使用 softmax 来放大主导的正向得分。
- 负向分支使用 softmin(定义为 σ(−z))来放大强烈的负向交互,从而捕捉被标准 softmax 所抑制的对比结构。
- 子空间分离:
- 正向和负向分支的交互被投影到两个不同的值子空间 (V+ 和 V−) 中。
- 理论动机(定理 2)表明,这两个子空间之间更大的主角度可以降低分类误差。
- 该架构通过初始化和训练动态过程来强制实现 V+ 与 V− 之间的准正交性,而非在每次迭代时强制执行严格的正交。
- 数学公式:
对于给定的头 h,DnA 输出计算如下:
AhQ±V±=σ(dQh+Kh⊤)Vh++αhσ^(dQh−Kh⊤)Vh−
其中 σ 是 softmax,σ^ 是 softmin,αh 是可学习的平衡参数。
集成方式
- 图像分类: DnA 取代了标准 ViT 主干网络(如 ViT-B)中的 MHSA。
- 视频理解:
- 视频 Transformer: DnA 同时取代了 TimeSformer 等模型中的空间和时间自注意力机制。
- 视频大语言模型 (Video LLMs): DnA 被集成到视觉探针(如 VisCoP/VideoLLaMA3 中)的交叉注意力模块中,允许模型在将视觉线索传递给 LLM 之前过滤掉有害的 Token 交互。
3. 核心贡献
- 理论洞察: 本文建立了子空间分离(主角度)与分类误差之间的联系,从而论证了将正向和负向交互分离到不同子空间中的合理性。
- 架构创新: 引入了 DnA,它利用双查询、双值和双激活(softmax/softmin)框架,显式地对注意力图进行去噪。
- 实证验证: 通过广泛的实验证明,DnA 在图像和视频任务上的表现优于标准注意力及其他替代方案(如 Differential Attention)。
- 子空间分析: 通过“入侵维度”(intruder dimension)分析和 Frobenius 内积测量提供的定量证据,证实了与单子空间替代方案相比,DnA 分支在更正交的子空间中运行,从而实现了更好的噪声抑制。
4. 实验结果
作者在多个基准测试上评估了 DnA,并报告了相对于基线的绝对增益:
图像分类 (ImageNet-1K):
- 使用 ViT-B 作为主干网络,DnA 相比基线 ViT-B 实现了 0.8% 的 Top-1 准确率绝对增益(81.9% vs. 81.1%)。
- 其表现优于使用 Differential Attention 和 Cog Attention 的模型。
- 鲁棒性: DnA 在 ImageNet-A(对抗性样本)上表现出卓越的性能,实现了比基线更高的可靠性 (AURRA) 和更低的校准误差 (RMSE)。
视频理解:
- 动作识别: 在 Toyota Smarthome 数据集上,DnA 相比 TimeSformer 分别提升了 1.3% (Cross-Subject) 和 4.0% (Cross-View)。在 NTU RGB+D 60 上实现了 1.2% 的增益。
- 视频大语言模型 (Video LLMs): 集成到 VideoLLaMA3 中用于 Ego-in-Exo PerceptionMCQ 基准测试时,DnA 相比基线 VisCoP 获得了 0.5% 的绝对增益,特别是在动作理解和人机交互任务方面。
定性分析:
- 注意力可视化显示,虽然标准 softmax 注意力往往分布较散或聚焦于对抗性背景物体,但 DnA 能精准聚焦于主要物体。
- 负向分支 (AQ−V−) 有效地抑制了无关的背景区域,在类别特征与噪声之间创造了清晰的对比。
5. 重要性与主张
本文声称 DnA 解决了基于注意力机制的视觉模型中的一个根本性局限:即标准 softmax 无法区分相关特征与紧密相关但不相关的噪声。
- 去噪效应: 通过显式建模负向交互并将它们投影到独立的子空间中,DnA 起到了“去噪”滤波器的作用,防止模型被对抗性或干扰性的视觉线索误导。
- 几何解释: 性能提升归功于正向和负向 Token 交互的几何分离,正如理论分析所预测,这降低了分类误差界限。
- 泛化性: 研究表明,该机制不仅在标准图像分类中有效,在复杂的视频理解任务(包括细粒度动作识别和视频-语言推理)中同样表现出色。
- 效率: 虽然 DnA 引入了额外的参数(对于 Video LLMs 约为 3%,对于 Video Transformers 最高达 23%),但作者指出这些参数存在于可并行化的注意力头中,因此保持了与基线模型相当的吞吐量。
作者总结道,DnA 为视觉任务提供了一种原则性的标准注意力替代方案,通过利用子空间分离来提高判别能力和鲁棒性,且无需对 Transformer 架构进行彻底重构。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。