Discrete Cosine Transform Based Decorrelated Attention for Vision Transformers
本文提出了两种基于离散余弦变换(DCT)的 Vision Transformer 方法:一种用于自注意力投影的结构保持初始化策略,可提升分类准确率;另一种是频域压缩技术,通过在无损性能的前提下截除高频噪声来降低计算开销。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将视觉 Transformer(ViT)视为一位试图学习识别图片中物体的超级聪明学生。为此,该学生将图像拆解为微小的拼图块(patches),并观察它们之间的相互关系。执行这种“观察与连接”功能的部分被称为自注意力(Self-Attention)。
Hongyi Pan 及其同事的论文指出,这位学生目前正带着一些坏习惯开始学习:他们在开始时随机猜测,并且试图记住每一个微小的细节,甚至包括静态干扰和噪声。作者提出利用一种名为**离散余弦变换(DCT)**的数学工具进行两项简单的修正——这正是用于压缩 JPEG 图像和 MP3 文件的相同数学原理。
以下是他们两种新方法的运作方式,通过日常类比进行解释:
1. “智能起步”(基于 DCT 的初始化)
问题:
通常,当视觉 Transformer 开始训练时,它会为“脑细胞”(权重)分配随机数字,以决定要寻找什么。这就像给一名新生一叠空白闪卡,并让他们猜测卡片另一面是什么。他们必须从零开始,这不仅耗时,而且可能不稳定。
解决方案:
作者说:“让我们让学生有一个良好的开端。”他们不使用随机数字,而是利用DCT 矩阵来初始化脑细胞。
- 类比: 想象学生的大脑是一个收音机调谐器。随机初始化就像将旋钮调至杂音。而 DCT 初始化则像是一开始就将收音机调谐到某个特定的清晰频道。
- 运作原理: DCT 矩阵由特定的模式(如不同的音符或颜色)组成,覆盖了所有可能性的频谱。通过从这些模式开始,模型无需“猜测”存在哪些特征;它从一开始就拥有了一个结构化、有条理的世界观。
- 结果: 模型学习得更快,并且在识别事物(如猫或汽车)方面表现更好,因为它拥有一个“干净”且有条理的基础,而非随机噪声。
2. “噪声过滤器”(基于 DCT 的压缩)
问题:
当模型查看图像时,它试图处理每一个细节。然而,在信号(如图像)的世界中,最重要的信息通常位于“低频”(即大形状和主色调),而“高频”往往只是微小的锯齿状细节或噪声(如照片中的颗粒)。
- 类比: 想象你正在向朋友描述一个风景。你告诉他们关于山脉、河流和树木的情况(重要的内容)。但随后,你又花了 10 分钟描述每一根草叶和岩石上的一粒灰尘(噪声)。这是对时间和精力的浪费。
解决方案:
作者提出了一种方法,在模型进行繁重思考之前先“剔除冗余”。
- 类比: 他们利用 DCT 将图像转换为一份“频率报告”。然后,他们直接切掉报告的前 25% 到 75%,丢弃高频噪声。
- 运作原理: 模型仅保留“低频”系数(即重要的形状),而忽略其余部分。这使得数据量大大减小。
- 结果: 模型变得更加轻便和快速(所需的计算能力和内存更少),因为它不再将精力浪费在噪声上。令人惊讶的是,论文发现,即使数据量减少,模型的准确率仍保持不变甚至略有提升,因为它专注于正确的事物。
总结
该论文声称,通过使用这两种 DCT 技巧:
- 初始化: 模型从一张更好的世界“地图”开始,从而在 CIFAR-10 和 ImageNet 等识别物体的测试中取得更高的准确率。
- 压缩: 模型可以忽略视觉上的“静态干扰”,使其运行速度更快,占用内存更少,同时不损失其清晰识别的能力。
作者在标准图像识别任务上测试了这种方法,发现他们的"DCT-Transformer"模型比标准版本更高效,且往往更准确,这证明了有时,一点点数学结构就能产生巨大的作用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。