Do All Vision Transformers Need Registers? A Cross-Architectural Reassessment
本文通过跨架构复现与扩展研究,验证了“寄存器”(Registers)在消除 Vision Transformer 注意力图伪影方面的有效性,同时揭示了其声称的普适性在不同模型(如 DINO、DINOv2、OpenCLIP 和 DeiT3)及不同规模下存在局限,并厘清了原文中的术语不一致问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一次对“视觉大模型”的深度体检和复查。
想象一下,你正在教一群超级聪明的机器人(也就是视觉 Transformer 模型)看图片。这些机器人非常厉害,能认出猫、狗、汽车,甚至能理解图片里的复杂场景。但是,最近有科学家(Darcet 等人)发现了一个奇怪的现象:这些机器人在“思考”的时候,脑子里会出现一些奇怪的噪点(Artifacts)。
这就好比你在看一张高清照片,但照片上突然出现了几个刺眼的、发光的白点,或者在注意力地图上(机器人觉得哪里重要的地方)出现了毫无意义的乱码。这些噪点让机器人很难解释它到底在看什么,也干扰了它发现物体的能力。
为了解决这个问题,Darcet 等人提出了一种“创可贴”方案:给机器人输入时,额外塞进去几个空白的“记事本”(Registers)。他们声称,这些空白记事本可以帮机器人把那些杂乱的“全球信息”记下来,从而让原本乱糟糟的图像变得清晰。
这篇论文的作者们(Spiros 等人)决定:“真的吗?让我们亲自试一下,看看这个‘创可贴’是不是对所有机器人都管用。”
1. 他们发现了什么?(核心发现)
作者们把 Darcet 的结论像剥洋葱一样,一层层地重新验证,结果发现:有些是对的,有些则没那么简单。
关于“大个子”和“小个子”的误区(Claim 2):
- 原观点:只有那些超级大的模型(参数超过 3 亿)才会产生这些噪点。
- 新发现:不对!即使是小个子模型(比如 OpenCLIP-B),有时候也会产生噪点。这就好比,不仅是大卡车容易爆胎,小轿车在特定路况下也会爆胎。噪点的出现不仅仅取决于模型的大小。
关于“噪点”住在哪里(Claim 3):
- 原观点:噪点喜欢躲在图片里最无聊、最重复的地方(比如一片蓝天或一面白墙)。
- 新发现:对于大多数普通模型(像 DINOv2),这确实是对的。噪点就像是在无聊的白墙上乱涂乱画。但是,对于金字塔结构的模型(像 PVT),情况就变了。它们的噪点分布规律完全不同,甚至有点“反着来”。
关于“噪点”到底在想什么(Claim 4):
- 原观点:这些噪点(高范数 Token)虽然看不懂局部细节(比如看不清猫耳朵),但它们懂大局(比如知道整张图是“猫”)。
- 新发现:在普通模型里,这完全正确。噪点确实像是“战略家”,负责把握全局。
- 但是! 在金字塔模型(PVT)里,情况完全反转了!那里的噪点反而变成了“战术家”,它们极其擅长记住位置(比如猫在左上角),却看不懂细节。这说明,不同的模型架构,对“噪点”的利用方式完全不同。
关于“创可贴”(Registers)的效果(Claim 5):
- 原观点:加上空白记事本(Registers),噪点就消失了,而且模型变得更聪明。
- 新发现:
- 清理噪点:是的,加上 Registers 后,那些刺眼的乱码确实消失了,图片变得干净了。这点没得黑。
- 提升性能:这点存疑。作者发现,虽然加了 Registers 模型变干净了,但并没有让模型变得更聪明(分类准确率没有明显提升)。这就好比你给机器人戴了一副防噪耳机,它听得更清楚了,但解题能力并没有因此变强。而且,这些 Registers 里的信息,似乎和机器人原本自带的“总指挥”([CLS] 令牌)重复了,没提供什么新东西。
2. 通俗比喻总结
为了让你更直观地理解,我们可以用**“开派对”**来打比方:
视觉 Transformer 模型 = 一个大型派对。
图片里的每个小方块 = 派对上的客人。
噪点(Artifacts/High-norm tokens) = 派对上几个特别吵、特别显眼的客人。
- 在普通派对(普通 ViT)上,这几个吵闹的客人通常躲在没人的角落(冗余区域),他们虽然不聊具体的细节(比如“这朵花是什么颜色”),但他们知道整个派对的氛围(全局信息)。
- 在金字塔派对(PVT)上,这几个吵闹的客人反而成了领舞,他们负责指挥大家站哪里(位置信息),但不懂具体的细节。
Registers(空白记事本) = 派对上专门请来的几个“安静观察员”。
- Darcet 说:请这几个观察员来,把那些吵闹客人的活儿接过去,派对就清净了,而且大家能玩得更开心。
- 这篇论文说:确实,派对变清净了(噪点没了,图变干净了)。但是,大家并没有因此玩得更开心(性能没提升)。因为那些观察员其实和派对主持人([CLS])说的话差不多,有点重复劳动。
3. 这篇论文告诉我们什么?
- 不要一概而论:以前大家觉得“大模型才有噪点,加了 Registers 就完美”,现在发现不同架构的模型性格迥异。不能拿一套方案套在所有模型上。
- 术语要分清:以前大家把“噪点”、“异常值”、“注意力图”混为一谈。这篇论文把它们分得很清楚,就像把“噪音”和“回声”区分开一样,这对以后研究很重要。
- Registers 是个好工具,但不是万能药:它确实能净化模型的“大脑”(让注意力图更清晰,方便人类理解),但它不一定能直接提升模型的智商。
一句话总结:
这篇论文告诉我们要**“具体问题具体分析”**。虽然给模型加“空白记事本”(Registers)能让它们看起来更清晰、更干净,但这并不意味着它们真的变聪明了,而且不同种类的模型对这种“治疗”的反应也完全不同。未来的研究需要更精细地针对不同模型架构来设计解决方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。