Vertical Fusion: Condensing Internal Representations for Robust ViT Classification
本文介绍了 VFusion,一种通过聚合视觉 Transformer 内部的中间表示来恢复被误分类样本,并显著提升鲁棒性与准确性的方法,为传统的水平集成方法提供了一种高效的替代方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人大脑,叫做视觉 Transformer (ViT)。它就像一座巨大的、多层结构的图书馆,每一层(或称“层”)都在阅读一张图片并写下一份关于它所见内容的简短报告。通常情况下,当我们要求这个机器人识别一只猫或一辆车时,我们只听取最顶层编写的报告。我们将所有下层视为一个“黑盒”,忽略了它们写的笔记。
但如果顶层搞错了怎么办?如果下面的楼层其实早就知道答案了呢?
这就是这篇论文试图回答的大问题。研究人员发现,机器人的“中间层”非常有帮助。事实上,他们发现,在顶层出错的情况下,有 18% 到 76% 的概率,其中一个较低的楼层其实是判断正确的!他们把这种现象称为**“可恢复性”(recoverability)**。这就像拥有一支侦探团队,首席侦探(顶层)有时会漏掉线索,但初级侦探(中间层)已经在笔记本上记下了答案。
一个巨大的误解:这并非关于“分歧”
你可能会想:“哦,所以这些层之间是在互相争论吗?这就是它们为什么优秀的原因?”论文给出的回答是:不,事实并非如此。
通常,当我们结合不同的意见(比如在小组项目中)时,我们希望每个人都有不同的视角。但在这种情况下,各层之间并没有产生分歧。相反,它们都在观察同一个“真相”,只是观察到的噪声程度略有不同。论文表明,这些层的作用更像是冗余且稳定的探测器(redundant, stable probes)。它们都在试图告诉你同样的事情,只是有些层比其他的更清晰一些。其魔力不在于它们的冲突,而在于它们都在共同拼凑同一块拼图。
解决方案:VFusion(“垂直搅拌机”)
既然顶层并不完美,而底层又被忽视了,作者们开发了一个名为 VFusion 的新工具。
把 VFusion 想象成一个智能搅拌机,它不仅仅是接收顶层的报告。相反,它会抓取来自每一层(或经过智能筛选的层)的笔记,将它们混合在一起,并使用一种特殊的过滤器来挤出“噪声”,只保留清晰且共享的信号。它创造出了一个超密集的“全局 Token”,结合了所有层的精华。
结果非常惊人:
- VFusion 平均比表现最好的单层模型高出约 1.9%。
- 它填补了最佳单层与“理论上的先知”(即只要任何一层答对就能得分的完美分数)之间 45% 的差距。
- 当图像具有挑战性时(例如区分不同品种的汽车或鸟类的细粒度细节),或者当图像模糊或扭曲时,它的表现甚至更好。
他们排除了哪些可能性
论文非常明确地指出了哪些方法不如 VFusion 有效:
- 仅仅挑选“最好”的那一层: 你不能仅仅靠猜测哪一层最聪明,然后只使用那一个。
- 简单的平均法: 仅仅对所有层的预测进行简单平均(就像简单的投票)效果并不如 VFusion 的智能混合。
- 水平集成(Horizontal Ensembles): 论文指出,虽然你可以训练 10 个不同的机器人并让它们投票(一种“水平”团队协作),但这非常昂贵且缓慢。VFusion 通过观察单个机器人内部(一种“垂直”方法)就能获得相似甚至更好的结果。这在医学影像等领域意义重大,因为在这些领域,你可能只有一个预训练好的模型可用。
他们的结论有多可靠?
作者并非凭空猜测;他们在 16 个不同的数据集(从简单的数字到复杂的花卉和汽车)以及 5 个具有挑战性的“分布外”(out-of-distribution)偏移数据集(即图像看起来与机器人训练时的图像不同)上进行了测试。
- 他们测量出中间层可以恢复 18% 到 76% 的错误。
- 他们证明了 VFusion 在不同模型规模(小、基础、大)和不同训练风格(监督学习、自监督学习、CLIP)下都能持续表现出色。
- 他们甚至检查了它在“细粒度”任务(如区分 100 种不同类型的鸟类)中的表现,并发现 VFusion 在这些困难的数据集上表现卓越,准确率提升高达 7.2%。
核心启示
论文表明,我们一直忽略了 AI 模型内部的一座信息金矿。通过使用 VFusion,我们可以将一个单一的、冻结的机器人大脑变成一个超精确的分类器,而无需训练一整支新的机器人军队。这是一种轻量级、高效的方法,可以榨取我们现有层级中的每一滴智能。
而且最棒的是什么?这不仅仅是一个理论。代码已经公开,且结果在不同类型的图像和不同规模的模型中都经受住了考验。事实证明,整个图书馆比仅仅顶层的图书管理员要聪明得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。