🤖 machine learning
Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers
本文揭示,对比预训练的视觉 - 语言模型包含一个 substantial 且不变的共享多模态噪声子空间,该子空间可被安全剪枝而不损害下游性能,从而为理解其潜在表征结构提供了新的机制性见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人助手(比如 CLIP),它被训练成既能理解图片也能理解文字。你让它“给我看一张狗的图片”,它瞬间就能找到。这看起来完美无缺。但这篇论文指出,这个机器人实际上背着一个沉重且无用的背包,里面装满了它完成工作所不需要的垃圾。
以下是研究人员发现的要点,使用简单的类比来说明:
1. 信号中的“静电”
把机器人的大脑想象成一个巨大的无线电接收器,拥有 768 个不同的频道(维度)在聆听世界。
- 好频道:这些频道中的大多数都调谐到了“信号”上——即图片或文字的实际含义(比如“狗”、“教堂”或“快乐”)。
- 坏频道:研究人员发现,其中大约 164 个频道只是在广播“静电”。这不是随机噪声,而是一种特定的、共享的静电,无论内容是什么,它都会出现在机器人看到的每一张图片、每一个词语中。
2. “幽灵”模式
最令人惊讶的是,这种“静电”在不同群体之间是完全相同的。
- 类比:想象你拍了一张西伯利亚哈士奇的照片和一张教堂建筑的照片。它们毫无共同之处。然而,如果你查看机器人记忆中这两张图片的“垃圾”部分,会发现这些垃圾看起来几乎完全一样(重叠度达 91%)。
- 发现:机器人有一个“幽灵”模式,被印刻在它看到的每一样东西上。这就像打印机镜头上有一块污渍;它打印的每一份文件,无论是食谱还是情书,角落都会有同样的污渍。研究人员发现,这块污渍如此一致,以至于他们可以完美地绘制出它的图谱。
3. “杂物抽屉”实验
研究人员决定测试一下,如果他们直接扔掉这个“杂物抽屉”(那 164 个维度的噪声)会发生什么。
- 结果:他们拿走了机器人,移除了那 164 个频道,然后让它执行常规任务(比如在照片中识别动物或将词语与图片匹配)。
- 惊喜:机器人并没有变差。事实上,它在将词语与图片匹配方面变得稍微更好了。这就像从跑步者身上卸下了装满石头的背包;他们不仅没有变慢,反而因为不再负重而跑得更快了。
4. 为什么会发生这种情况?
论文指出,这种“噪声”并非代码中的漏洞,而是机器人构建方式的副作用。
- 类比:想象一家制造汽车的工厂。工程师们设计了极其高效的装配线,使得汽车非常棒,但机器的振动却意外地在每一扇车门上印下了一道微小且无用的划痕。这道划痕并不会阻碍汽车行驶,但它出现在每一辆车上。
- 研究人员发现,这种“划痕”(即噪声)是架构的基本组成部分,而不仅仅是针对某个特定数据集的失误。
总结
该论文声称,像 CLIP 这样的现代 AI 模型携带着大量的“共享噪声”(在某些版本中约为 164 个维度),这些噪声与图片或文字的实际含义毫无关系。
- 好消息:你可以剔除这些噪声,而不会损害 AI 的性能。
- 大局观:AI“大脑空间”的很大一部分实际上只是在存储这种重复的、无意义的模式,而不是有用的知识。通过清理它,AI 会变得更高效、更准确。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。