Three Necessary Principles for Self-Supervised Visual Representation Learning
本文认为,有效的自监督视觉表示学习需要同时整合三个互不重叠的原则——语义不变性(观测)、补丁级空间预测以及表示非退化性(正则化)——以防止模型崩溃,并将主要方法统一在单一的能量分解框架之下。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人理解世界,但你有一个严格的规则:你不能展示任何标签。你不能说“这是一只猫”或“那是辆车”。这个研究领域被称为自监督学习(self-supervised learning)。机器人必须通过观察世界的图片并自行发现模式来学习,而不需要老师告诉它什么是什。
为了做到这一点,机器人需要建立一个心理地图,或者说一个“表示(representation)”。这就像是一个图书馆。如果机器人只是死记硬背每一张照片中的每一个像素,这个图书馆就会变成一个充满灰尘和纸张的混乱堆填区。但如果它学会了按意义进行分组——把所有的“猫”放在一个书架上,把所有的“车”放在另一个书架上——它就学会了一个有用的表示。科学家们一直追问的大问题是:机器人为了正确构建这个图书馆而不产生困惑或放弃,所需要遵循的绝对最小规则集是什么?
长期以来,研究人员尝试了各种技巧。有些告诉机器人观察两张不同的同类照片,并确保它们看起来相似(比如识别出无论猫是在睡觉还是在玩耍,都是同一只猫)。另一些则告诉机器人看一张照片的一部分,并猜测缺失的部分看起来像什么(就像玩拼图一样)。但通常,机器人会陷入困境。它会学会一种“捷径”,即它对每一张照片都输出完全相同的无聊答案,实际上是在说:“我不在乎,所有东西都一样。”这被称为崩溃(collapse),也是该领域最大的失败模式。你即将阅读的这篇论文深入探讨了为什么会发生这些失败,并提出了一个新的由三部分组成的规则手册来阻止它们。
打造智能机器人的三味药方
本文的作者 Nikos、Paschalis 和 Tania 认为,要教机器人无需标签即可观察,不能仅仅依赖一两个技巧。你需要三种截然不同的成分协同工作。如果你漏掉其中任何一个,机器人的大脑要么会崩溃,要么会变得过于简单,或者失去空间感。他们将这三个原则称为观察(Observation)、预测(Prediction)和正则化(Regularization)。
把训练机器人想象成训练一名侦探去解开谜团。
1. 观察: “同物”规则
第一个原则是观察。这是关于教机器人明白两张不同的同类物体照片实际上是同一个东西。如果你在早上拍了一张狗的照片,在下午又拍了一张,机器人需要意识到:“嘿,那是同一只狗!”
用论文中的术语来说,这是关于语义不变性(semantic invariance)。想象你正透过万花筒看一位朋友。颜色在变化,形状在扭曲,但你仍然知道那是你的朋友。机器人需要一个“投影器”(它大脑中的一个工具)来剥离这些令人困惑的扭曲,并专注于核心身份。如果你只有这条规则,机器人会擅长识别事物“是什么”,但它会忘记事物“在哪里”。这就像是知道一只狗是狗,但完全不知道这只狗是坐在房间左边还是右边。
2. 预测: “缺失碎片”游戏
第二个原则是预测。这是关于空间结构。想象你用一个黑盒子盖住了照片的一部分。机器人必须根据照片的其余部分来猜黑盒子里是什么。
这是预测原则。它迫使机器人理解事物是如何在空间中组合在一起的。如果你只有这条规则,机器人会成为一个出色的单图拼图高手,但如果给它看从不同角度拍摄的同一个物体,它就会感到困惑。它可能会认为从侧面看到的猫与从正面看到的猫是完全不同的生物。它学会了特定照片的“地图”,但没有学会即使旋转照片,地图依然保持不变。
3. 正则化: “反作弊”规则
第三个原则是正则化。这是防止机器人使用捷径最关键的部分。还记得那个只会输出相同答案而陷入停滞的机器人吗?那就是崩溃。
作者证明,如果没有一个特定的规则来阻止这种情况,机器人一定会找到使用捷径的方法。想象一个学生在考试时意识到,如果他把所有答案都写成“42”,因为老师的评分标准坏了,他就能拿到满分。机器人也是如此:它找到了一个捷径,停止学习并只输出一个常数。
正则化原则就像一名严格的监考老师,检查学生的作业以确保他们不仅仅是在重复同一个答案。它迫使机器人的内部“图书馆”保持充实且多样化。它确保机器人动用所有的脑力,而不是崩溃成一条无聊的平线。论文指出,如果你试图使用“负样本”(展示机器人哪些东西是不匹配的)来阻止这种捷径,这就像是用创可贴去堵漏一样;它有一点作用,但最终机器人总能绕过去。你需要一个强力的、显性的规则(几何约束)来真正阻止崩溃。
重大发现:你需要全部三样
作者并非凭空猜测;他们构建了一个数学框架(一种“能量分解”),将这三个规则整合进一个方程中。随后,他们进行了实验,观察逐一移除其中一个成分时会发生什么。
以下是他们的发现:
- 如果你丢弃“观察”: 机器人会失去识别同一物体在不同光线或角度下看起来不同的能力。它会变成一个空间天才,但在语义上是个白痴。
- 如果你丢弃“预测”: 机器人会失去空间感。它知道事物是什么,但无法告诉你它们在哪里或它们如何相互关联。在测试中,机器人在寻找图像特定区域(如寻找树上的特定叶子)方面的表现大幅下降。
- 如果你丢弃“正则化”: 机器人会崩溃。它会停止学习。作者在数学上证明,如果没有这条规则,机器人可以通过输出一个无聊的常数来获得“完美”分数。这是一个全局性的失败。
他们还研究了一种在许多现代 AI 模型中广泛使用的流行技巧,叫做动量编码器(Momentum Encoder)。这是一种让机器人使用一个“移动缓慢”的自身版本来辅助学习的技术。作者表明,虽然这种技巧能让机器人在开始阶段学得更快,但它并不能从长远来看阻止机器人崩溃。一旦机器人稳定下来,动量编码器只会复制主机器人所做的一切。如果主机器人崩溃了,动量编码器也会随之崩溃。唯一能真正保证机器人保持聪明的,是那条显性的正则化规则。
这为什么重要
这篇论文统一了几乎所有主要的自监督学习方法。无论一种方法被称为“对比式”(如 SimCLR)还是“预测式”(如 JEPA),作者都表明它们都只是混合这三种成分的不同方式。有些方法混合了“观察”和“正则化”,但跳过了“预测”。有些方法混合了“预测”和“正则化”,但跳过了“观察”。
作者在名为 STL-10 的小型数据集上使用 ViT-Tiny 模型进行的实验表明,当你结合所有三者时,你会获得最佳结果。具体而言,拥有全部三个原则的模型实现了 55.0% 的标准测试准确率,而缺少其中一个原则的模型准确率则显著下降(例如,缺少“观察”会导致准确率下降 13.4 个百分点)。
他们还证明了这三个规则并不会互相冲突。“观察”规则向整个图像发送统一信号,而“预测”规则仅向被预测的部分发送特定信号。它们像是一个团队在协作,而不是在进行拉锯战。
总结
核心信息既简单又强大:你不能仅仅依靠一种类型的技巧来构建一个鲁棒、智能的视觉 AI。你需要一个既能观察相同性,又能预测缺失部分,并且受到严格正则化以防止走捷径的系统。
作者建议,未来的 AI 设计者不应再试图发明复杂的、隐藏的技巧来阻止模型崩溃。相反,应该将这三个原则明确地构建到系统中。这就像盖房子:你需要地基(正则化)、墙壁(观察)和屋顶(预测)。如果你没有地基,房子会倒塌;如果你没有屋顶,内部会受潮;如果你没有墙壁,你就根本没有房子。
这篇论文并不声称构建了史上最大或最快的 AI。相反,它提供了一张清晰的数学地图,解释了 AI 运作的原理,并证明了这三个原则不仅是有益的建议,更是机器人学习如何观察世界的必要条件。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。