Cluster Contrast for Unsupervised Visual Representation Learning
本文介绍了 Cluster Contrast (CueCo),一种新颖的无监督视觉表示学习方法,它通过协同结合对比学习和聚类目标,同时实现分散不相似特征与对齐相似特征,从而在 CIFAR 和 ImageNet 基准测试上达到了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人识别动物,但你面对的是一座照片堆成的山,而且没有任何标签。你不能告诉机器人“这是一只猫”或“这是一只狗”。这就是无监督学习的世界——它是人工智能的一个分支,在这种模式下,计算机尝试在没有老师指点的情况下,自行学习世界的模式。为了实现这一点,研究人员使用了两种主要技巧。第一种是对比学习(contrastive learning),这就像是在教孩子辨别差异:“这张图片不是那张图片。”它迫使计算机在脑海中将不同的事物推开,以免混淆。第二种技巧是聚类(clustering),这就像是在整理一堆乱七八糟的衣物。计算机观察所有的袜子和衬衫,并尝试将相似的物品归为一类,即使它还不知道这些东西叫什么名字。长期以来,这两个技巧一直分别在不同的房间里工作,但科学家们在想:如果我们能让它们在同一个房间里协同工作,从而创造出对图像超智能的理解,会发生什么呢?
**CueCo(聚类对比)**应运而生,这是由伦敦帝国理工学院的研究员 Nikolaos Giakoumoglou 和 Tania Stathaki 提出的一种新方法。把 CueCo 想象成一个拥挤舞池中的高级编舞师。在过去,舞蹈教练(算法)要么告诉所有人尽可能散开(对比学习),要么告诉所有人紧紧聚在一起(聚类)。CueCo 同时完成了这两件事。它使用了一种类似于磁铁的“推拉”动态机制。它将不同类型的舞者(比如猫和狗)推向远方以防碰撞,同时又将相同类型的舞者(所有的猫)拉进一个紧凑、温馨的圆圈。
研究人员构建了一个包含两个神经网络的系统:一个用于学习的“查询(query)”网络,和一个移动缓慢、像影子一样跟随学习者的“键(key)”网络。他们在三个著名的图像数据集上进行了测试:CIFAR-10、CIFAR-100 和 ImageNet-100。结果令人印象深刻。当他们冻结学习过程并仅使用一个简单的分类器来对图像进行分类时,CueCo 在 CIFAR-10 上达到了 91.40% 的准确率,在 CIFAR-100 上达到了 68.56%,在 ImageNet-100 上达到了 78.65%。这些数字使其足以与目前最优秀的方法并驾齐驱,证明了将对比的“推”与聚类的“拉”结合起来,可以创造出一个更加有序且有用的视觉世界地图。
推与拉的魔力
要理解 CueCo 是如何工作的,请想象你正在整理一个巨大的图书馆,所有的书都混杂在一起,而你并不知道它们的书名。你有两个目标:确保没有两本书看起来是一样的,并且确保所有同一本书的副本都整齐地堆叠在一起。
推(对比学习)
首先,CueCo 提取一张图片并创建两个略微不同的版本,比如拍摄一张猫的照片,然后对其进行裁剪并轻微旋转。它告诉计算机:“这两个视角是同一只猫。”但它也会观察狗的照片并说:“这些完全不同。”通过使用一种称为 InfoNCE loss 的数学规则,该系统表现得像一种排斥力。它将“猫”的特征从“狗”的特征中推开,使其在计算机的记忆空间中产生距离。这确保了如果你再次看到一只猫,计算机不会误以为它是狗。它扩展了不同的类别,使它们变得截然不同。
拉(聚类)
但仅仅把事物推开是不够的;你还需要将相似的事物组合在一起。这就是“拉”的作用所在。由于计算机没有真实的标签,它通过寻找模式来猜测哪些图片属于一类。它创建了“簇(clusters)”或组。随后,CueCo 表现得像一种吸引力,将相同类型的图片拉向彼此,形成一个紧密的球体。它使用两个特定的工具来实现这一点:
- 质心对比损失(Centroid Contrastive Loss): 这确保了每张图片都与其所属组的“重心”对齐。这就像是确保每张猫的照片都站在虚构的“猫中心”旁边。
- 方差损失(Variance Loss): 这确保了小组不仅仅是一个松散的云团,而是一个紧凑、致密的球体。它最小化了图片与其组中心之间的距离,确保“猫”们紧紧依偎在一起,而不是散落各处。
舞池动态
研究人员将其可视化为物理学中的力。对比部分是一种排斥力(类似于磁铁的两个北极互相推开),确保不同的类别不会合并。聚类部分是一种吸引力(类似于异极相吸),确保同一类别保持紧凑。目标是达到一种完美的平衡:即“猫”的群体远离“狗”的群体,但每一只猫都与其他每一只猫手牵手。
他们是如何做到的
研究人员并非凭空猜测;他们构建了一个特定的框架。他们使用了 ResNet-18 作为骨干网络,这是一个用于图像识别的标准且可靠的结构。他们将其在三个数据集上进行了训练:
- CIFAR-10: 10 种类型的小型图像。
- CIFAR-100: 100 种类型的小型图像。
- ImageNet-100: 一个更大、更复杂的数据集的 100 个子集。
他们使用了一种被称为**动量编码器(momentum encoder)**的聪明技巧。想象一下,“查询”网络是一个学习飞快的学生,而“键”网络是一个更新缓慢的老师。老师只是学生的一个平滑、缓慢移动的平均值。这可以防止系统因突然的变化而感到困惑,并有助于保持“组(簇)”随时间推移的稳定性。
为了确保这些组不会陷入错误的模式(例如把所有图片都放进一个巨大的堆里),他们使用了一个图像“队列”来计算各组的中心。他们还每 1,000 步重置一次这些组,以保持新鲜感和平衡。
结果:它有效吗?
团队通过测试计算机在没有任何帮助的情况下对图像进行分类的能力来验证其方法。他们将 CueCo 与其他顶尖方法进行了对比,如 MoCo-v2、SimCLR 和 BYOL。
- 在 CIFAR-10 上,CueCo 达到了 91.40% 的准确率。这非常接近顶尖的表现,表明它能很好地处理简单任务。
- 在 CIFAR-100 上,它达到了 68.56%。
- 在 ImageNet-100 上,它实现了 78.65%。
但真正的魔力发生在无监督图像分类中。通常,当计算机在没有标签的情况下仅仅进行分组时,表现并不理想。然而,CueCo 展示了它比其他方法能更好地对图像进行分组。在 CIFAR-10 上,它的聚类准确率达到了 75.06%,击败了重新实现的 MoCo-v2 (63.51%) 和 SimCLR (74.50%)。在 CIFAR-100 上,它得分 33.82%,同样超越了竞争对手。
研究人员还进行了“消融实验(ablation study)”,这就像拆解一台机器来观察哪个部件起作用。他们发现:
- 仅使用“推”(对比损失)可以提供一个良好的基准。
- 加入“拉”(质心损失)改善了分组效果。
- 加入“紧凑度”(方差损失)使结果变得更好。
这证明了他们“推拉”系统的三个部分对于获得最佳结果都是必要的。
为什么这很重要
论文指出,通过结合这两种力量,我们可以创建既具有辨识度(易于区分)又具有组织性(易于分组)的视觉表示。这意义重大,因为这意味着我们可能不需要那么多人类标注的样本来教计算机如何看世界。该方法并不声称已经完全解决了 AI 的问题,但它提供了一个充满希望的新方向。它表明,一点点“推”和一点点“拉”可以帮助计算机以一种既广博又细致的方式理解世界,而无需任何人类老师说:“那是只猫。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。