← 最新论文
🤖 machine learning

An Empirical Study into Clustering of Unseen Datasets with Self-Supervised Encoders

本文通过实证研究表明,尽管自监督编码器在未见数据集上的泛化能力优于监督编码器,但在其上进行 ImageNet-1k 微调会反转这一优势,并进一步证实了 UMAP 空间中的轮廓系数可以作为评估无标签数据聚类性能的可靠代理指标。

原作者: Scott C. Lowe, Joakim Bruslund Haurum, Sageev Oore, Thomas B. Moeslund, Graham W. Taylor

发布于 2026-09-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Scott C. Lowe, Joakim Bruslund Haurum, Sageev Oore, Thomas B. Moeslund, Graham W. Taylor

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的广阔版图中,一个强大的理念已经扎根:机器可以通过仅仅观察数百万张图像来学习如何观察世界,而不仅仅是通过被告知每样东西是什么。这种被称为自监督学习的方法,让计算机能够构建出一张视觉模式的精神地图——识别形状、纹理和结构——而无需人类为每一张图片标注名称。一旦计算机建立了这张地图,它就可以被用来解决新的问题,例如识别特定种类的鸟类或对医学扫描图像进行分类。然而,一个关键的问题一直萦绕不去:如果我们拿出一个从海量通用照片库中学习过的计算机,并交给它一组它从未见过的全新图像集,它是否仍然能够理解它们?它能否仅仅通过观察之前学到的模式,将这些未知的图片归为一类,使其在逻辑上具有意义,而无需进一步的训练?

一个研究小组致力于回答这个问题,他们将计算机内部的“地图”视为一种发现工具。他们采用了几种不同类型的预训练计算机视觉模型——有些是通过被告知正确答案来学习的,而另一些则是通过在数据中寻找模式来自主学习的——并要求它们对各种未见的图像集合进行分类。这些集合涵盖了从熟悉的物体(如汽车和花朵)到更抽象的类别(如纹理、手写数字,甚至显微镜下的肿瘤组织视图)。研究人员并没有教模型任何新知识;他们只是让模型观察图像,将图像转换为代表其特征的一组数字列表,然后使用标准的排序算法将相似的数字组合在一起。目标是观察计算机形成的组别是否符合我们所熟知的现实世界类别(如“狗”或“汽车”),还是基于其他完全不同的因素(如背景颜色或图像风格)进行分组。

结果揭示了这些不同类型的模型在思考方式上的有趣分歧。当图像与模型在初始训练期间所见过的图像相似时,那些被明确教授了物体正确名称的模型表现得最好。它们能高精度地对这些熟悉的物品进行分类。然而,当研究人员转向与训练数据差异极大的图像时——例如素描、绘画或显微切片——那些自主学习的模型开始超越那些被教导过的模型。这些自学模型更擅长在完全陌生的视觉世界中发现潜在的结构。似乎那些由人类训练以识别特定物体的模型过于关注特定物体的细节,而自学模型则发展出了一种更灵活的视觉模式理解能力,这种能力即使在语境完全改变时依然有效。

这项研究还发现了一个令人惊讶的弱点:当自学模型随后被迫学习特定的名称时,它们会表现出局限性。当研究人员将自学模型交给它们进行关于物体命名的速成课程时,它们在处理熟悉项目时的表现变得非常出色,但处理那些奇怪、陌生的图像的能力实际上却变差了。它们变得不再那么灵活,失去了最初使它们能够应对未知事物的特质。这表明存在一种权衡:教导一个模型成为特定任务的专家,可能会降低它作为通才的能力。此外,研究人员发现,自学模型更容易被图像的背景所迷惑;如果图像的背景发生变化,自学模型就会难以识别物体,而接受过人类标签训练的模型则能更好地忽略背景并专注于主体。这表明自学模型将整个图像视为一个单一且不可分割的整体,而受监督的模型则学会了将主要对象与其周围环境区分开来。

这项工作中最具实践意义的发现之一是,一种无需正确答案即可判断模型表现优劣的新方法。通常,要了解计算机是否正确分类了一堆照片,你需要知道每张照片的正确答案。研究人员发现,他们只需通过观察各组之间聚集的紧密程度,就能预测分类的效果如何。如果相似图像组成的组别彼此非常接近且远离其他组别,那么分类很可能是正确的。这种“紧密度”评分在将图像首先简化为低维空间(一个剥离了不必要噪声的过程)时效果尤为显著。这一发现意义重大,因为它意味着科学家现在可以测试模型对新数据集的理解程度,即使在没有任何标签的情况下,只需检查数据如何自然地聚类即可。

研究人员还测试了这些模型处理需要极细微区别的图像的能力,例如区分不同种类的鸟类或花卉品种。他们发现,模型在处理这些高度具体的任务时普遍表现挣扎,而在处理更宽泛的类别(如“鸟类”对比“花卉”)时表现要好得多。这符合这样一个观点:虽然这些模型擅长把握大局,但它们在自然状态下尚不适合处理区分某一特定事物之细微特征的任务。研究结论指出,对于对新的、未知的数据进行分类,最好的方法通常是使用一个尚未被强迫学习特定名称的自学模型,并在处理前先对数据进行简化以使模式更加清晰。这为如何利用人工智能来组织和理解存在于我们用于训练的数据集之外的、庞大且未标记的视觉世界,提供了一条清晰的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →