← 最新论文
📊 statistics

Similarity search generalisation in contrastive learning with InfoNCE loss

本文阐明了具有 kk 个负样本的 InfoNCE 损失近似于量化相似性搜索偏差的期望交叉熵,并通过引入一种基于 Gâteaux 微分的创新连续性界限,证明了增加负样本数量能够使 Lipschitz 嵌入函数的泛化误差趋于稳定。

原作者: Nick Whiteley

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Nick Whiteley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人理解什么是“相似”。你给它看一张猫的照片(锚点/anchor),然后是同一只猫的一张略有不同的照片(正样本/positive)。接着,你给它看一堆狗、汽车和香蕉的照片(负样本/negatives)。机器人的任务是学习一种特殊的“嵌入”(一种数学映射),将这两张猫的照片拉近,同时将狗的照片推远。

机器人用来学习这个过程的工具叫做 InfoNCE。这就像一场游戏,机器人会根据它将猫与噪声分离得有多好来获得分数。但这里有一个大问题:如果机器人在你展示给它的这些照片上完美地学会了这场游戏,它在面对从未见过的真实世界(未见数据)中的相似事物时,真的会表现得很好吗?

这篇由 Nick Whiteley 撰写的论文深入探讨了这个问题。它不仅仅是说“它有效”,而是试图解释“为什么”有效,以及“噪声”图片的数量如何改变了这场游戏。

“噪声”人群的魔力

在 InfoNCE 游戏中,你通常会给机器人一些负样本(比如 10 个或 100 个)。但在现实世界中,可能性是无限的。如果给机器人一个规模巨大的负样本群体,会发生什么?

论文证明了一个非常具体的结论:随着负样本数量(kk)的增加,机器人的表现会越来越接近于一种完美的“理想搜索”。

可以这样理解:

  • 理想搜索: 想象一位神奇的图书管理员,他完全了解宇宙是如何生成“正样本对”(比如那只猫及其孪生兄弟)的。这位管理员可以瞬间告诉你任何两个事物之间的完美相似度。
  • 机器人的搜索: 机器人使用它学到的映射来猜测相似度。
  • 两者的联系: 论文表明,随着你增加负样本的数量,机器人的猜测与那位神奇图书管理员的完美答案之间的差距会迅速缩小。具体来说,误差以 O(1/k)O(1/k) 的速率下降。

这意味着,如果你将负样本的数量增加一倍,误差就会减半。如果你有 1,000 个负样本,误差就会变得微乎其微。这是论文中一个经过证实的数学事实,而不是一个猜测。它纠正了一个旧观点,即认为误差下降的速度可能较慢(例如 1/k1/\sqrt{k})。作者证明了,通过正确的数学方法,实际下降速度要快得多:1/k1/k

温度旋钮

故事中还有另一个角色:温度参数 (τ\tau)。想象这是机器人大脑中的一个“聚焦旋钮”。

  • 如果温度,机器人会变得非常挑剔。它只关心那些相似的事物,而忽略其余的。
  • 如果温度,机器人会变得更放松,并考虑更广泛的相似性范围。

论文证明了这个旋钮起到了**正则化器(regularizer)**的作用。如果你把温度调高(使其变大),机器人的映射会被迫保持在所有数据的平均分布附近,从而防止它变得过于古怪或对异常值产生过拟合。论文明确指出,温度越高,机器人的搜索行为就越受到约束,使其靠近通用的数据分布,无论机器人的配置如何。

“平均化”超能力

最令人兴奋的发现之一是关于泛化(generalization)——即机器人在处理新的、未见过的数据时的表现。

之前的理论认为,增加负样本可能会让数学变得混乱且难以控制。但本文提出了相反的观点。它引入了一种新的数学工具(使用一种称为 Gâteaux 微分 的工具)来表明,损失函数中负样本的“平均化”效应实际上稳定了机器人的表现。

这就像是在进行民意调查。如果你只问一个人,他的意见可能会很极端;如果你问 10 个人,情况会好一些;如果你问 1,000 个人,平均意见就会变得非常稳定可靠。论文证明,InfoNCE 损失函数的工作原理完全就像这种民意调查。随着 kk 的增长,单个糟糕样本带来的“噪声”被平均掉了,机器人对新数据的泛化能力也随之趋于稳定

本文排除了哪些可能性

需要注意的是,这篇论文并没有给出以下问题的答案:

  • 它反对认为当 kk 很大时,误差率下降缓慢(如 1/k1/\sqrt{k})的观点。论文证明了它下降得更快(1/k1/k)。
  • 并不依赖于“正样本”和“负样本”来自完全相同的对称分布的假设。论文明确拒绝了我们需要假设正样本只是从负样本所在的同一个池子中随机抽取的想法。在现实世界中,正样本对是通过特定的变换(如裁剪照片)创建的,论文处理了这种“黑箱”现实,而没有强行将其纳入完美的对称性中。
  • 并不要求机器人必须是特定类型的神经网络(如深层 CNN)。只要嵌入函数是“Lipschitz 连续的”(意味着它不会变化得过于剧烈),这些结果都成立,这涵盖了许多类型的网络,但其证明具有通用性。

我们有多确定?

作者对核心机制非常确定。他们通过严密的数学证明(使用严格的微积分和概率论)得出:

  1. 机器人的搜索与理想搜索之间的误差是 O(1/k)O(1/k)
  2. 随着 kk 的增长,由于平均化效应,泛化误差会趋于稳定。
  3. 温度参数 τ\tau 起到了约束搜索的特定且可预测的作用。

他们并非依靠模拟或实验来做出这些主张;这些结论是从基本原理中推导出来的。然而,他们也指出,对于极其复杂的深度神经网络,除非网络非常大或数据量非常大,否则这些界限可能会变得“空洞”(即过于宽松而失去实用价值)。他们建议未来的工作可以将他们的新数学方法与其他技术结合,以更好地处理这些庞大的网络。

大局观

简单来说,这篇论文告诉我们,InfoNCE 损失函数是一个非常鲁棒的工具。它不仅仅是一个在实践中“效果很好”的启发式方法,它有着深厚的理论基础:

  • 它学习去逼近一种理想的相似性搜索。
  • 你投喂的负样本越多,它向理想状态收敛的速度就越快。
  • 这些样本的平均化过程自然地保护了模型免于过拟合,使其在处理未见数据时更加可靠。

所以,下次当你看到一个系统使用对比学习来寻找相似的图像或文本时,请记住,它本质上是在进行一场大规模的、经过数学证明的“相似性民意调查”,而且你询问的人(负样本)越多,得到的答案就越准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →