← 最新论文
🤖 machine learning

On the Importance of Embedding Norms in Self-Supervised Learning

本文通过理论与实验分析,证明了尽管余弦相似度广泛流行,但嵌入范数(embedding norms)对于控制收敛速率并编码网络置信度(其中较小的范数表示非预期样本)至关重要,从而解决了关于嵌入范数在自监督学习中所扮演角色的表观矛盾。

原作者: Andrew Draganov, Sharvaree Vadgama, Sebastian Damrich, Jan Niklas Böhm, Lucas Maes, Dmitry Kobak, Erik Bekkers

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrew Draganov, Sharvaree Vadgama, Sebastian Damrich, Jan Niklas Böhm, Lucas Maes, Dmitry Kobak, Erik Bekkers

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《论嵌入范数在自监督学习中的重要性》(On the Importance of Embedding Norms in Self-Supervised Learning)的解释,使用了通俗易懂的语言和日常类比。

大局观:“尖刺球”问题

想象一下,你正在教一台计算机识别图片(比如猫和狗),但没有给它任何标签。这被称为自监督学习(Self-Supervised Learning, SSL)

为了实现这一点,计算机将每张图片转化为巨大多维空间中的一个数学点。为了让数学计算成立,计算机通常会强制让这些点落在完美的、光滑的球体表面(超球体)上。它通过测量两个点之间的相似度来完成这项工作,这种相似度是基于方向(就像检查两个箭头是否指向同一个方向)来衡量的,而忽略了箭头的长度。

论文的发现:
作者发现,尽管计算机理应忽略这些箭头的长度(即“嵌入范数”),但长度实际上非常重要。事实上,训练过程自然地会让常见、易识别图片的箭头变得非常长,而让罕见或令人困惑的图片的箭头保持较短。

这使得计算机的“完美光滑球体”变成了一个**“尖刺球”**。尖刺是代表熟悉数据的长箭头,而平坦区域则是代表不熟悉数据的短箭头。


论文的两个主要规则

论文解释了关于这些“箭头长度”(范数)的两件主要事情:

1. “沉重背包”效应(收敛速度)

类比: 想象你正试图走向一个目的地(学习正确答案)。如果你背着一个沉重的背包(长箭头/范数),你的移动速度会变慢。如果你很轻盈(短箭头),你可以冲刺。

论文的内容:
数学证明,箭头越长,计算机学习的速度就越慢。具体来说,学习速度会随着箭头长度的平方而下降。

  • 悖论(Catch-22): 为了学习,计算机需要将箭头推向彼此。但“推挤”这个动作本身又会让箭头自然增长。
  • 结果: 计算机陷入了一个循环:它试图学习,但学习行为本身却让“背包”变得更重,从而减慢了它的速度。

2. “信心计”(网络置信度)

类比: 把箭头长度想象成一个音量旋钮,控制着信心。

  • 大声(长箭头): 计算机对这张图片非常有把握。它经常看到这种类型的猫,所以它有一个强而长的信号。
  • 安静(短箭头): 计算机不确定。这可能是一只猫的奇怪角度,或者是一张看起来像猫的狗的照片。信号微弱且短小。

论文的内容:
箭头长度自然地编码了模型的置信度。

  • 常见数据: 如果一张图片看起来像训练数据,箭头就会变长(高置信度)。
  • 奇怪的数据: 如果图片完全陌生或很奇怪(分布外数据/Out-of-Distribution),箭头会保持较短(低置信度)。
  • 数据不平衡: 如果计算机看到了 1,000 次“猫”,但只看到了 10 次“狗”,那么“猫”的箭头会变得巨大,而“狗”的箭头会保持极小。这会让计算机产生偏差且不稳定。

解决方案:如何修复“尖刺球”

作者测试了三种方法,旨在阻止箭头不受控制地增长并修复学习速度。

1. 权重衰减(系绳)

  • 它是什么: 一种机器学习中的标准工具,它会轻轻地将权重拉回零附近。
  • 论文的发现: 它有助于防止箭头变得过长,但这是一种缓慢且渐进的修复方式。如果你拉得太用力,计算机就会忘掉所有东西(球体会塌陷);如果你拉得不够,箭头就会过长,导致学习变慢。

2. 切割初始化(Cut-Initialization)(起跑线)

  • 它是什么: 在训练开始之前,作者将所有的内部数值除以一个常数(例如 3 或 9)。
  • 类比: 想象在一场比赛开始前,大家都穿着沉重的靴子。相反,我们让他们赤脚起跑。
  • 论文的发现: 这是一个巨大的胜利。通过从较短的箭头开始,计算机学习得更快。它从第一步起就防止了“沉重背包”问题。这种方法对于不使用“负样本”的模型(如非对比模型 SimSiam)特别有效。

3. GradScale(音量旋钮)

  • 它是什么: 一个特殊的层,它改变了计算机学习的方式。它观察箭头的长度并调整学习步长。
  • 类比: 如果箭头很长(背包很重),计算机就迈出一小步。如果箭头很短,它就迈出一大步。
  • 论文的发现: 它完全抵消了“沉重背包”效应。无论箭头长度如何,它都能使学习速度保持一致。然而,论文指出这可能难以调优,并且如果数据过于混乱,有时会导致计算机感到困惑。

结果总结

  • 问题: 自监督学习(SSL)模型自然地产生了“尖刺状”的表示,其中常见数据具有长箭头,而罕见数据具有短箭头。这减慢了学习速度并产生了偏差。
  • 好消息: 箭头的长度实际上是一个有用的信号!它能告诉你模型的置信度。
  • 解决方法: 你可以通过以下方式修复速度和稳定性问题:
    1. 从较小的数值开始(切割初始化)。
    2. 使用特殊的层根据箭头长度调整学习步长(GradScale)。
    3. 精细调节你拉回权重的力度(权重衰减)。

论文得出结论:我们不应仅仅关注数据的方向;我们也必须管理它们的长度,才能使自监督学习变得更快、更可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →