← 最新论文
💬 NLP

Anisotropy Decides Cosine vs. Rank Metrics for Text Embeddings

本文证明了用于比较文本嵌入的最优度量取决于嵌入空间的几何各向异性,表明虽然余弦相似度对于各向同性编码器更为优越,但基于秩和 L1 型的度量在各向异性模型中表现出显著的超越,这种关系可以通过单一的方差主导度量进行预测,并通过投影掉主导方向得到因果确认。

原作者: V. S. Raghu Parupudi

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: V. S. Raghu Parupudi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇使用简单语言和日常类比对论文进行的解释。

核心问题:我们如何衡量“相似度”?

想象你有一个巨大的句子图书馆。为了寻找相似的句子,计算机将它们转化为数字列表(向量)。为了判断两个句子是否相似,计算机需要一把尺子来测量这些列表之间的距离。

长期以来,大家一直都在使用同一把尺子:余弦相似度 (Cosine Similarity)。它就像是在检查两支箭是否指向同一个方向,而忽略了箭有多长。

但一些研究人员曾私下议论:“嘿,也许这把尺子并不适用于所有情况。”他们尝试了不同的尺子(比如测量点之间的实际距离,或者计算有多少个数字相匹配),有时这些新尺子确实效果更好。但没有人能解释清楚为什么,或者何时该更换尺子。

这篇论文就是最终解开这个谜团的侦探工作。

发现:关键在于“房间的形状”

作者测试了 19 种不同的“句子编码器”(将文本转化为数字的机器)和 19 种不同的“尺子”(度量标准),并涵盖了许多任务。他们发现了一个清晰的分野:

  1. “宽敞”的房间: 在某些编码器上,数据点均匀地散布在空间中,就像一群人在一片开阔的田野里站立。

    • 结果: 标准尺子(余弦)在这里表现完美。尝试更换其他尺子几乎没有任何收益。
    • 启示: 如果房间是开阔的,坚持使用标准尺子即可。
  2. “拥挤”的房间: 在另一些编码器上,数据点被挤压在一个狭窄的角落或一条线上,就像一群人全都挤在一个小小的门口。

    • 结果: 标准尺子(余弦)在这里表现糟糕。它认为所有东西都很相似,因为每个人都指向同一个方向。
    • 解决方法: 更换一种不同的尺子(特别是基于秩 (Rank-based)L1 型的度量标准)会带来巨大的变化。它能将准确率平均提高约 20%。

“为什么”:流氓维度 (The Rogue Dimension)

为什么“拥挤”的房间会让标准尺子失效?

想象一个房间,90% 的重量都压在其中一面墙上。如果你试图测量这个房间里两个人的距离,测量结果会被他们离那面重墙有多近所主导,而不是他们在彼此之间相对的位置。

在论文的术语中,这被称为各向异性 (Anisotropy) 或拥有一个**“流氓维度”**。

  • 在“拥挤”的编码器中,数字列表中的某一个数字特别巨大,以至于淹没了所有其他信息。
  • 余弦相似度就像一个放大镜,它完全聚焦于那个巨大的数字。它会被这个数字蒙蔽双眼。
  • 新尺子(基于秩或 L1)则像是观察数字的顺序或它们之间的差异。它们忽略了某个数字是否巨大,转而关注数据的实际模式。

“顿悟时刻”:是几何结构,而非训练方式

你可能会想:“噢,所以如果一个模型是用特定的方法训练的,它就会使用新尺子。”
不对。 论文证明了事实并非如此。

  • 案例 A: 一个专门为了“擅长余弦相似度”而训练的模型(E5-Mistral)最终也呈现出了“拥挤”的房间。新尺子对它依然有效。
  • 案例 B: 一个普通的、未经训练的语言模型(Multilingual BERT)最终呈现出了“宽敞”的房间。标准尺子运行良好。

教训: 这与模型的构建或训练方式无关。它只取决于构建完成后的数据形状是什么样的。如果数据是被挤压的,你就需要一把新尺子。如果数据是展开的,旧尺子就没问题。

他们是如何证明的:“手术”实验

为了 100% 确定“拥挤”的方向就是罪魁祸首,作者进行了一场小小的“手术”。

  1. 他们提取了那些“拥挤”的编码器。
  2. 他们在数学上“切除”了导致问题的那个主导方向(那面重墙)。
  3. 结果: 突然间,标准尺子(余弦)又开始表现得非常出色!新尺子的优势消失了。

这证明了“拥挤”的方向是问题的原因,而不仅仅是一个副作用。

实际应用建议

  • 对于大多数人: 如果你正在使用标准的、经过微调的工具来进行搜索或相似度计算(例如公司通常部署的工具),你的数据很可能是“宽敞”的。请继续使用余弦相似度。 它是最合适的工具。
  • 对于极端情况: 如果你正在使用原始的、未经训练的语言模型(例如直接使用大型 AI 的原始输出而不进行微调),你的数据可能是“拥挤”的。
    • 解决方法: 在开始之前,检查一个简单的数值(“流氓维度主导程度”)。
    • 如果该数值很高,请切换到基于秩或 L1 的度量标准,或者移除那个主导方向,这样你的结果会显著提升。

简而言之: 最好的尺子取决于房间的形状,而不是建筑师的名字。如果房间很拥挤,请更换你的尺子。如果房间很开阔,请坚持使用经典款。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →