← 最新论文
🤖 machine learning

Improving Relative Representations with Learned Anchors and Whitened Inner Products

本文提出了一种用于跨模型通信的鲁棒框架,该框架通过学习语义锚点原型并采用几何感知相似度度量,改进了传统的相对表示方法,从而实现了异构神经架构之间稳定且近乎无损的信息传输。

原作者: Oscar Thorsted Svendsen, Nikolaj Holst Jakobsen, Fabian Mager, Hiba Nassar

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Oscar Thorsted Svendsen, Nikolaj Holst Jakobsen, Fabian Mager, Hiba Nassar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有两位使用完全不同的词典和句子结构的翻译员,尽管他们说同一种语言。翻译员 A 将“国王”描述为一个高大的金色身影;而翻译员 B 则将“国王”描述为一个矮小的蓝色身影。如果你试图把一份由 A 编写的笔记交给 B,B 将无法理解,因为坐标并不匹配。

这就是相对表示(Relative Representations)试图解决的问题。与其强迫 A 和 B 在“国王”的精确坐标上达成一致,不如让他们就一组地标(landmarks/anchors)达成共识。他们会说:“好吧,无论你们如何绘制地图,‘国王’距离‘女王’和‘城堡’有多远?”如果两个模型在这些地标的距离上达成一致,即使它们的内部地图看起来完全不同,它们也能进行交流。

然而,旧的方法有两个重大缺陷,这篇论文通过一个名为 PARAMWIP 的新系统解决了这些问题。

旧方法的缺陷

  1. 随机地标: 旧方法通过向地图投掷飞镖来选择地标。有时你会选到一堆落在同一个位置的飞镖(冗余),或者完全遗漏了地图的巨大区域。这意味着“翻译”经常是模糊的,或者丢失了重要的细节。
  2. 错误的尺子: 旧方法使用的尺子只能测量角度(方向),却忽略了距离(模长)。想象一下你在测量一个房间,而地板被不均匀地拉伸了。如果你只看角落的角度,你可能会认为一个小而拉伸的房间与一个大而正常的房间是一样的。当模型之间差异很大时(例如一个小语言模型在与一个巨型模型对话时),这种方法会导致“翻译”失效。

新方案:PARAM 与 WIP

1. PARAM:学习最佳地标

与其随机投掷飞镖,作者教计算机去学习完美的地标

  • 类比: 想象你正在向朋友描述一座城市。与其随机挑选街角,不如询问这座城市本身:“哪些是最重要、最稳定的枢纽,能够代表整个区域?”
  • 工作原理: 该系统通过对数据点进行分组平均来创建地标。这平滑了噪声(就像将几张摇晃的照片平均化以获得一张清晰的照片)。这些新的地标是“鲁棒的语义原型(robust semantic prototypes)”——它们是稳定的,能均匀覆盖整个地图,并且不会被特定模型的特性所迷惑。

2. WIP:智能尺子

作者用 白化内积(Whitened Inner Product, WIP) 取代了旧的“仅限角度”的尺子。

  • 类比: 想象旧的尺子像一根橡皮筋,会根据握住它的人而拉伸或收缩。如果模型 A 拉伸了空间,而模型 B 挤压了空间,橡皮筋就会给出错误的答案。
  • 工作原理: 新的 WIP 尺子是经过“白化”处理的。在测量之前,它会在数学上把橡皮筋压平。它修正了拉伸、挤压和偏移。至关重要的是,它还关注信号的强度(模长),而不只是指向哪个方向。这使得模型能够保留旧方法丢弃的重要细节(例如“置信度”)。

结果:“无损”翻译

作者通过尝试连接不同类型的 AI 模型来测试了这一点:

  • 视觉: 他们连接了一个 CNN(一种图像模型)和一个 Transformer(另一种更现代的图像模型)。
  • 语言: 他们连接了不同的语言模型(如 BERT 变体),这些模型说着不同的语言(英语、德语、法语等)。
  • 大小对比: 他们甚至将微型语言模型与大型语言模型连接起来。

结果:
过去,试图将这些模型缝合在一起会导致灾难(新模型会进行随机猜测)。有了 PARAM 和 WIP,模型几乎可以完美地通信。

  • 他们实现了零样本缝合(zero-shot stitching):你可以在模型 A 的数据上训练一个工具,然后立即将其用于模型 B 的数据,无需任何重新训练。
  • 性能与直接使用原始模型几乎完全相同。仿佛这种“翻译”是无损的——在过程中没有丢失任何信息。

总结

这篇论文介绍了一种让不同 AI 模型进行对话的新方法。

  1. 停止猜测地标: 学习最稳定、最好的参考点(PARAM)。
  2. 使用更好的尺子: 使用一个能够考虑到数据中拉伸和挤压现象的测量工具(WIP)。

结果是一个通用的“即插即用”系统:你可以更换 AI 的“大脑”(编码器),而系统的其余部分仍能完美运行,且无需重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →