✨ 要点🔬 技术摘要
想象一下,你有两位使用完全不同的词典和句子结构的翻译员,尽管他们说同一种语言。翻译员 A 将“国王”描述为一个高大的金色身影;而翻译员 B 则将“国王”描述为一个矮小的蓝色身影。如果你试图把一份由 A 编写的笔记交给 B,B 将无法理解,因为坐标并不匹配。
这就是相对表示(Relative Representations)试图解决的问题。与其强迫 A 和 B 在“国王”的精确坐标上达成一致,不如让他们就一组 地标(landmarks/anchors)达成共识。他们会说:“好吧,无论你们如何绘制地图,‘国王’距离‘女王’和‘城堡’有多远?”如果两个模型在这些地标的 距离 上达成一致,即使它们的内部地图看起来完全不同,它们也能进行交流。
然而,旧的方法有两个重大缺陷,这篇论文通过一个名为 PARAM 和 WIP 的新系统解决了这些问题。
旧方法的缺陷
随机地标: 旧方法通过向地图投掷飞镖来选择地标。有时你会选到一堆落在同一个位置的飞镖(冗余),或者完全遗漏了地图的巨大区域。这意味着“翻译”经常是模糊的,或者丢失了重要的细节。
错误的尺子: 旧方法使用的尺子只能测量角度 (方向),却忽略了距离 (模长)。想象一下你在测量一个房间,而地板被不均匀地拉伸了。如果你只看角落的角度,你可能会认为一个小而拉伸的房间与一个大而正常的房间是一样的。当模型之间差异很大时(例如一个小语言模型在与一个巨型模型对话时),这种方法会导致“翻译”失效。
新方案:PARAM 与 WIP
1. PARAM:学习最佳地标
与其随机投掷飞镖,作者教计算机去学习完美的地标 。
类比: 想象你正在向朋友描述一座城市。与其随机挑选街角,不如询问这座城市本身:“哪些是最重要、最稳定的枢纽,能够代表整个区域?”
工作原理: 该系统通过对数据点进行分组平均来创建地标。这平滑了噪声(就像将几张摇晃的照片平均化以获得一张清晰的照片)。这些新的地标是“鲁棒的语义原型(robust semantic prototypes)”——它们是稳定的,能均匀覆盖整个地图,并且不会被特定模型的特性所迷惑。
2. WIP:智能尺子
作者用 白化内积(Whitened Inner Product, WIP) 取代了旧的“仅限角度”的尺子。
类比: 想象旧的尺子像一根橡皮筋,会根据握住它的人而拉伸或收缩。如果模型 A 拉伸了空间,而模型 B 挤压了空间,橡皮筋就会给出错误的答案。
工作原理: 新的 WIP 尺子是经过“白化”处理的。在测量之前,它会在数学上把橡皮筋压平。它修正了拉伸、挤压和偏移。至关重要的是,它还关注信号的强度 (模长),而不只是指向哪个方向。这使得模型能够保留旧方法丢弃的重要细节(例如“置信度”)。
结果:“无损”翻译
作者通过尝试连接不同类型的 AI 模型来测试了这一点:
视觉: 他们连接了一个 CNN(一种图像模型)和一个 Transformer(另一种更现代的图像模型)。
语言: 他们连接了不同的语言模型(如 BERT 变体),这些模型说着不同的语言(英语、德语、法语等)。
大小对比: 他们甚至将微型语言模型与大型语言模型连接起来。
结果: 过去,试图将这些模型缝合在一起会导致灾难(新模型会进行随机猜测)。有了 PARAM 和 WIP,模型几乎可以完美地通信。
他们实现了零样本缝合(zero-shot stitching) :你可以在模型 A 的数据上训练一个工具,然后立即将其用于模型 B 的数据,无需任何重新训练。
性能与直接使用原始模型几乎完全相同。仿佛这种“翻译”是无损的 ——在过程中没有丢失任何信息。
总结
这篇论文介绍了一种让不同 AI 模型进行对话的新方法。
停止猜测地标: 学习最稳定、最好的参考点(PARAM)。
使用更好的尺子: 使用一个能够考虑到数据中拉伸和挤压现象的测量工具(WIP)。
结果是一个通用的“即插即用”系统:你可以更换 AI 的“大脑”(编码器),而系统的其余部分仍能完美运行,且无需重新训练。
技术摘要:通过学习型锚点与白化内积改进相对表示
1. 问题陈述
独立训练的神经模型往往会收敛到由于旋转、各向异性缩放和平移差异而导致不兼容的潜在表示。这为构建高度模块化的 AI 系统(即编码器和解码器可以互换而无需重新训练)制造了根本性的障碍。
相对表示 (Relative Representations, RR) 通过将绝对嵌入映射到由一组共同锚点定义的相似度共享空间中来解决这一问题,而非依赖于绝对坐标。然而,标准的 RR 实现存在两个主要局限性:
随机锚点采样: 传统的实现方法使用随机采样的样本点作为锚点。这通常会导致数据流形覆盖率差、冗余以及相对特征的低秩性,从而导致任务相关信息的丢失。
余弦相似度: 标准的相似度度量仅依赖于角度关系,丢弃了模长信息(模长可以编码特征置信度),并且无法处理现代架构(如 Transformer)中常见的各向异性几何结构。此外,它在仿射偏移和原点附近表现不稳定。
这些局限性导致了跨空间对齐和信息保留效果不佳,阻碍了异构模型之间的零样本缝合(zero-shot stitching)。
2. 方法论
作者提出了一个由两个核心组件组成的鲁棒框架:PARAM (通过自适应矩阵实现的参数化锚点表示)和 WIP (白化内积)。
2.1 PARAM:将锚点学习为凸混合
不同于将锚点视为固定且随机采样的样本子集,PARAM 将锚点学习为一组平行数据点的凸混合 。
机制: 一个共享的混合矩阵 P P P 被优化以生成每个编码器空间 i i i 的锚点 A i A_i A i ,公式为 A i = P X s u b i A_i = P X_{sub}^i A i = P X s u b i ,其中 X s u b i X_{sub}^i X s u b i 是嵌入的一个子集。
约束: P P P 被约束为行随机矩阵,确保锚点保持在数据的凸包之内。
优势: 这种方法通过平均化产生去噪效果,从而创建稳定的语义原型。它允许在潜在空间内进行连续的锚点放置,避免了离散样本选择的局限性。
训练目标: 矩阵 P P P 通过损失函数的加权和进行优化:
单空间目标: 覆盖度(L c o v L_{cov} L co v ,软 k-means)、正交性(L o r t h L_{orth} L or t h ,惩罚相关联的锚点)以及长度控制(L l e n L_{len} L l e n ,约束范数)。
多空间目标: 对称式 InfoNCE(L s y m N C E L_{symNCE} L sy m N C E ),用于利用配对样本在不同编码器之间对齐相对坐标。
2.2 WIP:白化内积
为了解决独立训练的空间之间的几何畸变(均值偏移和各向异性缩放),作者使用白化内积 取代了余弦相似度。
机制: 对于每个嵌入空间,首先移除经验均值 μ i \mu_i μ i ,然后基于协方差矩阵 Σ i \Sigma_i Σ i 应用对称白化变换 L i = ( Σ i ) − 1 / 2 L_i = (\Sigma_i)^{-1/2} L i = ( Σ i ) − 1/2 。
公式: 相似度定义为 s W I P ( x , a r i ) = ⟨ L i ( x − μ i ) , L i ( a r i − μ i ) ⟩ s_{WIP}(x, a_r^i) = \langle L_i(x - \mu_i), L_i(a_r^i - \mu_i) \rangle s W I P ( x , a r i ) = ⟨ L i ( x − μ i ) , L i ( a r i − μ i )⟩ 。
优势: 该度量对仿射畸变具有鲁棒性(满足跨空间对齐),同时保留了角度和模长信息(满足信息保留),这对于判别性信号至关重要。
3. 核心贡献
学习型锚点 (PARAM): 一种将锚点学习为数据凸混合的方法,确保了鲁棒的语义覆盖和跨嵌入空间的稳定性,取代了随机采样。
几何感知相似度 (WIP): 一种协方差感知的相似度度量,对仿射偏移具有不变性并保留了模长信息,解决了现代架构的各向异性问题。
统一框架: 一种联合方法,显著提升了在高度异构架构(例如 CNN 与 Transformer,以及不同规模的语言模型)之间的零样本缝合性能。
4. 实验结果
该框架在视觉和语言模态的零样本缝合任务上进行了评估,并与使用余弦相似度的随机锚点基准进行了对比。
图像分类 (CIFAR-100): 在缝合基于 CNN(RexNet)和基于 Transformer(ViT)的编码器时,所提出的 PARAM-WIP 方法实现了近乎无损的迁移。例如,在 ViT 特征上训练分类器并在 RexNet 特征上测试,其 F1 分数达到 80.94% (PARAM Multi),而随机-余弦基准仅为 56.67% 。在许多情况下,零样本性能达到了原始潜在空间的绝对性能水平。
文本分类 (MARC): 在跨语言情感分析(如英语、德语、法语、西班牙语、中文)中,该框架始终优于基准。例如,将法语缝合到英语编码器时,结果为 93.75% F1(PARAM Multi),而随机-余弦为 92.06% 。
小语言模型 (SLMs): 在不同规模模型(GPT-2, TinyLlama, Gemma)之间的零样本检索任务中,基准表现出极大的不稳定性(R@1 ≈ \approx ≈ 0.5% - 10%)。相比之下,PARAM-WIP 实现了 87% 至 95% 之间的 R@1 分数 ,以及 接近 100% 的 R@5 分数 ,证明了即使在隐藏层维度差异巨大的模型之间,也能实现稳定的几何对齐。
消融实验: 结果证实这两个组件都是必要的。虽然 WIP 提高了检索质量,但当与学习型锚点结合时,其准确度增益达到最大。相反,使用随机锚点配合 WIP 的表现往往不如随机锚点配合余弦相似度,这是由于其对原点附近的噪声敏感。
5. 重要性与主张
论文指出,依赖随机采样和角度投影(余弦相似度)是当前相对表示研究中的一个基本局限,特别是在处理异构模型族时。
鲁棒性: 所提出的框架实现了近乎无损的信息传输 以及在先前互不兼容的编码器之间实现稳定的零样本通信 。
模块化: 通过形式化潜在几何与相对坐标系之间的关系,这项工作为实现模块化 AI 架构提供了一条切实可行的路径,使得编码器和解码器可以互换而无需昂贵的重新训练。
几何理解: 结果表明,保留模长信息并考虑仿射畸变对于对齐现代各向异性嵌入空间至关重要,而标准余弦相似度无法满足这一要求。
作者也指出了局限性,包括表示能力对支持子集大小的依赖,以及对稳定协方差估计的需求。他们建议未来的工作可以探索自适应子集选择、结构化稀疏以及非线性相似度函数。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。