When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models
本文揭示了大语言模型间分词器移植中存在的一种结构性“非对称可实现性”漏洞,其中特定的系数向量可被设计为“破坏性分词”,在源模型中保持惰性,却在基础模型中触发高显著性重构,从而规避标准的权重合并检查与基于 LoRA 的缓解措施。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和创意类比对该论文的解读。
宏观图景:“通用翻译器”的故障
想象你有两种不同的语言:捐赠者(源模型)和基座(目标模型)。有时,开发者希望将它们结合起来。他们会选取一个仅存在于捐赠者词典中的词,并试图将其“移植”到基座的词典中,以便基座能够理解它。
为此,他们使用一种翻译器(如 mergekit 这样的工具)。翻译器查看捐赠者的这个词,并说:“好的,这个词由 10% 的 A 词、5% 的 B 词和 2% 的 C 词组成。”然后,它将这些确切的百分比(即系数)应用到基座的词典上,从而生成一个新词。
论文的发现:研究人员发现了这种翻译过程中隐藏的一个缺陷。由于两个词典(捐赠者和基座)的结构不同,同一组百分比可能意味着两种截然不同的含义。
- 在捐赠者的词典中,这些百分比加起来可能是一个枯燥、不可见且无人使用的词。
- 在基座的词典中,这些完全相同的百分比加起来可能变成一个响亮、引人注目的词,模型会热衷于说出这个词。
论文将这种现象称为**“非对称可实现性”**。这就像拥有一个秘密代码,在一个房间里它是无声的,但在另一个房间里它却在尖叫。
攻击手段:“幽灵令牌”
研究人员展示了攻击者如何利用这一点。他们创造了一种所谓的**“破坏令牌”**。
- 设置:攻击者在捐赠者模型的词典中添加一个新的、虚假的词。
- 诡计:他们精心构造这个虚假词的“成分”(即嵌入向量),使得:
- 在捐赠者模型中,这些成分很无聊。模型完全忽略这个词。它就像一个幽灵,穿过捐赠者的脑海而不留任何痕迹。
- 在基座模型中,经过“翻译”后,这些相同的成分突然变成了一个磁石。基座模型开始不停地重复这个虚假的词。
类比:想象你有一个蛋糕食谱(捐赠者)。你在食谱中加入了一撮“隐形灰尘”。
- 当你在厨房 A(捐赠者)烘焙蛋糕时,灰尘毫无作用。蛋糕味道正常。
- 你将食谱发送到厨房 B(基座)。因为厨房 B 使用不同的量杯和烤箱,那同一撮“隐形灰尘”导致蛋糕变成鲜红色,并且每次出炉时都尖叫“你好!”。
攻击者不需要直接黑客入侵基座模型。他们只需要污染捐赠者的食谱,剩下的“翻译”过程就会自动完成。
这个破坏令牌能做什么?
论文展示了这种“幽灵词”造成麻烦的三种方式,具体取决于攻击者如何命名它:
- 服务降级(坏掉的收音机):如果攻击者将令牌命名为某种让模型不断重复的内容,基座模型可能会不停地输出该令牌,拒绝回答任何问题。这就像收音机卡在了单一的静电噪音上。
- 声誉中毒(隐藏的侮辱):攻击者可以让模型在正常、有帮助的回答中说出一些冒犯性的内容(如脏话)。回答的其余部分看起来没问题,但那个“幽灵词”会毁掉使用该模型公司的声誉。
- 对抗性水印(隐形签名):攻击者可以让模型在每个回答末尾附加一个秘密代码(如
[WM-8472])。这让攻击者日后可以证明:“嘿,这个模型正在使用我被盗的词汇”,而没有人注意到代码的存在。
为什么我们不能直接修复它?
研究人员测试了人们在合并 AI 模型后尝试清理模型的常见方法,发现这些方法无法抵御这种特定攻击:
- 微调(教模型新把戏):如果你试图重新训练基座模型以停止说出那个坏词,只有在你针对攻击期间被问到的完全相同类型的问题进行训练时才有效。如果你问它一个略有不同的问题(比如用数学题代替故事),模型就会忘记教训,重新开始说那个坏词。
- 与干净模型合并:如果你将“被污染”的模型与“干净”的模型混合以稀释坏的部分,攻击依然会存活。“幽灵词”在翻译中结构如此紧密,以至于将其与干净权重混合也无法将其洗掉。
- 谱滤波器(金属探测器):人们使用工具扫描模型中看起来像攻击的“奇怪”数字。研究人员发现,他们的“幽灵令牌”对这些扫描器来说看起来完全正常。它们大摇大摆地隐藏着,看起来就像捐赠者词典中的一个普通词。
核心启示
这篇论文揭示了当前我们结合 AI 模型方式中的一种结构性弱点。这不是某个特定模型的漏洞,而是用于结合它们的“翻译”数学中的根本性问题。
警告:如果你正在通过混合和匹配开源模型来构建 AI 产品(这是目前常见的做法),你可能会在不知情的情况下从恶意来源导入“幽灵词”。这些词在源模型中保持沉默,但在你的产品中会爆发行动,而标准的安全检查可能无法检测到它们。
作者建议,我们需要新的方法来在将这些“移植”的词放入我们的系统之前进行检查,因为目前的“混合和匹配”工具过于轻信。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。