← 最新论文
💻 computer science

Output Vector Editing for Memorization Mitigation in Large Language Models

本文提出了“输出向量编辑”(output vector editing),这是一种约束优化技术,通过对特定 MLP 神经元的输出向量进行最小化修改,以抑制大型语言模型中记忆的序列,在实现比传统零消融(zero-ablation)方法显著更高的缓解率的同时,识别出注意力机制是针对一类无法触达的情况所必需的补充手段。

原作者: Ahmad Dawar Hakimi, Kaiwei Lei, Isabelle Augenstein, Hinrich Schütze

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmad Dawar Hakimi, Kaiwei Lei, Isabelle Augenstein, Hinrich Schütze

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和创意类比对该论文进行的解释。

问题所在:模型的“坏记忆”

想象一下,大型语言模型(LLM)就像一个读遍了整个互联网的学生。有时,这个学生不仅学习了“概念”,还逐字逐句地背诵了教科书(训练数据)中的特定句子。

这是很危险的。如果你要求这个学生完成一个句子,他们可能会不小心背诵出一段私密邮件、一本受版权保护的书籍,或者一个他们意外“学到”的秘密密码。这被称为记忆(Memorization)

旧的解决方案:“暴力破解”法

以前,研究人员试图通过找到模型中负责这段记忆句子的特定“脑细胞”(神经元),然后直接把它们关掉来修复这个问题。

  • 类比: 想象模型的脑子是一个繁忙的厨房。如果某位特定的厨师(神经元)总是大声喊出一个私人电话号码,旧的方法就是把这位厨师的双手绑在背后,让他们无法进行烹饪。
  • 缺陷: 那位厨师可能也很擅长做其他事情(比如做汤或切菜)。绑住他们的手虽然阻止了电话号码的喊叫,但也毁掉了那锅汤。模型为了阻止一个坏记忆,失去了有用的知识。

新的解决方案:“输出向量编辑”

作者提出了一种更聪明的方法:输出向量编辑(Output Vector Editing)。与其绑住厨师的双手,不如给厨师一张新的食谱卡,改变他们“喊出什么”,而不是停止他们的工作。

  • 它是如何工作的:
    1. 寻找罪魁祸首: 他们定位到即将吐出那段记忆文本的特定神经元。
    2. “干扰项”技巧: 他们不是让神经元沉默,而是微调神经元的“输出向量”(即在模型大脑中指向的具体方向)。他们轻轻推动它,使其不再指向那个记忆中的词,而是指向一个干扰项(Distractor)
    3. 结果: 神经元仍然在放电(仍然处于活跃状态),但它现在建议的是另一个无害的词。记忆中的句子被打破了,但神经元仍然可以自由地去做它的其他工作(比如做汤)。

四种“编辑模式”

研究人员测试了四种选择“干扰项”单词的不同方式,创造了一个从温和到激进的光谱:

  1. 遮蔽(Redact,即“审查者”): 神经元被推动输出一串星号(****)。这就像是在敏感文本上涂了一层黑条。这种方式对模型的通用智能非常安全,但只能阻止约 32% 的记忆句子。
  2. 次优选择(Next-Best,即“智能替换”): 神经元被推动去说那个比记忆中的词更可能的“第二个词”。这感觉自然且流畅。它能阻止约 81.5% 的记忆句子,且很少破坏模型回答其他问题的能力。
  3. 终止符(EOS,即“停止标志”): 神经元被推动立即停止句子(序列结束)。这是最激进的方式,能阻止 87.9% 的记忆句子,但偶尔会导致模型在其他任务上变得异常(就像汽车刹车过猛导致打滑)。
  4. 抑制(Suppress,即“静音”): 神经元被推动主动降低坏词出现的概率,而不建议具体的替代词。

核心发现

  • 关键在于“方向”,而非“音量”: 论文证明了问题不在于神经元是否“声音太大”(激活强度),而在于它们指向了“错误的方向”(输出向量)。改变方向比降低音量效果要好得多。
  • “甜点区”: “次优选择(Next-Best)”模式是赢家。它阻止了大部分坏记忆(81.5%),同时又不会导致“灾难性失败”(即模型完全丧失说英语的能力)。
  • 规模很重要: 更大的模型(如 70 亿参数的模型)比小模型更容易修复。模型越大,它吸收这些微小编辑而不崩溃的“空间”就越多。
  • 局限性: 大约 14% 的记忆序列对于这种方法来说过于复杂。它们依赖于大脑的不同部分(“注意力机制”),而不是作者所编辑的神经元。对于这些情况,作者建议可能需要一种混合方法。

总结

这篇论文介绍了一种手术刀式的工具,它编辑的是模型的“记忆内容”,而不是删除承载记忆的“硬件”。它让我们能够在不误伤 AI 通用智能的前提下,清除模型中的私密或受版权保护的文本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →