← 最新论文
🤖 machine learning

HoReN: Normalized Hopfield Retrieval for Large-Scale Sequential Model Editing

本文提出了 HoReN,这是一个可扩展且保持参数不变的模型编辑框架,它利用具有角度相似性和阻尼 Hopfield 吸引子动力学的离散键值码本,在不对原始模型造成损害的情况下实现稳定且高性能的序列知识更新。

原作者: Yuan Fang, Yi Xie, Xuming Ran

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuan Fang, Yi Xie, Xuming Ran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)比作一位读过世间几乎一切书籍的、庞大且极其聪明的图书管理员。这位管理员非常擅长回答问题,但有时他们会引用过时的信息(例如认为某部电影仍在上映,而实际上早已下映),或者编造事实。

通常,若要修正一个错误,你必须从头开始重新训练整个管理员。这就像让图书馆停业一年,重新教导管理员一切。这不仅成本高昂且风险巨大,因为你可能会让他们忘记原本擅长的其他事情。

问题所在:“修补”困境
科学家们曾尝试两种主要方法来修正这些错误,而无需重新训练整个管理员:

  1. “手术”方法:你试图通过“手术”改变管理员的大脑(即模型的权重),以修正某一个特定事实。
    • 弊端:如果你这样做太多次,就会开始切断错误的线路。管理员会变得困惑,忘记旧事实,或者开始产生新的幻觉。这就像试图通过一次更换一个齿轮来修理手表;最终,整个机械结构会卡死。
  2. “笔记本”方法:你保持管理员的大脑原封不动,并给他们一本笔记本(外部记忆),你在上面写下修正内容。当被问及问题时,管理员会先查阅笔记本。
    • 弊端:笔记本会变得杂乱无章。如果你写下“法国的首都是巴黎”,后来有人问“法国的首都是哪里?”,但换了一种说法(“埃菲尔铁塔住在哪里?”),管理员可能意识不到这是同一个问题。他们可能会在笔记本中搜索确切的短语“法国的首都”,错过新的措辞,从而找不到答案。这被称为路由失败

解决方案:HoReN
这篇论文介绍了HoReN(归一化霍普菲尔德检索),这是一种管理该“笔记本”的新方法,即使经过 50,000 次编辑也能完美运作。

以下是 HoReN 的工作原理,使用简单的类比:

1. “方向”指南针(归一化)

想象管理员的大脑使用一种由“向量”(箭头)构成的语言。

  • 旧方法:笔记本同时查看箭头指向的方向和箭头的长度。如果你用略微不同的语气或长度提问,箭头方向可能相同但长度不同,管理员就会认为这是一个完全不同的问题。
  • HoReN 的方法:HoReN 忽略箭头的长度,只关注方向。它将所有内容归一化为相同的大小。
    • 类比:这就像指南针。无论你将指南针拿在胸前还是拿在远处,指针仍然指向北方。HoReN 确保“法国的首都是哪里”和“埃菲尔铁塔在哪里”在指南针上都指向完全相同的方向,因此管理员知道它们是同一个问题。

2. “磁铁”效应(霍普菲尔德动力学)

即使有了指南针,仍存在微小差距。如果你用非常不同的方式提问,箭头可能指向“几乎”北方,但并非完全准确。标准的笔记本会说:“那不是北方,我没有答案。”

HoReN 添加了一个磁铁

  • 机制:在管理员查阅笔记本之前,HoReN 会给问题一个微小的“磁力”,将其拉向笔记本中的正确答案。
  • 类比:想象笔记本中的正确答案就像景观中的深谷(势阱)。如果你将一个球(你的问题)扔在谷附近,它会自然地滚入谷底。
    • 如果问题是已知事实的改写版本,磁铁会轻轻将其拉入正确的山谷。
    • 如果问题完全无关(例如询问天气),磁铁不会将其拉向任何地方;它会停留在原地。
  • 神奇之处:HoReN 仅执行一次这种“拉动”。如果拉动太多次,磁铁会变得如此强大,以至于每一个问题,甚至是不相关的问题,都会被吸进错误的山谷,导致混乱。一次温和的拉动是完美的平衡。

3. 结果:永不遗忘的图书馆

这篇论文在“压力测试”中测试了该方法,强制管理员连续学习50,000个新事实。

  • 其他方法:大多数方法在 10,000 次编辑后就崩溃了。管理员要么忘记了旧事实(灾难性遗忘),要么无法识别改写后的问题(泛化失败)。
  • HoReN:它一直稳定到 50,000 次编辑。它能够正确回答新事实,即使问题被改写也能识别,并且仍然记得之前知道的所有其他内容。

总结
HoReN 就像给管理员一本超级智能的磁性笔记本。它忽略问题的“音量”,专注于“含义”(方向)。它利用温和的磁力拉动,帮助改写后的问题找到正确答案,但在不相关的问题被混淆之前停止拉动。这使得模型能够无限学习而不会崩溃或遗忘。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →