← 最新论文
💬 NLP

Conflict-Resolving and Sharpness-Aware Minimization for Generalized Knowledge Editing with Multiple Updates

该论文提出了 CoRSA,这是一个参数高效的训练框架,旨在解决知识冲突并最小化损失曲率,从而显著提升大型语言模型在经历多次知识编辑时的泛化能力、稳定性和更新效能。

原作者: Duy Nguyen, Hanqi Xiao, Archiki Prasad, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Duy Nguyen, Hanqi Xiao, Archiki Prasad, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博学多才的图书管理员(即大语言模型),他掌握着大量的知识。但世界有时会发生变化。也许是一家公司的 CEO 换了人,或者是运动队交易了球员。你需要更新这位图书管理员的记忆,但又不能解雇他并重新雇佣一个新的人(因为那样太昂贵且太慢了)。

这篇论文介绍了一种名为 CORSA 的新方法,旨在帮助高效且准确地更新这位图书管理员的记忆。以下是它的工作原理,我们使用简单的类比来解释:

问题所在:“固执”的图书管理员

当你试图教给图书管理员一个新的事实时,现有方法通常会出现三个问题:

  1. “改写”问题(The "Paraphrase" Problem): 如果你告诉管理员:“CEO 是 Andy Jassy”,他们可能只会记住这句完全相同的话。如果你问:“谁在管理亚马逊?”,他们可能仍会回答旧任 CEO 杰夫·贝索斯。他们并没有真正理解这个“概念”,而只是记住了特定的词汇。
  2. “倒退”问题(The "Backslide" Problem): 如果你更新了管理员一次,稍后又进行了另一次更新,第一次的更新可能会被抹除,或者旧的错误信息会再次跳出来。这就像是在白板上用一种不会干的马克笔写字,旧的墨水会渗透出来。
  3. “冲突”问题(The "Conflict" Problem): 管理员对旧事实有着深刻的记忆。当你试图覆盖这些事实时,旧的记忆会产生抵抗,导致混乱或“幻觉”,即管理员给出的答案是新旧信息的混合体。

解决方案:CORSA

作者开发了 CORSA(冲突解决与锐度感知最小化)。你可以把它看作是针对图书管理员的一种特殊训练方案,通过两个主要技巧来解决上述三个问题:

1. “平坦谷底”技巧(锐度感知最小化/Sharpness-Aware Minimization)

想象一下,图书管理员的知识是一个由山丘和山谷组成的景观。

  • 旧方法: 当他们学习一个新事实时,他们可能会陷入地图上的一个微小、尖锐的“突起”。看起来这是一个完美的位置,但只要你稍微推动一下(比如以不同的方式提问),他们就会从突起上掉下来,从而忘掉一切。
  • CORSA 的技巧: CORSA 强迫图书管理员寻找一个宽阔、平坦的谷底,而不是一个尖锐的突起。在平坦的谷底,即使你推动一下(以不同的方式提问),他们仍会保持在原处。这使得新知识变得稳定,并有助于其泛化到不同的提问方式。

2. “对抗幽灵”技巧(冲突解决/Conflict-Resolving)

想象一下,旧的事实就像是一个困扰着图书管理员的幽灵。

  • 旧方法: 标准训练试图教授新事实,但却无意中让幽灵的声音变得更大。管理员学会了新事实,但旧的事实仍在背景中低语。
  • CORSA 的技巧: CORSA 使用了一种双重策略。它在教授新事实的同时,也明确告诉管理员:“忽略那个旧幽灵!”它通过显式地推开旧答案并拉近新答案,在两者之间创造出一个清晰的间隙,确保旧的事实不会在以后偷偷溜回来。

它如何处理多次更新

论文测试了当多次更新图书管理员的记忆时(例如追踪每年都会更换工作的 CEO)会发生什么情况。

  • 其他方法: 它们表现得像一块会被饱和的海绵。经过几次更新后,海绵就无法吸收新水,或者会将旧水挤出来(遗忘)。
  • CORSA: 它表现得像一本模块化的笔记本。因为找到了那些“平坦的谷底”并推开了“幽灵”,它可以不断添加新页面而不会撕掉旧页面。它能记住新的 CEO 而不忘记旧的,而且当 CEO 再次变更时,它也不会感到困惑。

结果

作者在真实世界的事实(如谁是亚马逊的 CEO)甚至在代码(更新计算机程序的工作方式)上进行了测试。

  • 更好的记忆力: 当以不同的方式提问时,CORSA 在记住新事实方面表现得更好(泛化能力)。
  • 更少的遗忘: 当他们持续更新模型时,与其他方法相比,CORSA 遗忘无关信息的程度要少得多。
  • 代码技能: 它甚至能胜任修复代码漏洞的任务,而之前的研究方法在处理此类任务时往往会失败,因为代码对于简单的“事实替换”来说过于复杂。

总结

CORSA 是一种更聪明的更新 AI 大脑的方式。它不是简单地“覆盖”旧数据,而是通过在 AI 的思维中找到一个稳定、平坦的位置来存储新信息,并主动抑制冲突的旧记忆。这使得 AI 更加可靠、不易遗忘,并且能更好地处理随时间推移而来的新信息。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →