← 最新论文
🤖 AI

Revisiting Ripple Effects in Knowledge Editing through Pressure-Aware Joint Neighborhood Optimization

本文介绍了联合邻域优化(Joint Neighborhood Optimization, JNO),这是一个通过联合优化邻域目标表示并采用语义预执行门控,从而在显著提高传播与保持指标的同时维持跨骨干稳定性,旨在解决知识编辑中可编辑侧协调与被保护侧泄漏这一耦合设计压力的创新框架。

原作者: Haoben Huang, Shuxin Liu, Ou Wu, Di Gao

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoben Huang, Shuxin Liu, Ou Wu, Di Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)视为一座宏大而复杂的图书馆,其中的每一本书都代表着一段知识。当你想要更新一个事实时——比如,将“凯文·杜兰特效力于菲尼克斯太阳队”改为“凯文·杜兰特效力于休斯顿火箭队”——你不仅仅是在更换一页纸。你正在触动一个脆弱的连接网络。

如果你改变了这个事实,其他事实也可能自然地需要随之改变(例如他的球队城市或所属分区)。这些是良性涟漪(good ripples)。但你可能会意外地撞倒那些本不该移动的书籍,比如他的国籍或身高。这些是恶性涟漪(bad ripples)

目前,大多数方法都在试图分别解决这两个问题:一组团队试图推动良性涟漪,而另一组团队则试图阻止恶性涟漪。本文作者认为,这种分离本身就是问题所在。你无法在不考虑这些改变可能会意外破坏你想保留的事物的前提下,去规划那些良性的改变。

以下是他们提出的新解决方案——**JNO(联合邻域优化,Joint Neighborhood Optimization)**是如何工作的,我们使用简单的类比来解释:

1. 问题所在:“多米诺效应” vs. “泼洒的油漆”

将模型的知识想象成一组多米诺骨牌。

  • 良性涟漪: 当你推倒“凯文·杜兰特”这块多米诺骨牌时,你希望“菲尼克斯太阳队”这块骨牌也跟着倒下,并被“休斯顿火箭队”所取代。
  • 恶性涟漪: 但如果你推得太用力或方向不对,你可能会撞倒“美国”这块骨牌(他的国籍)或“前锋”这块骨牌(他的位置),而你原本希望它们保持直立。

现有的方法试图在推动多米诺骨牌的同时又去阻止油漆泼洒,但它们将这两者视为两个独立的任务。论文指出,这两股力量实际上是**耦合(coupled)**在一起的。如果你为了获得良性涟漪而推得太用力,你不可避免地会泼洒更多的油漆。

2. 解决方案:“压力感知型”建筑师

作者提出了一种在实际触碰模型记忆之前先规划更新方案的方法。他们称之为联合邻域优化(JNO)

想象你是一位正在装修房间的建筑师。你不是直接敲下一枚钉子,而是先创建一个考虑到整个房间结构的蓝图。JNO 主要做了两件事:

A. “走钢丝”(压力感知协调)

系统会观察房间内的“压力”。

  • 可编辑侧协调(Editable-side Coordination): 如果两个事实紧密相连(如球员与其球队),系统会确保它们像手牵手的舞者一样平稳地共同移动。它能防止它们因拉扯而导致逻辑崩溃。
  • 保护侧泄漏(Preserved-side Leakage): 如果某个事实离你正在修改的事实非常近(比如紧挨着你要重写的那本书),系统会在其周围设置一个“安全缓冲带”。它会限制该事实能使用的力量,以免意外触动邻居。

系统同时平衡这两股压力。它会询问:“我能否在不把‘禁止触碰’的事实挤离原位的前提下,将目标事实移动到新位置?”

B. “安全门”(语义预执行门控)

在装修真正开始之前(在更新模型权重之前),系统会进行一次模拟。

  • 它会检查蓝图:“如果我们进行这些更改,模型是否还能保持逻辑通顺?”
  • 如果模拟显示这些更改风险过高,或者会导致模型产生幻觉或胡言乱语,系统就会停止。它拒绝进行此次更新。
  • 这就像是一个安全检查员说:“这个计划看起来很危险,我们还是别建了,”而不是先建好再去祈祷一切顺利。

3. 结果:更好的装修效果

作者在多个大型语言模型(如 Qwen、GPT-J 和 LLaMA)上测试了 JNO。他们发现:

  • 传播性更好: 它成功更新相关事实(如球队城市)的频率比以往方法高出约 7%。
  • 保护性更好: 它能显著更好地阻止对无关事实(如国籍)的意外更改。
  • 稳定性更高: 它不会破坏模型回答一般问题的能力。

总结

简而言之,本文认为你不能仅仅通过修补漏洞来修复船上的漏水问题;你必须理解水压是如何影响整个船体的。JNO 是一种通过同时观察整个事实“邻域”来进行知识更新规划的方法,它平衡了移动某些事物的需求与保持其他事物静止的需求,并且如果看起来会使船沉没,它会拒绝行动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →