← 最新论文
💬 NLP

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

本文通过使用一种自修复干预手段,揭示了失配的内部知识电路如何阻碍有效推理,进而研究了微调大语言模型中存在的“知行差距”(即记忆的知识无法泛化)问题,并提出了一种能够恢复 58%–75% 潜在泛化性能的启发式策略。

原作者: Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人图书管理员,它刚刚学到了一个全新的知识:“悉尼在澳大利亚。”当你问它:“悉尼在哪里?”它能完美地回答。但随后你问它:“悉尼所在的国家的首都是哪里?”机器人却愣住了,表现得好像完全不知道你在说什么一样。

这正是香港科技大学(广州)及香港科技大学的研究人员试图解决的谜题。他们称之为**“知用差距”(Knowing–Using Gap)**。这是一个令人沮丧的时刻:大型语言模型(LLM)显然已经记住了一条新信息,却无法将其用于解决稍微复杂一点的谜题。

谜团:为什么机器人会卡住

研究人员发现,这并不是因为机器人“忘记了”,也不是因为它太笨而无法理解逻辑。事实上,机器人知道答案;它只是把答案藏在了错误的房间里。

要理解这一点,可以将机器人的大脑想象成一座巨大的、多层的办公大楼:

  • 底层(第1–10层): 这就像是门厅和收发室。它们非常擅长存储传入的包裹(记忆事实)。
  • 中层(第10–20层): 这是“思考”部门,复杂的推理在这里发生。
  • 顶层(第20–30层): 这是撰写并发送最终报告的地方。

当机器人学习一个新事实时,它会迅速将信息存入门厅顶层。那里很安全!但处于中间的“思考部门”却从未收到通知。因此,当机器人试图解决一个多步骤的谜题(比如将悉尼与澳大利亚联系起来,再将澳大利亚与其首都联系起来)时,信息就卡在了错误的地方。这就像是你兜里揣着一张图书馆卡,却试图在超市收银台使用它一样。

侦探工作:“自我修补”(Self-Patching)

他们是如何证明信息确实存在、只是放错了位置的呢?他们发明了一个巧妙的技巧,叫做**“自我修补”**。

想象一下,有两个版本的机器人并排运行:

  1. 机器人 A 正试图回答那个难题,但失败了。
  2. 机器人 B 的“门厅”里存储着答案。

研究人员伸手进入机器人 B,抓取了关于“悉尼在澳大利亚”的特定记忆,并物理性地将其移动到了机器人 A 的“思考部门”。

结果如何? 机器人 A 瞬间解决了问题!

这个实验表明,知识从未丢失;它只是错位了。机器人拥有这些数据,但没有将其路由到大脑中可以进行数学运算的正确部分。研究人员将此称为**“知识–电路错位假设”(Knowledge–Circuit Misalignment Hypothesis)**。

这并不是……

研究人员非常谨慎地排除了其他观点:

  • 不是缺乏脑力: 他们测试了更大、更聪明的模型,问题依然存在。
  • 不是“提示词”问题: 他们尝试给机器人提示(例如要求它“一步步思考”),但这只起到了微小的作用。真正的修复方法是移动记忆,而不仅仅是提出更好的问题。
  • 不是机器人正在学习新逻辑: 机器人不需要学习如何进行推理;它只需要访问它已经知道的事实即可。

好消息:一个简单的修复方法

最棒的部分是,研究人员发现了一种无需知道具体哪个记忆属于哪个事实的修复方法。

他们注意到,“思考部门”(中间层)是关键。他们创建了一个简单的规则:“如果你在门厅或顶层存储了一个事实,请将其移动到中层。”

他们在不同的机器人模型和不同类型的知识(从生物学到学术论文)上测试了这个简单的规则。

  • 在没有修复的情况下,机器人在处理推理问题时的正确率仅为 7% 到 18%
  • 使用这个简单的“移动记忆”规则后,它们的正确率达到了 35% 到 45%

这个简单的技巧找回了机器人本可以实现的潜在成功率中的 58% 到 75%。它虽然不是能解决一切问题的魔杖,但它证明了这个问题是可解的。

核心启示

这篇论文表明,当 AI 模型无法使用它们所学到的知识时,这通常是一个路由问题,而不是学习问题。事实就在那里,只是被安全地存储在脑部的错误角落。通过简单地将这些事实移动到“思考层”,我们可以帮助机器人将点与点连接起来,从而解开谜题。

研究人员现在建议,未来的训练不应只关注如何让模型更快地记忆事实,而应致力于教它们如何将这些事实路由到正确的地方进行推理。这是一种从“教更多”到“组织更好”的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →