CoRect: Context-Aware Logit Contrast for Hidden State Rectification to Resolve Knowledge Conflicts
本文提出了一种名为 CoRect 的方法,通过对比上下文相关与非上下文相关的 Logit 来识别并纠正深层网络中因参数记忆导致的知识冲突,从而在无需标准答案的情况下提升检索增强生成(RAG)的忠实度并减少幻觉。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇文章介绍了一种名为 CoRect 的新技术,专门用来解决大语言模型(如 ChatGPT)在面对“新知识”和“旧记忆”打架时,容易“固执己见”的问题。
为了让你听懂,我们把大语言模型想象成一个**“博学但有点固执的老教授”**。
1. 问题的核心:老教授的“偏见” (Knowledge Conflict)
想象一下,你正在考一个历史教授。
- 教授的旧记忆(参数知识): 他脑子里记着“1979年,某项政策开始了”。
- 你给他的参考资料(检索到的证据/RAG): 你递给他一张最新的报纸,上面写着“该政策其实是在1980年开始的”。
这时候,冲突发生了。由于这个教授脑子里的记忆太深了,即使你把报纸拍在他面前,他可能还是会脱口而出:“是1979年!”
这就是论文里说的**“知识冲突”。模型并不是没看到新证据,而是它大脑深处的“旧记忆”太强大,把新证据给“压制”**(Parametric Suppression)住了。
2. 论文的发现:大脑里的“干扰信号”
研究人员通过一种类似“脑电图”的技术(Logit Lens),观察了教授思考的过程。他们发现了一个有趣的现象:
教授在思考的初期,其实已经捕捉到了报纸上的“1980”这个信息;但当思考进入到大脑深层(深层神经网络)时,那些负责存储旧记忆的细胞(FFN层)突然发出了强烈的信号,把“1980”给盖过去了,最后输出的结果又变回了“1979”。
简单来说:新知识在传递过程中,被大脑深处的“老顽固”给拦截并抹杀了。
3. CoRect 的解决方案:精准的“心理疏导”
以前的方法(比如 CAD 或 AdaCAD)就像是在教授说话的那一刻,强行把他说错的话改过来。这有点像“捂住他的嘴,强迫他说对词”,虽然能改对,但说话会变得很生硬、不自然,甚至语无伦次。
CoRect 的做法更高级,它是在教授“思考的过程中”进行干预。
它的工作分为两步:
第一步:找准“重点词” (Trustworthy Token Selection)
在教授开口前,先通过对比“有参考资料”和“没参考资料”两种状态下的思维波动,精准地锁定那个最可能正确的词(比如“1980”)。这就像是先在教授耳边轻声提醒:“嘿,重点看报纸上的那个年份!”
第二步:精准“消除干扰” (Hidden State Rectification)
这是最天才的地方。研究人员不再是强行灌输新知识,而是**“消除干扰”。
他们通过定位,找到大脑里那些正在疯狂输出“旧记忆”的特定区域,然后给这些区域施加一个“反向抵消信号”**。
打个比方:
这就像是在嘈杂的派对上,老教授听到了干扰他的噪音。CoRect 不是大声对着他喊“听报纸的!”,而是像一个降噪耳机,精准地抵消掉那些“旧记忆”的噪音。
这样一来,教授原本就捕捉到的新知识(1980)就能顺畅地流向嘴巴,自然而然地表达出来。
4. 总结:CoRect 的厉害之处
- 不强扭瓜,自然顺: 它不强迫模型背诵新答案,而是通过“降噪”让模型恢复原本的逻辑,所以说话依然很流畅,不会像机器人一样生硬。
- 不需要“标准答案”: 很多修改模型的方法需要提前知道正确答案才能训练,但 CoRect 在推理时就能自己发现冲突并解决,非常灵活。
- 效果拔群: 在各种问答和总结任务中,它都能显著减少模型的“一本正经胡说八道”(幻觉),让模型变得既博学又听劝。
一句话总结:CoRect 不再是强行纠正模型的“嘴”,而是通过精准降噪,帮模型清理了大脑里的“思维噪音”,让它能听得进新知识,说得出真话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。