← 最新论文
💬 NLP

Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions

本文通过对隐藏表示进行几何分析,并引入一种轻量级的推理时干预方法 KAPPA,旨在识别并解决大型语言模型在多项选择题中内部知识与输出行为之间的不一致问题,该方法通过对齐知识与预测子空间来提高准确率。

原作者: Yoonah Park, Haesung Pyun, Yohan Jo

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Yoonah Park, Haesung Pyun, Yohan Jo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文《弥合大语言模型在多选题上的知识-预测差距》(Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions)的解释,采用了通俗易懂的语言和富有创意的类比。

核心问题:那个“胸有成竹”却“语塞”的学霸

想象一下,你有一位非常聪明的学生,他读遍了图书馆里的每一本书。如果你在闲聊时问他一个问题,他能完美地解释出答案。但如果让他参加一场多选题考试,尽管他知道正确答案,却突然开始胡乱猜测。

这正是大语言模型(LLMs)所面临的情况。论文称之为**“知识-预测差距”(Knowledge-Prediction Gap)**。

  • 知识(The Knowledge): 在模型的“大脑”(其隐藏层)内部,正确的答案清晰可见。这就像学生把答案写在了兜里的纸条上。
  • 预测(The Prediction): 当模型真正开口说话(生成文本)时,它却忽略了那张答案纸条,反而选了一个错误的选项。

研究人员发现,模型并不是因为缺乏知识而产生“幻觉”;它失败的原因在于无法将它所知道的内容转化为它所表达的内容。


调查过程:探究内部机制

为了弄清楚为什么会发生这种情况,研究人员并没有仅仅观察最终答案,而是观察了模型在回答问题时内部的“思维过程”(称为残差流/residual stream)。

他们使用了一种叫做**“探针”(Probe)**的工具(可以把它想象成一个翻译官或翻译官的耳朵)来倾听模型的内部信号。他们构建了两个不同的翻译官:

  1. 知识翻译官(The Knowledge Translator): 它倾听模型的内部信号并询问:“这里的实际正确答案是什么?”
  2. 预测翻译官(The Prediction Translator): 它倾听同样的信号并询问:“模型即将说出哪个答案?”

发现:
在许多情况下,知识翻译官说:“答案绝对是‘夏天’!”而预测翻译官却说:“模型即将说出‘冬天’!”

研究人员意识到,模型的脑中拥有两个不同的“房间”或子空间(subspaces)

  • 知识室(The Knowledge Room): 真理居住的地方。
  • 预测室(The Prediction Room): 做出最终决策的地方。

问题在于,这两个房间是错位的(misaligned)。这就像是一个房间里有一张地图,另一个房间里有一个指南针,但指南针指向的方向与地图完全不同。模型拥有地图(知识),但指南针(预测)却在疯狂乱转,从而误导了它。


解决方案:KAPPA(对齐工具)

为了解决这个问题,作者创建了一种名为 KAPPA 的方法。

想象你在开车。你清楚地知道要去哪里(知识),但你的方向盘稍微有点偏,导致你不断向错误的车道漂移(预测)。

KAPPA 就像是一个智能的自动转向修正系统。

  • 它不会重写地图,也不会强迫车子倒着开。
  • 相反,就在模型即将做出选择的那一瞬间,KKAPPA 会轻轻地拨动一下方向盘。
  • 它将“预测室”与“知识室”进行对齐。

这个过程是在模型思考的过程中(即“推理时”)瞬间完成的。它不需要重新训练模型,也不需要教它新知识,它只是修正了模型使用已有事实时的几何结构。

尝试效果如何?

研究人员在多种不同类型的问题上测试了它,包括:

  • 推理谜题(如数学题)。
  • 真实性测试(询问一个陈述是谎言还是事实)。
  • 偏见测试(检查是否存在刻板印象)。

结果:

  • 使用 KAPPA 之前: 模型内部往往知道正确答案,但输出的却是错误的选项。
  • 使用 KAPPA 之后: 模型开始更频繁地选择正确选项。

在某些情况下,模型的表现大幅提升,甚至达到了与“知识翻译官”一致的准确度。这证明了模型并不“笨”;它只是需要重新校准它的内部指南针。

核心要点

  1. 模型知道的比它说的更多: 即使 LLMs 输出错误的答案,它们的内部“大脑”往往也持有正确的答案。
  2. 这是一个几何问题: 问题不在于缺乏数据,而在于知识存在的“空间”与预测发生的“空间”之间存在错位。
  3. 简单的修复方案行之有效: 通过在模型回答前的瞬间对其内部状态施加一个微小的、基于数学的“推动”(KAPPA),我们可以弥合差距,在无需重新训练的情况下提高模型的可靠性。

简而言之,这篇论文表明,帮助 AI 模型变得更诚实、更准确,并不在于教它们新知识,而在于帮助它们更好地利用已有的知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →