← 最新论文
💬 NLP

Failure by Interference: Language Models Make Balanced Parentheses Errors When Faulty Mechanisms Overshadow Sound Ones

本文揭示了语言模型在括号平衡任务上的失败是由于错误的机制掩盖了可靠的机制所致,并引入了 RASteer,这是一种通过放大可靠组件且不损害通用编程能力的转向方法,将准确率提升至接近 100%。

原作者: Daking Rai, Samuel Miller, Kevin Moran, Ziyu Yao

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Daking Rai, Samuel Miller, Kevin Moran, Ziyu Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一支由 100 位专家组成的团队,正齐心协力解决一个谜题。这个谜题很简单:确保一行代码中的所有括号都是平衡的。 例如,如果你打开了一个括号 (,你必须用 ) 来闭合它。

你会认为一个超级聪明的 AI(大语言模型)应该对此驾轻就熟。但令人惊讶的是,即使是最高级的 AI 也经常失败,尤其是当括号像 ((())) 这样堆叠起来的时候。

这篇名为**《因干扰而失败》(Failure by Interference)**的论文,研究了为什么会发生这种情况,以及如何在不重新训练 AI 的情况下修复它。

问题所在:一个嘈杂的专家室

研究人员发现,AI 做决策时并不只依赖于一个“大脑”,而是使用成千上千个微小的内部组件(称为注意力头神经元),它们同时发出自己的建议。

把这想象成一个拥挤的房间,每个人都在为下一个词进行投票:

  • 声音机制: 房间里的少数专家其实非常擅长计算括号。他们准确地知道何时该闭合括号。
  • 有缺陷的机制: 房间里的其余部分则是嘈杂的。有些专家很困惑,有些在瞎猜,还有一些人在大声喊出错误的答案。

失败的原因: AI 的失败并不是因为它缺乏聪明的专家,而是因为那些嘈杂、困惑的专家喊得比聪明的专家更响亮。聪明的建议被噪音淹没了。论文将此称为“因干扰而失败”。

发现:寻找“超级专家”

研究人员观察了七种不同的 AI 模型(从小型到大型),并发现了一些有趣的现象:

  1. 大多数部分是专才: 许多内部组件只能很好地处理简单任务(如一对括号),但当任务变得更难时(如四对括号)就会失效。
  2. 某些部分是通才: 极少数的部分极其可靠。无论有多少个括号,它们都能完美运行。
    • 例子: 在一个模型(CodeLlama-7b)中,一个微小的部分(一个注意力头)实际上比整个模型本身还要擅长解决这个谜题!

解决方案:RASTEER(音量旋钮)

既然聪明的部件已经存在,只是被忽视了,研究人员发明了一种名为 RASTEER 的方法。

想象 AI 的内部组件是音响系统中的扬声器。

  • 之前: “困惑型”扬声器的音量调到了 10,而“聪明型”扬声器的音量只有 1。结果就是一片混乱的噪音。
  • RASTEER: 这种方法就像是一个音量旋钮。它识别出那些聪明、可靠的扬声器,并稍微调高它们的音量。它并不禁言其他声音,只是确保聪明的声音足够大,能够盖过噪音。

实验结果:

  • 奇迹般的修复: 对于一些正确率仅为 0% 的模型,通过调高前 10 个聪明部件的音量,它们的准确率提升到了接近 100%
  • 没有副作用: 至关重要的是,这并没有破坏 AI 编写其他代码的能力。事实上,对于某些模型,它们的通用编程技能甚至略有提升。
  • 同样有效: 他们在数学问题(算术推理)上也进行了测试,并看到了类似的改进(提升高达 20%)。

他们没做的事情(以及应当避免的)

  • 他们没有重新训练 AI: 他们没有喂给 AI 新的数据,也没有改变其大脑结构。他们只是在思考的瞬间调整了 AI 如何使用其现有的部件。
  • 他们没有寻找“电路”: 先前的研究试图绘制出精确的逻辑路径(类似于电路图)来修复错误。研究人员发现这太复杂了,且对较小的模型效果不佳。他们的“音量旋钮”方法更简单且更有效。
  • 他们并未声称这能修复所有 AI 错误: 这专门针对简单的语法任务(如括号和数学),在这些任务中,AI 拥有相关知识,但会被内部噪音搞混。

核心启示

论文的结论是,AI 模型通常是资历过剩但利用不足的。它们拥有解决简单问题的正确工具,但这些工具被埋没在了一座名为“内部噪音”的大山之下。通过简单地“调高音量”来使用那些可靠的工具,我们可以在不需要从头构建模型的情况下,显著提高 AI 在特定任务上的智能水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →