← 最新论文
💬 NLP

From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks

该论文通过字符计数任务揭示,大型语言模型在符号推理上的失败并非源于缺乏表征或规模不足,而是由于模型内部存在特定的“负向电路”(主要位于最后几层),它们在计算过程中抑制了已正确编码的信息,导致模型虽能内部推导出正确答案却无法在输出层表达。

原作者: Ayan Datta, Mounika Marreddy, Alexander Mehler, Zhixue Zhao, Radhika Mamidi

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Ayan Datta, Mounika Marreddy, Alexander Mehler, Zhixue Zhao, Radhika Mamidi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一次对大型语言模型(LLM)的“内部体检”,专门检查它们为什么会在一些看似极其简单的问题上犯傻。

想象一下,你让一个拥有百科全书般知识的超级天才(比如现在的 LLM),问你一个小学生都能回答的问题:“单词 'strawberry'(草莓)里有几个字母 'r'?”

你会惊讶地发现,这个天才经常答错。它可能说 1 个,也可能说 2 个,甚至完全瞎猜。这篇论文就是去探究:为什么这个天才“心里知道答案,嘴上却说不出来”?

以下是用通俗语言和比喻对论文核心发现的解读:

1. 核心发现:心里有数,嘴上没谱

研究人员发现,这些大模型其实完全有能力数清楚字母。

  • 比喻:这就好比一个厨师,他在切菜的时候,脑子里非常清楚手里有 3 根胡萝卜(模型在早期层已经编码了正确的信息)。但是,当他要把菜端给客人(输出最终答案)时,他却突然说:“哎呀,我觉得是 1 根吧。”
  • 结论:问题不在于模型“学不会”或“记不住”,而在于它在最后一步主动放弃了正确答案。

2. 内部运作:一场“自我内耗”的战争

研究人员像侦探一样,一层层地检查模型的“大脑”(神经网络),发现了两个关键阶段:

  • 早期阶段(编码期):信息很清晰
    在模型处理单词的前几层,关于“有几个 r"的信息非常清晰、准确。就像厨师刚把菜切好,放在案板上,数量一目了然。

    • 比喻:模型的前半部分是个诚实的会计,账记得清清楚楚。
  • 晚期阶段(抑制期):信息被“按”下去了
    当信息传递到模型的最后几层(特别是倒数第二层和最后一层)时,发生了一件奇怪的事。模型里的一些特定组件(主要是MLP 层,可以理解为“决策部门”)开始主动压制那个正确的答案。

    • 比喻:这就好比厨师的“决策部门”突然说:“别管案板上的 3 根胡萝卜了,根据经验,客人通常喜欢听'1',或者随便猜一个吧。”于是,正确的信息被强行按了下去,错误的、概率更高的答案被推到了前面。
    • 研究人员把这些捣乱的组件称为**“负面电路” (Negative Circuits)**。它们就像是一个个“捣蛋鬼”,专门负责把正确的信号抹杀。

3. 为什么越大的模型越没用?

通常我们认为,模型越大(参数量越多),越聪明。但这篇论文发现,把模型从 20 亿参数扩大到 90 亿参数,甚至进行“指令微调”(教它怎么聊天),这个问题依然存在,甚至更顽固。

  • 比喻:这就像给一个总是算错数的小学生换了一间更大的教室,或者让他读了更多的书(指令微调),但他最后交卷时,依然习惯性地写错答案。因为他的“坏习惯”(负面电路)已经根深蒂固,并没有因为“变高”或“变聪明”而消失。

4. 没有专门的“计数员”

研究人员还试图在模型里找有没有专门负责“数数”的神经元或注意力头(Attention Heads)。

  • 发现:没有!模型里并没有一个专门的“数数专员”。
  • 比喻:这就像是在一个巨大的交响乐团里找专门负责“数拍子”的人,结果发现根本没人专门干这个。数数的信息是散落在各个乐器(神经元)里的,而且最后被指挥(输出层)给带偏了。

5. 这意味着什么?(给普通人的启示)

这篇论文告诉我们一个令人深思的事实:

  • 现在的 AI 并不是真的在“思考”:它们在处理像“数字母”这种需要精确逻辑的任务时,并不是在一步步推理,而是在玩“概率游戏”。它们倾向于输出那些在训练数据中出现频率最高的“安全答案”(比如看到字母就猜 1 个),而不是去真正计算。
  • 未来的方向:如果我们想让 AI 更可靠,不能只靠“堆参数”(把模型做得更大)。我们需要重新设计模型,确保那些正确的信息不仅能被记住,还能被信任并顺利传递到嘴边,而不是在最后关头被“自我怀疑”给压死。

总结

这就好比一个**“懂事的捣蛋鬼”**:
它其实什么都懂(早期层编码正确),但它有个坏毛病(晚期层的负面电路),总喜欢在最后关头把正确答案藏起来,换成一个它觉得“更顺口”但其实是错的回答。

这篇论文就是揭开了这个“坏毛病”的盖子,告诉我们:AI 的弱点不在于不够聪明,而在于它的“自我审查”机制太容易把真相给压没了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →