Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs
本文表明,大语言模型在计数重复标记时的失败,并非源于其内部无法表示正确的计数,而是源于一种由特定格式触发的多层感知机机制,该机制在输出生成过程中将准确的表示覆盖为固定的错误答案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明、博览群书的图书管理员(即 AI 模型)。你请这位管理员数一数长列表中单词"apple"出现了多少次。你本以为他们会算对,但他们却自信地回答:“有 8 个苹果”,尽管实际上明显有 10 个。
长期以来,人们认为这位管理员只是不擅长计数。他们假设管理员的大脑里没有内置“计数器”,因此无法追踪数字。
这篇论文指出,这种假设是错误的。
以下是研究人员实际发现内容的简明拆解,并辅以一些日常类比:
1. 管理员确实知道答案
研究人员深入观察了管理员的大脑(模型的内部层),在思考过程的每一步都进行了检查。他们发现,正确的数字(10)从一开始到最后一步,都被清晰、完美地记录了下来。
- 类比:想象管理员手里拿着一块白板,正沿着走廊行走。在行走的每一步,白板上都清晰地写着"10"。信息就在那里,响亮而清晰。管理员并不困惑;他们实际上知道答案。
2. “故障”的写牌员
那么,既然管理员知道答案是 10,为什么他们会说"8"呢?
研究人员在走廊的中间发现了一个特定的“故障”。在思考过程进行到大约 90% 时,有一位特定的工人(计算机代码中称为MLP 块的一部分)看到了列表的格式(单词由空格分隔),并决定忽略白板。
- 类比:想象管理员正拿着写有"10"的牌子走在走廊里。突然,一位特定的工人(我们叫他“格式弗雷德”)跳了出来。弗雷德看到列表是用空格书写的(如"apple apple apple")。他有一个预设规则:“如果我看到用空格分隔的单词列表,我就必须把牌子改成'8'。”
- 弗雷德抢过白板,擦掉"10",在上面写上"8"。
- 尽管管理员的大脑仍然知道是 10(原始信号在背景中依然存在),但最终输出变成了"8",因为弗雷德覆盖了它。
3. 问题不在于单词,而在于格式
这种故障只发生在单词(如"apple"或"cat")上,而不出现在数字(如"1"或"2")上。
- 类比:如果你给管理员一个数字列表("1 1 1 1..."),格式弗雷德并不在意。他只对单词有反应。管理员能完美地数出数字。但如果你给他们单词,弗雷德就会被触发。
- 此外,如果你将格式改为使用逗号而不是空格(例如"apple, apple, apple"),弗雷德就不会跳出来。"8"的规则不会被触发,管理员就能答对。这证明问题不在于计数能力,而在于对列表外观的特定反应。
4. 是“路由”问题,而非“表征”问题
该论文对两种类型的失败做出了重大区分:
表征失败:管理员不知道如何计数。(本文指出这并未发生)。
路由失败:管理员知道如何计数,但信号在到达嘴巴之前被劫持了。(这正是发生的情况)。
类比:这就像一家广播电台正在播放正确的歌曲(计数),但播音室里的 DJ(MLP 块)决定在音乐传出扬声器之前切断音乐,播放另一首歌曲(错误的数字)。音乐本身没问题;是路由出了问题。
5. 更大的模型有不同的故障
研究人员还观察了更大、更智能的模型。这些模型通常能数对,但如果你偷偷在苹果列表里混入一个“香蕉”,它们就会失败。
- 故障:这些更大的模型看到了香蕉。它们的注意力系统注意到了它。但是,就像较小的模型一样,它们未能让该信息改变最终答案。它们看到了异常,但无法将新信息“路由”到最终输出。
核心结论
该论文得出结论:这些 AI 模型并非“不擅长数学”。它们实际上在内部追踪数字方面非常擅长。问题在于,它们大脑的特定部分被列表的书写方式(空格与逗号、单词与数字)触发,从而将错误的答案强加给最终输出,覆盖了原本已经存在的正确答案。
要解决这个问题,我们不需要教 AI 如何计数(它已经知道了)。我们需要修复那个目前阻碍正确答案输出的“交通警”(路由机制)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。