Are Arithmetic Heuristic Neurons Form-Invariant? A Mechanistic Analysis of Symbols, Text, and Code in LLMs
本文表明,大语言模型中的算术计算依赖于一套在符号、自然语言和代码格式之间共享且形式不变的“启发式神经元”,从而揭示了跨格式失效源于激活状态而非不同的内部电路。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人做数学题。你可能会认为,如果机器人学会了使用像“4 + 5 = 9”这样简单的等式来做加法,那么当你给它讲一个故事(“汤姆有4个苹果,爱丽丝给了他5个……”)或者要求它写一段程序来完成这个任务时,它也会自动知道如何解决同一个问题。但转折在于:这些被称为大语言模型(LLM)的机器人,表现得异常反复无常。它们可能在处理故事时能答对,但在要求它们写代码时却惨败,尽管其中的数学逻辑完全相同。这不仅仅是一个小故障,更是关于这些模型在其数字大脑中是如何“思考”的一个谜团。
要理解这一点,我们需要窥探其内部构造。不要把大语言模型看作一个单一的巨型大脑,而要把它看作一座由被称为“神经元”的微小工人组成的庞大城市。当模型解决一个问题时,特定的神经元群体就会被激活,承担起繁重的计算工作。科学家们称之为“机械解释性”——基本上就是通过逆向工程来研究这台机器,看看是哪些具体的齿轮在转动以使其运作。研究人员一直在追问的大问题是:当机器人从用符号做数学运算切换到用文字或代码做数学运算时,它是招募了一支全新的工人团队?还是说,它使用的是同一支团队,只是因为指令看起来不同而感到困惑?
本论文旨在通过将机器人的大脑视为一个侦探案件来解决这个谜团。研究人员提取了同一个数学问题的三个不同版本——一个是以标准等式形式呈现,一个是 Python 计算机程序,另一个是自然语言文字问题——并观察了在三个不同的 Llama-3 模型中,哪些神经元被激活了。他们发现,机器人并不是针对不同的格式使用不同的团队。相反,在每一层中,都有一支大约 50 到 100 个神经元组成的微小且紧凑的“核心班底”在进行实际的数学运算,无论你如何提问。
这是他们发现中最令人兴奋的部分:当机器人在一种格式(如代码)中失败,但在另一种格式(如文字问题)中成功时,并不是因为它缺乏正确的工具。它仅仅是因为“核心班底”没有接收到启动工作的正确信号。研究人员通过进行一次数字“大脑移植”证明了这一点。他们将成功处理文字问题时的激活信号,粘贴到了失败的代码运行上。突然间,那个卡壳的机器人开始正确解决代码中的加减法问题,成功率竟然超过了 97%!
这表明,机器人的失败并非由于缺乏知识或电路损坏;它只是因为神经元处于“不对的情绪”中。这项研究表明,这些“算术启发式神经元”具有“形式不变性”,这意味着无论数学是以符号、故事还是代码的形式呈现,它们都是同样可靠的工人。它们始终属于相同的“策略家族”,比如检查数字是否在某个特定范围内,或寻找特定的模式。因此,虽然机器人看起来似乎会对不同方式的提问感到困惑,但它的内部数学引擎实际上是非常一致且稳健的,它仅仅是在等待那点燃工作的正确火花。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。