Language Models are Symbolic Learners in Arithmetic
本文认为,语言模型并未学习到算术的真实算法,而是作为贪婪的符号学习者,通过层级化地获取一系列简单的、低标记量的捷径来掌握任务,这一机制通过多位数乘法中呈现出的、与最简输入输出映射质量相吻合的 U 型准确率模式得到了证实。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大问题:它们是数学天才还是模式匹配者?
想象一下,你看到一个学生能瞬间告诉你一个巨型乘法题(比如 )的最后一位数字,但在处理中间数字时却卡壳了。你可能会问:他们是真的理解乘法的原理,还是仅仅根据以前见过的模式在进行猜测?
这篇论文认为,大语言模型(LLMs)属于后者。它们并没有学习数学的“算法”(即我们在学校里教授的那种循序渐进的规则)。相反,它们表现得像是贪婪的捷径寻求者。它们在寻找最简单、最直接的方法来获得正确答案,通过记忆特定的“符号到符号”的技巧,而不是学习底层的逻辑。
侦探工具:“子群归纳法”(Subgroup Induction)
为了证明这一点,作者创建了一个新的侦探工具,叫做子群归纳法。
把一个乘法问题想象成一个巨大的拼图。要解决它,你通常需要观察其中涉及的所有数字。但这个工具提出了一个更简单的问题:“我们能否仅通过观察输入中一个微小的、特定的部分,就解决答案中的某一个部分?”
- 类比: 想象你在尝试猜一个蛋糕的味道。
- 算法方式: 你品尝整个蛋糕,分析面粉、糖、鸡蛋和烘焙时间,然后计算出味道。
- 捷径方式: 你只需闻一下香草精的味道。如果你闻到了香草味,你就猜它是“香草蛋糕”。你不需要知道关于鸡蛋或烤箱温度的任何信息;你只是找到了一个快速且可靠的捷径。
论文将这些捷径称为**“子群”(Subgroups)**。一个子群就是一个微小的映射关系,例如:“如果最后两位是 3 和 4,那么答案一定以 2 结尾。”
“U型曲线”的发现
研究人员通过对乘法问题进行训练来测试这一理论。他们发现了一个奇怪且一致的模式,其表现形式在图表上呈现出一种 U型 曲线:
- 两端(高准确度): 模型在预测答案的第一位和最后一位数字方面表现得非常出色。
- 中间(低准确度): 模型在预测中间数字时表现得很糟糕。
为什么会发生这种情况?
- 两端是简单的捷径: 乘法的最后一位数字仅取决于被乘数和乘数的最后一位数字。这是一个完美的、简单的捷径(就像闻香草味一样)。模型能瞬间学会这一点,因为它只需要观察极少数的数字。
- 中间很困难: 中间数字取决于所有其他数字以及“进位”值的复杂混合。这里没有简单的、微小的捷径。要得到正确的中间数字,你必须几乎同时观察所有的数字。
论文显示,模型的性能曲线完美地匹配了这些捷径的“质量”。它们首先掌握那些容易的、低成本的捷径。只有当被迫进行更多训练时,它们才会开始学习复杂的、混乱的中间部分。
学习的“树”
作者将学习过程可视化为攀爬一棵树:
- 树的底部: 使用极少数字的简单捷径(容易学习,对两端数字准确度高)。
- 树的顶部: 使用大量数字的复杂捷径(难以学习,是完成中间部分所必需的)。
模型从底部开始。它们先抓取容易获得的胜利。只有随着训练的增加,它们才会慢慢向上攀爬,去应对更难、更复杂的模式。它们不会一次性学习“整棵树”,而是通过学习每一个分支,从最简单的开始。
“熵”度量:衡量难度
论文还引入了第二个工具,叫做子群熵(Subgroup Entropy)。你可以把它看作是一个**“困惑度计”**。
- 如果一个捷径具有低熵,意味着答案是非常可预测的(例如:“3 乘以 4 总是等于 12”)。
- 如果一个捷径具有高熵,意味着答案是混乱且难以预测的,如果不了解所有细节就无法得出结论。
研究人员发现,当他们分解复杂的推理任务(如思维链,即模型进行逐步思考的过程)时,那些困惑度(熵)最低的路径,正是模型最常做对的路径。这证实了模型偏好“阻力最小的路径”——它们想要最简单、最可预测的步骤来获得答案。
核心结论
论文得出结论:语言模型并不是在以人类的方式进行“计算”。它们是符号学习者(Symbolic Learners),构建了一个由捷径组成的层级结构。
- 它们并没有学习乘法的“配方”。
- 它们学习的是一个庞大的“如果-那么”技巧库,从最简单的(如最后一位数字)开始,并随着经验的增加,逐渐加入更复杂的(如中间数字)技巧。
简而言之:LLM 是高明的模式匹配者,它们热爱捷径,而不是算法思考者。 它们通过寻找符号之间最简单的路径来解决数学问题,而不是像我们那样进行数学运算。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。