← 最新论文
🤖 machine learning

The Shape of Addition: Geometric Structures of Arithmetic in Large Language Models

本文揭示了大语言模型的算术错误源于被称为“等原始和轨迹”(Iso-Raw-Sum Trajectory)的连续潜空间内的“几何滑动”,并提出了一个噪声量化模型来解释神经噪声如何破坏进位传播,进而提供了一个用于检测和纠正此类失效的几何框架。

原作者: Liuyuan Wen, Xun Zhu, Lihao Huang, Wenbin Li, Yang Gao

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Liuyuan Wen, Xun Zhu, Lihao Huang, Wenbin Li, Yang Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大谜团:为什么聪明的 AI 模型在简单数学面前会失灵?

想象一位才华横溢的学生,他能写出复杂的文章,也能解决逻辑难题,但偶尔会在简单的加法问题上出错,比如把 123+392+136123 + 392 + 136 算成 $652而不是 而不是 651$。这就是论文开篇提到的“悖论”:大语言模型(LLMs)擅长高层推理,但在处理基础数学时却异常脆弱,经常出现“差一错误”(即结果只差了一个数字)。

研究人员想要知道:错误是在计算机大脑内部的哪个环节发生的? 是模型对数字感到困惑,还是仅仅在最后一步出了点小差错?

发现: “数字高速公路”(几何结构)

为了寻找答案,研究人员观察了模型的“残差流”(residual stream,即信息传输的内部高速公路)。他们使用了一种叫做 UMAP 的技术,将模型极其复杂、庞大的 3D(或 3000 维)思维图谱压缩成了一张人类可见的 2D 图片。

他们发现,模型的内部数学运算并非杂乱无章的数据堆,而是一个高度有序的几何景观

  1. 数字盆地(城市): 想象十个巨大的、深邃的山谷或“盆地”,分别代表数字 0 到 9。如果模型正在思考“5”,它的内部状态就会处于“5 号谷底”深处。
  2. 进位纤维(道路): 在每个谷底内部,都有一些隐形的“道路”或“纤维”穿行其中。这些道路代表了进位(即当你计算 7+7=147+7=14 时,向下一列进的那个 1)。
    • 一条路是为“进位 0”准备的。
    • 另一条路是为“进位 1”准备的。
    • 第三条路是为“进位 2”准备的。

类比: 把模型的数学过程想象成一列火车在特定的轨道上行驶。“轨道”是原始总和(Raw Sum,即你当前正在相加的数字之和)。“车站”是数字(0–9)。而“车票”则是进位(Carry)。

核心概念:等原始和轨迹(IRST)

论文中提出了一个特定的结构,称为等原始和轨迹(Iso-Raw-Sum Trajectory, IRST)

  • 它是什么: 一条连接不同数字谷底的连续、蜿蜒的路径。
  • 它是如何运作的: 如果你正在相加的数字总和为特定数值(例如 11),模型的内部状态会沿着一条单一且连续的线移动。随着“进位”从 0 变为 1 再变为 2,模型会沿着这条线平滑地滑动,从“1 号谷底”移动到“2 号谷底”,再到“3 号谷底”。
  • 深刻见解: 模型并不是在数字之间随机跳跃,而是在一条平滑且连续的导线上滑动。

问题所在:“几何滑动”

那么,模型为什么会出错呢?

研究人员提出,模型在大多数时候其实是在正确地进行计算,但在它必须决定停在哪个“车站”(数字)的那一瞬间产生了困惑。

  • 类比: 想象模型是一辆沿着平滑道路(IRST)行驶的汽车。这条路恰好经过两个城镇(数字 1 和数字 2)之间的边界。
  • 噪声: 汽车的引擎带有微小的“静电”或震动(神经噪声)。
  • 滑动: 当汽车正好位于两个城镇的交界处时,那一点点震动就会把汽车推向错误的城镇。
    • 如果它本该停在“城镇 1”,噪声会将它推入“城镇 2”(高估/幻觉)。
    • 如果它本该停在“城镇 2”,噪声会将它推回“城镇 1”(低估/泄漏)。

论文将此称为几何滑动(Geometric Slippage)。数学逻辑是存在的,但由于内部噪声的存在,其“决策边界”变得模糊不清。

“噪声量化”模型

作者用一个名为**噪声量化模型(Noisy Quantization Model)**的理论将其形式化。

  • 连续势能: 模型不仅仅是以整数(0, 1, 2)进行思考。它思考的是一种连续的“压力”或“势能”(例如 1.4, 1.51, 1.9)。
  • 阈值: 为了输出最终答案,模型必须将这个连续的数字向下取整(量化)为最接近的整数。
  • 误差: 如果连续数值是 1.9,而噪声增加了微小的数值,它可能会跨越阈值达到 2.0,导致模型输出“2”而不是原本应有的“1”。

他们发现,当“压力”处于两个整数之间时(如 1.9 或 2.1),错误发生得最为频繁,呈现出一种“浴缸形”的误差分布:在边缘处错误率高,在中间处错误率低。

“探针”的魔力

研究中一个非常酷的发现是关于**探针(Probes)**的。探针是一种简单的工具,通过观察模型的内部状态来尝试猜测它在想什么。

  • 惊喜之处: 即使模型输出了错误的答案(例如,它说“2”但正确答案是“1”),探针也可以观察内部状态并正确判断:“嘿,模型实际上知道答案是 1,而且它也知道进位是 0。”
  • 解释: 因为模型的内部状态是一个平滑的连续景观,所以“真相”与“错误”在几何上是紧挨着的。探针之所以能看到隐藏在“错误”中的“真相”,是因为它们在几何位置上非常接近。这就像看到一个人站在篱笆的错误一侧,但你依然能准确知道他原本打算站在哪一侧。

解决方案:“双流一致性”

既然模型在内部已经“知道”了正确答案,只是在最后关头滑了一下,研究人员构建了一个修复方案。

  1. 第一流(局部): 一个工具负责检查即时的数学运算(当前列的求和)。
  2. 第二流(全局): 一个工具负责检查“压力”(来自前一步的进位势能)。
  3. 检查机制: 如果模型的输出与这两个工具所显示的一致性不符,系统就会介入。它会强制模型输出符合数学逻辑的数字。

结果: 这种方法显著降低了错误率,且无需重新训练模型。它证明了模型的“大脑”一直持有正确的信息,它只是需要一个微小的推力来确保自己留在正确的几何线的一侧。

总结

  • 模型: LLM 通过在几何景观中沿着平滑、连续的路径(纤维)滑动来进行数学运算。
  • 错误: 当内部“静电”将模型的思维推过界限,进入错误的数字谷底时,错误便发生了。
  • 真相: 即使模型给出了错误答案,正确的答案仍然隐藏在其内部状态中,只是位置略有偏移。
  • 修复: 通过检查内部“压力”是否与局部数学运算相匹配,我们可以捕捉到这些滑动并实时纠正它们。

论文的结论是,LLM 数学能力的脆弱性并非源于缺乏知识,而是由决策边界处的噪声引起的几何不稳定性

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →