← 最新论文
💬 NLP

AI-rithmetic

本文通过系统性研究发现,尽管现代 AI 在高级数学领域表现出色,但在基础整数加法上仍存在显著缺陷,其错误主要归因于操作数对齐错误(常与分词机制相关)和进位失败,这两类错误解释了主流大模型绝大部分的计算错误。

原作者: Alex Bie, Travis Dick, Alex Kulesza, Prabhakar Raghavan, Vinod Raman, Sergei Vassilvitskii

发布于 2026-02-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Alex Bie, Travis Dick, Alex Kulesza, Prabhakar Raghavan, Vinod Raman, Sergei Vassilvitskii

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这份研究报告非常有意思,它揭示了一个看似矛盾的现象:现在的 AI 既能像天才一样解复杂的数学难题,又会在最简单的加法面前“翻车”。

为了让你轻松理解,我们可以把这个现象想象成一个**“超级学霸的低级错误”**。

1. 核心矛盾:会写诗、会证明定理,却不会算 1+1

想象一下,你面前坐着一位教授,他能跟你讨论量子力学,能写出优美的散文,甚至能帮你推导复杂的数学公式。但如果你突然递给他一张卷子,上面写着两个 50 位的超长数字让他相加,他竟然可能算错!

这就是目前最顶尖的 AI(比如 GPT-5、Claude 等)面临的尴尬现状:它们在“高阶思维”上很强,但在“基础运算”上却像个没学好口诀的小学生。


2. 为什么会出错?(两个主要的“翻车”原因)

研究人员发现,AI 的错误并不是乱来的,它们主要掉进了两个“坑”里:

坑一:对齐失误(Misalignment)—— “看走眼了”

比喻: 想象你在玩一个“连连看”或者“对齐数字”的游戏。如果你要把两排很长的数字对齐,但其中一排不小心往左或往右挪了一个位子,那么后面的计算全都会乱套。

真相: AI 在处理数字时,并不是像我们人类一样一个数字一个数字地看,而是把数字切成一小块一小块的“零件”(这在技术上叫 Tokenization/分词)。

  • 有的 AI 喜欢把数字每 3 位切成一块。
  • 如果数字的长度刚好不能被 3 整除,剩下的那 1 或 2 位就会显得很“突兀”。
  • 这就好比你用尺子量东西,如果尺子的刻度跟物体的长度对不上,你就会产生一种“错位感”,导致 AI 在计算时把数字“摆错位置”了。

坑二:进位错误(Close Carry Errors)—— “记性不好”

比喻: 这就像你在做小学数学题,算到 9+1 的时候,大脑里闪过一个念头:“哎呀,要进位了!”但由于你走神了,或者那一瞬间没反应过来,你就直接写下了 0,忘了把那个“1”加到下一位去。

真相: 研究发现,AI 的这种错误非常具有“随机性”。它并不是因为不懂进位规则,而是在遇到那种“刚好要进位”或者“差一点就进位”的临界点时,像掷硬币一样,有时候对了,有时候错了。这种错误是独立发生的——算完这一位,它可能就忘了刚才那个进位带来的影响。


3. 总结:AI 的“大脑”构造问题

这份论文告诉我们一个深刻的道理:规模大并不代表万能。

虽然我们不断给 AI 喂更多的数据、用更大的算力,让它们变得越来越聪明,但它们目前的“大脑构造”(Transformer 架构)在处理这种极其严谨、一步都不能错的逻辑链条时,依然存在天然的弱点。

用一句话总结:
现在的 AI 就像是一个**“直觉极强、灵感爆棚,但极其不细心”**的天才。它能带你领略数学的星辰大海,但如果你想让它帮你算账,你最好还是得自己拿个计算器复核一遍!

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →