AI-rithmetic
本文通过系统性研究发现,尽管现代 AI 在高级数学领域表现出色,但在基础整数加法上仍存在显著缺陷,其错误主要归因于操作数对齐错误(常与分词机制相关)和进位失败,这两类错误解释了主流大模型绝大部分的计算错误。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这份研究报告非常有意思,它揭示了一个看似矛盾的现象:现在的 AI 既能像天才一样解复杂的数学难题,又会在最简单的加法面前“翻车”。
为了让你轻松理解,我们可以把这个现象想象成一个**“超级学霸的低级错误”**。
1. 核心矛盾:会写诗、会证明定理,却不会算 1+1
想象一下,你面前坐着一位教授,他能跟你讨论量子力学,能写出优美的散文,甚至能帮你推导复杂的数学公式。但如果你突然递给他一张卷子,上面写着两个 50 位的超长数字让他相加,他竟然可能算错!
这就是目前最顶尖的 AI(比如 GPT-5、Claude 等)面临的尴尬现状:它们在“高阶思维”上很强,但在“基础运算”上却像个没学好口诀的小学生。
2. 为什么会出错?(两个主要的“翻车”原因)
研究人员发现,AI 的错误并不是乱来的,它们主要掉进了两个“坑”里:
坑一:对齐失误(Misalignment)—— “看走眼了”
比喻: 想象你在玩一个“连连看”或者“对齐数字”的游戏。如果你要把两排很长的数字对齐,但其中一排不小心往左或往右挪了一个位子,那么后面的计算全都会乱套。
真相: AI 在处理数字时,并不是像我们人类一样一个数字一个数字地看,而是把数字切成一小块一小块的“零件”(这在技术上叫 Tokenization/分词)。
- 有的 AI 喜欢把数字每 3 位切成一块。
- 如果数字的长度刚好不能被 3 整除,剩下的那 1 或 2 位就会显得很“突兀”。
- 这就好比你用尺子量东西,如果尺子的刻度跟物体的长度对不上,你就会产生一种“错位感”,导致 AI 在计算时把数字“摆错位置”了。
坑二:进位错误(Close Carry Errors)—— “记性不好”
比喻: 这就像你在做小学数学题,算到 9+1 的时候,大脑里闪过一个念头:“哎呀,要进位了!”但由于你走神了,或者那一瞬间没反应过来,你就直接写下了 0,忘了把那个“1”加到下一位去。
真相: 研究发现,AI 的这种错误非常具有“随机性”。它并不是因为不懂进位规则,而是在遇到那种“刚好要进位”或者“差一点就进位”的临界点时,像掷硬币一样,有时候对了,有时候错了。这种错误是独立发生的——算完这一位,它可能就忘了刚才那个进位带来的影响。
3. 总结:AI 的“大脑”构造问题
这份论文告诉我们一个深刻的道理:规模大并不代表万能。
虽然我们不断给 AI 喂更多的数据、用更大的算力,让它们变得越来越聪明,但它们目前的“大脑构造”(Transformer 架构)在处理这种极其严谨、一步都不能错的逻辑链条时,依然存在天然的弱点。
用一句话总结:
现在的 AI 就像是一个**“直觉极强、灵感爆棚,但极其不细心”**的天才。它能带你领略数学的星辰大海,但如果你想让它帮你算账,你最好还是得自己拿个计算器复核一遍!
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。