← 最新论文
🤖 machine learning

Explaining and Tuning Transformer-based LLMs in Arithmetic Tasks with Human Strategies

本文表明,通过采用类似于人类的学习策略(如任务分解和认知赋能),基于 Transformer 的大语言模型可以实现更优的算术性能,这暗示了 LLM 与人类学习者之间存在共同的认知过程,同时通过可解释人工智能验证增强了模型的可靠性。

原作者: Luyu Qiu, Jianing Li, Hwanhee Kim, Xiaoyong Wei, Yueyuan Zheng, Janet Hsiao, Lei Chen

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Luyu Qiu, Jianing Li, Hwanhee Kim, Xiaoyong Wei, Yueyuan Zheng, Janet Hsiao, Lei Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

聪明的机器人与数学题

想象一个计算机已经学会阅读几乎所有已有的书籍、网站和对话的世界。这些被称为“大语言模型”(LLMs),它们就像超级聪明的机器人,可以写故事、回答问题以及与你聊天。它们是基于一种特殊的架构——“Transformer”构建的,这种架构就像一个巨大的聚光灯,帮助机器人同时关注句子中最重要的词汇。你可能会认为,一个掌握了如此多语言知识的机器人,在数学方面也应该很擅长。但转折在于:虽然这些机器人是文字方面的巫师,但在处理简单的数学问题(比如把两个数字相加)时,它们却经常出错。这就像一个人能写出优美的诗篇,却算不清在商店里应该找回多少零钱一样。这件事情非常重要,因为如果我们希望信任这些机器人去从事重要的工作——比如帮助医生或管理资金——我们需要知道它们能否正确完成基础工作。科学家们正在试图弄清楚,为什么这些聪明的机器人会在简单的数学上失败,更重要的是,如何教它们变得更好。

论文的故事:教机器人像人类一样思考

在这项研究中,研究人员决定将数学问题视为一个待解的谜团。他们并没有只是向机器人投喂更多的数据并听天由命,相反,他们提出了一个引人入胜的问题:这些人工智能机器人学习数学的方式是否与人类相同?

为了找出答案,他们采用了一个标准的“原生”(vanilla)Transformer 模型(即 AI 的基础版本),并教它进行整数算术——包括加法、乘法和除法。他们发现,AI 并不只是在瞎猜;它实际上是在学习,但它在运算顺序和步骤的复杂性上遇到了困难。

“乐高式”拆解
研究人员意识到,就像人类将一个庞大且可怕的数学问题分解成更小、更简单的步骤一样,AI 也需要这样做。他们将任务拆解成了微小的“子任务”。

  • 关于加法: 想象一下在计算两个长数字相加。你不会只看整个数字,而是先加最后一位,然后是下一位,并将任何“多出来的”数字(比如进位的 1)进到下一列。研究人员发现,AI 学习简单部分(如加最后一位)的速度很快,但当它需要记住并使用这些“进位”数字来进行下一步时,它就会感到困惑。这就像是在跑步之前先学习走路。
  • 关于乘法: 这更加棘手。当你计算大数字的乘法时,你需要进行许多次较小的乘法,然后将它们全部相加。论文发现,AI 试图一次性完成所有事情,结果被搞得应接不暇。然而,当研究人员教 AI 以逆序(从最后一位开始向后计算,就像人类在纸上计算时常做的那样)书写答案时,AI 的表现有了显著提升(仅针对简单的单数乘法任务)。但这里有个陷阱:对于复杂的位乘法,仅仅反转数字并不能解决问题;由于中间步骤对单层模型来说过于困难,AI 仍然会感到吃力。

“人类式”技巧
这篇论文最令人兴奋的部分在于,研究人员测试了人类教师用来帮助学生的策略,而这些策略在 AI 身上同样奏效!

  1. 思维链(Chain of Thought, CoT): 他们没有问 AI:“57257 乘以 51422 等于多少?”并期待一个神奇的答案,而是要求它展示每一步的计算过程。他们告诉 AI 将大的乘法分解为更小、更容易的乘法。这正是人类老师对学生说的话:“不要惊慌,一步步来。”当 AI 将 CoT 与反转数字结合使用时,其准确率大幅跳升(达到了约 79%)。研究人员发现,要达到接近完美的得分,需要将 CoT 与反转数字以及增加模型的“深度”结合起来。
  2. 反转输出: 如前所述,对于乘法,从个位开始倒着写有助于 AI 专注于正确的数字,但这种技巧是有极限的。它在处理较简单的任务时效果很好,但对于复杂的位乘法,仅靠反转本身是不够的。有趣的是,对于除法,反转数字反而让情况变得更糟。这是因为除法计算自然地是从高位数字(左侧的大数字)开始的,这符合人类的经验。尝试在除法中反转顺序会让模型感到困惑。
  3. 更深的模型: 他们还发现,使 AI 变得“更深”(增加更多的思考层)有助于它处理除法的复杂中间步骤以及乘法的繁重计算。这为模型提供了处理中间结果所需的额外“脑力”,使其不会在关键时刻掉链子。

他们的发现(以及未发现的部分)
研究人员不仅是说“它有效”,他们还深入观察了机器人的“大脑”内部,以查看它是如何运作的。他们使用了一种称为“可视化”的技术,来观察 AI 的注意力机制中哪些部分在闪烁。他们看到 AI 拥有特定的“注意力头”(内部的小型工作者),这些注意力头学会了执行特定的任务,例如“基数乘法”(Base Multiply)或“进位处理”(Make Carry)。

  • 好消息: AI 可以 学习这些模式。当给予正确的结构(如拆解任务、使用 CoT、在适当处反转数字以及调整模型深度)时,它的表现几乎是完美的。
  • 坏消息: 如果没有这些类人策略,AI 就会陷入困境。例如,在一个标准的 5 位数乘法任务中,一个基础的 AI 可能只能得到 13% 的正确率。但通过结合这些“人类技巧”,它可以达到 100%。
  • 原因: 论文指出,AI 的失败并不是因为它“笨”,而是因为它试图用一种与数学结构不匹配的方式来解决问题。这就像试图通过从后面推车而不是使用方向盘来开车一样。此外,“正确”的驾驶方式取决于车型:对于乘法,你可能想倒着开;但对于除法,你必须正着开。

大局观
这篇论文表明,基于 Transformer 的 AI 模型可能与人类学生有着相似的学习模式。两者都会先学习简单的东西,然后将其组合起来解决更难的问题。通过使用“可解释人工智能”(XAI)技术,研究人员可以清楚地看到 AI 在哪里卡住了,并进行修复。

研究结论认为,虽然目前的 AI 模型在语言方面非常出色,但它们在数学方面需要一点帮助。但好消息是,我们不需要发明一种全新的机器人;我们只需要教它们像我们一样思考。通过使用诸如拆解问题、展示过程、整理思路(以及知道何时该反转顺序,何时不该反转)等策略,我们可以让这些 AI 模型变得更加可靠。这是迈向让 AI 在重要工作中变得安全且值得信赖的重要一步,尤其是在那些计算正确与否决定成败的关键领域。这篇论文并未声称解决了宇宙中的每一个数学问题,但它展示了一条清晰的前行之路:如果我们把 AI 当作一个需要好老师的学生,它就能学会我们需要的数学能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →