← 最新论文
🤖 AI

AdaR: A Framework for Equipping LLMs with Adaptive Reasoning

AdaR 框架通过在自动合成的逻辑等价查询上对大语言模型进行强化学习训练,以惩罚伪相关并鼓励自适应推理,从而增强了大语言模型的数学推理鲁棒性和泛化能力。

原作者: Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能的广阔版图中,大型语言模型已成为强大的工具,能够解决从撰写诗歌到调试代码等各种复杂问题。在这些令人印象深刻的成就中,数学推理尤为突出,这些系统能够将一个问题分解为一系列逻辑步骤以得出解决方案。多年来,研究人员一直对这种能力表示赞赏,认为当模型正确解决一个问题时,它确实理解了背后的逻辑。然而,仔细观察会发现一个令人不安的缺陷:许多此类模型实际上并没有在进行逻辑推理。相反,它们通常是在记忆训练数据中的模式。它们学会了将特定的数字或短语与某些答案联系起来,就像一个背下了练习题答案解析、却并不理解底层数学原理的学生一样。当测试发生微小变化时——比如数字改变或措辞调整——这些模型往往会跌倒,因为它们的“推理”从一开始就并非真实的。

这正是南京大学与美团的研究人员所致力于解决的核心挑战,他们开发了一个名为 AdaR 的框架,旨在教机器如何进行自适应思考。该团队发现,问题的根源在于他们称之为“伪推理”(spurious reasoning)的现象。这种情况发生在模型依赖于表层联系(例如问题中某个数字的具体数值)而非问题本身的结构逻辑时。为了说明这一点,想象一个被训练去解决“一个数字求立方”问题的模型。如果训练数据中始终使用数字 3,那么每当模型看到乘法问题时,它可能会简单地输出“立方”,而不管实际涉及的数字是什么。如果问题变为涉及另一个数字,模型就会失败,因为它从未学习过“求立方”的规则;它只是学会了识别数字 3 的模式。研究人员发现,即使是那些在标准测试中表现卓越的高级模型,也存在这种脆弱性,无法将其技能泛化到新的、略有不同的场景中。

为了解决这个问题,研究人员创建了一个迫使模型学习逻辑而非数字的系统。他们首先提取现有的数学问题,并将其简化为核心结构,即“模板”。然后,他们利用计算机程序自动生成了数千个这些问题的新版本,通过改变具体的数字,同时保持逻辑步骤完全一致。至关重要的是,他们不仅仅是让语言模型去猜测新答案,而是编写了可执行代码来以绝对确定的方式计算出正确答案。这确保了他们创建的每一个新问题都是有效的,并且拥有经过验证的解法。随后,他们利用这些多样化的新问题对模型进行了严格的训练过程。他们并没有简单地向模型展示正确答案,而是采用了一种方法:只有当模型能够正确解决整套多样化问题时,才会给予奖励。如果模型依赖于记忆的模式,它会在面对新数字时失败并受到惩罚;如果它学习了实际逻辑,它就能在所有变化中取得成功并获得奖励。

这种方法的实验结果非常显著。在针对熟悉和完全陌生的数学问题进行测试时,接受过这种自适应框架训练的模型表现出了显著的提升。平均而言,与其它方法相比,它们的性能提升了八个点以上,这在人工智能领域是一个实质性的进步。更重要的是,这些模型变得更加稳健。它们能够处理问题中数字的变化而不崩溃,证明了它们已经学习到了底层规则,而非仅仅是记忆特定的例子。研究人员还观察到了模型“思考”方式的变化。在接受此类训练之前,模型倾向于关注问题中的特定数字,而忽略结构;训练之后,它们的注意力转向了问题本身的结构,从而能够像对待已知数字一样,以同样的逻辑严谨性对待未知变量。这种转变表明,模型正在发展出一种代数思维,将问题视为关系系统,而非待回忆的事实列表。

研究还探讨了不同类型的变化如何影响学习过程。他们发现,通过改变问题中的数字来教模型进行推理,比仅仅用不同的措辞重写问题要有效得多。这表明,实现自适应推理的关键在于让模型接触广泛的数值场景,迫使它依靠逻辑来应对差异。研究人员指出,虽然该方法效果良好,但它也有局限性:它要求问题必须能被计算机程序求解,这意味着它最适用于数学和逻辑任务,而非像证明复杂定理那样抽象的领域。此外,该方法的成功取决于模型是否已经具备坚实的数学知识基础。该系统无法从零开始教导一个一无所知的模型进行推理;它只能提炼那些已经具备基本构建模块的模型的推理能力。

最终,这项工作为使人工智能更加可靠提供了一条清晰的路径。通过从简单的记忆转向自适应推理,研究人员表明,构建能够应对意外情况的模型是可能的。研究结果表明,智能系统的未来不仅在于使其规模更大或速度更快,更在于教会它们理解支配世界的规则,而非仅仅是它们见过的特定实例。随着这些模型越来越多地融入我们的日常生活——从解决财务方程到规划复杂的物流——能够适应新信息而不出错的能力将至关重要。AdaR 框架提供了一个实现这一目标的蓝图,将脆弱的、模式匹配型的机器转变为灵活的、具备逻辑思维能力的思考者,使其能够应对不断变化的世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →