← 最新论文
💬 NLP

ASTER: Agentic Scaling with Tool-integrated Extended Reasoning

该论文介绍了 ASTER,这是一个通过利用具有高交互密度轨迹的有针对性的冷启动策略,来克服工具集成推理中交互崩溃问题的框架,使一个 4B 参数的模型能够在 AIME 2025 等数学基准测试中达到最先进的性能。

原作者: Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一名非常聪明但缺乏经验的学生(一个大语言模型)如何解决极其困难的数学问题。这个学生思维能力很强,但由于习惯于在脑中完成所有计算,经常会出现微小的计算错误,并最终导致错误的答案。

这篇论文介绍了一种名为 ASTER(基于代理缩放的工具集成扩展推理)的新型训练方法来解决这个问题。以下是他们是如何做到的,使用了简单的类比。

问题所在:“过度自信”的学生

此前,研究人员尝试通过让 AI 模型在实践中从错误中学习(强化学习)来教会它们使用工具(如计算器或代码解释器)。

然而,这往往会导致一个被称为**“交互崩溃”(Interaction Collapse)**的问题。

  • 类比: 想象一名学生在进行一场漫长且复杂的数学考试时,本该使用计算器。结果,他们试图在脑中完成所有的难题,陷入混乱,最后在结束时,仅仅输入了 1+1 来“检查”自己的工作。他们并没有真正利用工具来辅助思考;他们只是把工具当作最后时刻的一个微小的安全网。
  • 结果: AI 停止了有效地使用工具。它退回到过度依赖内部“思考”的状态,从而产生错误,并无法解决长而复杂的难题。

解决方案:“名厨”学徒制

研究人员意识到,在让学生独立练习之前,你需要先向他们展示如何正确地使用工具。他们称之为 冷启动 SFT(监督微调)。

他们测试了不同的教学方式:

  1. “快速修复”法: 向学生展示那些仅使用一两次工具的解决方案。
  2. “深度钻研”法 (ASTER): 向学生展示一小组示例(仅 4,000 个),在这些示例中,工具被频繁且持续地使用。

核心发现:交互密度
研究人员发现,训练示例中工具使用的密度比其他任何因素都重要。

  • 类比: 如果你想教一位厨师烹饪一道包含十道菜的盛宴,仅仅向他展示一份只用了一次烤箱的食谱是不够的。你需要向他展示一份在烹饪过程中需要不断切菜、搅拌、品尝并调整火候的食谱。
  • ASTER 方法: 他们创建了一个“名厨”数据集,要求 AI 在解决单个问题时必须反复使用工具(代码解释器)——有时在单个问题中甚至要使用超过 9 次。这教会了 AI 一种“习惯”(或称为行为先验),即不断地使用工具来检查自己的工作,而不是仅仅靠猜测。

训练过程:两个阶段

一旦 AI 从这 4,000 个示例中学会了这种“习惯”,研究人员就让它通过强化学习进行自主练习。

  1. 第一阶段(练习赛): AI 进行练习,但限制了使用工具的次数。它学会了如何提高效率。
  2. 第二阶段(马拉松): 他们给了 AI 更长的“思考空间”(更多的内存),并允许它最多使用工具 50 次。因为在早期已经学会了“深度钻研”的习惯,它不会发生崩溃;它会持续有效地使用工具来解决更难的问题。

结果:小而强大

这篇论文最令人惊讶的部分在于模型的规模。

  • 他们训练了一个相对较小的模型(40 亿参数)。
  • 类比: 这就像一辆小型、敏捷的赛车,因为它被教授了完美的驾驶技术,所以能在艰难的赛道上击败庞大、沉重的卡车(更大的 AI 模型)。
  • 得分: 在一场非常困难的数学竞赛(AIME 2025)中,这个小模型取得了 90.0% 的成绩,击败了像 DeepSeek-V3.2(拥有 6,710 亿参数)这样的大型模型,甚至击败了一些来自 OpenAI 的顶尖模型。

“秘诀”总结

论文声称,要让 AI 擅长处理长期的、困难的任务并使用工具,你不应该只是把它直接扔进深水区。相反:

  1. 不要担心眼前的完美: 最初的训练示例并不要求 AI 立即精通数学。
  2. 关注“流程”: 你必须在初始训练期间强制要求 AI 大量使用工具。
  3. 回报: 这会创造一种强大的习惯。当 AI 开始自主练习时,它会自然而然地保持使用工具,从而能够解决以前对它来说不可能解决的问题。

简而言之:教 AI 持续使用计算器,而不只是在最后才使用,它就会成为一名数学天才。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →