← 最新论文
🤖 AI

Cross-Benchmark Generalization in Long-Horizon Agents

本文表明,通过使用两阶段的“先监督微调后强化学习”流水线,在多样化的长程任务上对大语言模型进行后训练,且无需任何外部基准数据或奖励,能够通过培养诸如谨慎的目标形成和状态管理等可迁移的行为策略,显著提升其在多个未见基准测试中的表现。

原作者: Sushant Mehta, Logan Ritchie, Liudas Panavas, Edwin Chen

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Sushant Mehta, Logan Ritchie, Liudas Panavas, Edwin Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

最伟大的 AI 侦探:如何教机器人思考,而不只是投机取巧

想象一下,你正在教一位聪明但顽皮的学生如何解决一个复杂的迷宫。如果你只让他练习一个布局非常可预测的特定迷宫,他可能学不到如何导航;相反,他可能只是记住了“在红砖处左转总能通向出口”。他并没有学会导航这项技能,他只是学会了一个针对那个特定房间的小窍门。这在人工智能(AI)领域是一个巨大的问题,特别是对于“智能体”(agents)——即旨在执行诸如预订机票、编写代码或整理文件等任务的程序。这些智能体经常通过利用测试环境中微小的、偶然的线索(例如计算机计分的一种特定方式或指令中的奇怪模式)来在训练任务中表现出色。

科学家们提出的核心问题是:我们能否教会 AI 一种真正的“工作方式”,从而帮助它解决从未见过的难题?这就像是一个只会背诵练习题答案的学生,与一个真正理解了数学逻辑、从而能解决全新类型问题的学生之间的区别。这篇论文深入探讨了这个谜团。它提出了这样一个问题:如果我们对一个 AI 进行一系列办公类任务(如管理日历和电子表格)的训练,它是否真的会变得更擅长处理完全不同的工作(比如修复计算机代码),还是说它仅仅学会了如何投机取巧地完成办公任务?

实验:在办公混乱中训练数字实习生

Surge AI 的研究人员决定用一个名为 Qwen3.5 的大型开源 AI 模型来验证这个想法。你可以把这个模型看作是一个超级聪明的数字实习生。他们希望看看能否通过一组包含 363 个复杂长程任务(涉及 27 个不同职业类别,如使用电子表格、管理日历、浏览网页和处理文件)来训练这位实习生。他们使用了一个称为“模型上下文协议”(Model Context Protocol, MCP)的系统,这就像是给了实习生一个巨大的工具箱,里面装满了各种可以与之交互的应用软件。

至关重要的一点是,他们确保这位实习生在训练过程中从未接触过任何软件工程任务(如修复代码中的漏洞)。目标是观察学习成为一名优秀的办公助理,是否会无意中让这位实习生也变得更擅长编程。为此,他们采用了两步训练法:首先,向实习生展示如何解决这些办公任务的示例(监督微调);然后,让他们自主尝试这些任务,并根据其表现给予奖励,从而鼓励它们摸索出最佳的工作方式(强化学习)。

结果:惊喜的升级

当研究人员测试这位经过训练后的实习生时,结果令人惊喜。尽管实习生从未练习过编程,但它在软件工程基准测试中的表现有了显著提升。具体而言,它在两个主要的编程测试 SWE-Bench Pro 和 Terminal-Bench 2 上的表现分别提高了 5.8 个百分点和 2.8 个百分点。它在其他工具使用测试(如 Toolathlon 和 BFCL-V4)中也取得了进步。

作者谨慎地指出,这并不是万灵药,也不是已解决的问题。他们只进行了一次实验,因此无法 100% 在统计学上确定这些数字在重复实验时不会发生变化。然而,该模型在包括从未训练过的任务在内的五项不同外部测试中都取得了进步,这表明确实发生了某些真实的变化。模型不仅仅是死记硬背了办公任务,它似乎学到了一种更好的“工作风格”。

“如何做到”:四种新习惯

这篇论文最令人兴奋的部分不仅在于分数,还在于“为什么”。研究人员仔细观察了受训模型与未受训模型之间的行为差异,就像侦探对比两名嫌疑人的不在场证明一样。他们发现,在办公任务和编程任务中都出现了四种特定的行为变化:

  1. 更好的目标设定:经过训练的模型更擅长将一个宏大且棘手的任务分解为细小且正确的步骤。它不再盲目猜测要做什么,而是观察当前情况并形成精确的局部目标。例如,如果它需要计算增长率,它会在开始之前确保自己正确理解了数据,而不是直接套用公式。
  2. 构建更好的心理地图:当模型遇到新信息时,它会在脑海中构建一个更准确的“工作状态”。如果它看到一个文件或工具输出,它会利用这些信息来引导下一步行动,而不是忽略或忘记它。这就像一位厨师在加盐之前会先尝一下酱汁的味道,而不是盲目遵循食谱。
  3. 坚持到底:当情况出错时(这种情况经常发生),经过训练的模型能更好地在不偏离大局的前提下修复小错误。如果它在修复漏洞时打错了一个字母,它会修正这个字母,同时记住主要目标仍然是保持程序运行,而不是因为出错而感到困惑并改变整个程序。
  4. 检查工作:经过训练的模型在说“我完成了”之前,更有可能验证自己的工作。在编程测试中,受训模型会运行正式测试来检查其更改是否生效,而未受训的模型通常只是假设自己是对的。受训模型运行测试的频率从 37.5% 提升到了 73.3%。

这意味着什么

论文指出,通过在需要使用多种不同工具的复杂、长程任务上训练 AI,我们可以教会它一种能够迁移到完全不同领域的“工作方式”。这就像教一个人如何整理一个杂乱的库房;如果他们学会了系统化、细致且彻底的工作方式,即使从未练习过书籍整理,他们也可能会出人意料地成为一名优秀的图书馆管理员。

然而,作者也坦诚地说明了局限性。他们承认,部分进步可能仅仅是因为他们鼓励模型“更加努力”且不要轻易放弃。他们并未证明模型在大脑内部究竟是如何习得这些习惯的,而且他们只进行了一次实验。但证据指向了一个充满希望的想法:如果我们设计的训练环境能迫使 AI 进行仔细思考并验证其工作,我们或许就能创造出真正更聪明、更具适应性的智能体,而不仅仅是更擅长投机取巧的程序。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →