← 最新论文
🤖 AI

Recursive Synthesis for Long-Horizon Terminal Tasks

本文介绍了递归合成终端任务(Recursive Synthetic Terminal Tasks, RST),这是一个可扩展的框架,通过递归地生成并验证长程终端智能体任务,以低成本产生了 37,484 个高质量示例,在没有显示出收益递减迹象的情况下,显著提升了微调模型和智能体模型在挑战性基准测试上的性能。

原作者: Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人成为一名顶级技师。你不仅希望它知道扳手长什么样,还希望它能真正修理一台从未损坏过的汽车引擎。这就是“AI智能体”(AI agents)的世界——这些聪明的计算机程序不仅仅是与你聊天,它们还能实际地“做事”,比如输入命令、移动文件和修复软件漏洞。但大问题在于,这些机器人在处理长期、复杂的任务时表现得很糟糕。如果你要求它们盖一栋房子,它们可能会先铺一块砖,然后就陷入混乱。为了更好地教导它们,我们需要成千上万个练习题,让机器人尝试盖房子,失败,接受纠正,然后再次尝试。但制作这些练习题简直是一场噩梦。如果你亲手编写一个,成本极其高昂。如果你让计算机编写一个,它往往会制定出与工具不匹配的规则,或者创造出一个无法解决的谜题。这就像是要求一位厨师写一份蛋糕食谱,但食谱里要求的食材在厨房里并不存在,或者烤箱坏了。

由此,一种被称为**递归合成终端任务(Recursive Synthetic Terminal Tasks, RST)**的新方法诞生了。你可以把这看作是一个用于创建机器人训练谜题的“数字进化机”。研究人员并没有让通过人类来编写每一个问题,而是从一小堆经过验证、可以运行的谜题(即“种子”)开始,共计639个。然后,他们利用一个强大的AI来扮演一个调皮但才华横溢的游戏设计师。这个AI会观察一个正在运行的谜题,在解决方案中增加一个更难的新步骤(比如给引擎增加一个新齿轮),然后立即更新指令和“答案解析”以匹配这个新的、更难的版本。至关重要的一点是,在新的谜题被保存之前,它会被投入到一个数字沙盒中——一个安全的、隔离的计算机房间——以观察它是否真的可行。如果解决方案失败了,这个谜题就会被丢弃。如果成功了,它就会被保留下来,并作为下一轮更难谜题的种子。研究人员运行了这个循环15次。到最后,他们创造了近38,000个经过验证的新谜题。最棒的部分在于,这些谜题随着每一轮都在变得真正困难。中间阶段的谜题从需要67行代码来解决,增加到了需要374行。机器人必须输入的命令数量也从40个跳升到了244个。

结果是戏剧性的。当他们用这些谜题测试一个顶尖的AI求解器时,其成功率从第一轮简单任务时的90%下降到了第15轮时的仅2.5%。这证明了该系统不仅仅是在拉长指令,它实际上是在创造需要更深层思考和更多步骤的任务。但真正的魔法发生在他们使用这些谜题来训练另一个AI模型(Qwen3.5)时。在利用这些谜题生成的轨迹(逐步尝试的过程)进行训练后,该模型在解决现实世界终端任务方面的表现有了显著提升。在标准测试中,其性能提升了高达10个百分点;通过进一步的强化学习,根据测试的不同,性能又提升了20%到41%。最令人兴奋的发现是,该系统没有表现出停止的迹象。即使在进行了15轮不断加难的过程后,系统仍在持续产出有效且多样化的谜题,而没有崩溃成无意义的内容或重复同样的套路。这表明,我们或许能够生成无穷无尽的高质量训练数据,将原本昂贵、缓慢的人类教学过程,转变为一种快速、自动化且可扩展的进化过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →