← 最新论文
🤖 AI

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

Argus 是一个通用型、固定权重的智能体运行时,通过利用由专门角色管理的持久且自我演进的状态,来自主验证、恢复并优化任务轨迹,从而在多种基准测试中实现了卓越的长程推理性能。

原作者: Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang
发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang, Shibo Hu, Hangxi Guo, Yilin Chen, Yuzhe Zhang, Fan Yang, Chuan Wen, Xian Zhang, Xuanhe Zhou, Zhijie Deng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长程侦探:为什么 AI 需要记忆与教练

想象一下,你正在试图解决一个巨大的、跨越数日的谜题,比如研究如何从零开始制造一台可以工作的机器人,或者写一部逻辑自洽的小说。如果你是几年前的计算机程序,你可能会尝试通过阅读指令、做出猜测,然后在尝试下一次之前立即忘记刚才所做的一切来解决问题。这就是许多早期 AI“智能体”(agents)的工作方式:它们就像一个侦探,每解开一个线索就经历一次彻底的失忆,每次遇到死胡同时都必须从头开始整个调查过程。它们阅读速度很快,但在长期学习自身错误方面表现得很差。

“长程推理”(long-horizon reasoning)领域的核心正是解决这个问题。它在追问:如何让 AI 能够维持一个持续数天甚至数周的计划,记住昨天尝试过的方法,并在意识到自己走错路时改变策略?这里的关键理念是:聪明不仅仅在于拥有一个大脑袋(强大的模型),还在于拥有一本好的笔记本(持久化记忆)和一位严格的教练(验证机制),后者能在你陷入困境并试图自我欺骗时阻止你。这篇论文探讨了如何构建一个不仅不会原地打转,而且能够随着时间的推移不断进化自身方法的 AI 系统,使其无需从头开始重新训练就能变得更擅长解决难题。


认识 Argus:学会转向的 AI

认识一下 Argus,一种新型的 AI “运行时”(runtime,可以将其理解为运行 AI 大脑的操作系统的或引擎)。Argus 背后的研究人员——来自微软及多所顶尖大学的一个团队——意识到,要让 AI 处理真正困难的长期项目,它不能只是盲目地向前推进。如果 AI 试图修复巨型软件代码库中的一个漏洞,或者证明一个复杂的数学定理,它可能会花费数小时走入一条死胡同。普通的 AI 可能会继续硬推,从而浪费时间和精力。Argونها 不同:它被设计为能够转向(pivot)

把 Argus 想象成一个在共享办公室里工作的组织严密的科研团队,而不是一个人在孤军奋战。这个团队有四个截然不同的角色,且职责绝不混淆:

  1. 经理(The Manager): 掌控全局的老板。他们确保团队专注于最初的目标(例如“建造机器人”),即使日常计划发生了变化。
  2. 规划者(The Planner): 战略家,负责将宏大目标分解为当天可执行的小任务。
  3. 工程师(The Engineer): 建设者,负责实际编写代码、进行实验或进行数学运算。
  4. 评审员(The Reviewer): 严格的质量控制检查员。他们的工作是查看工程师构建的内容,并给出评价:“这很好”、“这需要修正”或“停下,这条路是死胡同”。

Argus 的魔力在于它将失败视为数据。当工程师尝试某种方法失败时,评审员不仅仅是说一句“哎呀”。他们会记录下失败的具体原因。这些记录被保存在一个永久性的“项目状态”(团队的共享笔记本)中。随后,如果团队再次尝试走那条死胡同,系统会记得:“嘿,我们昨天试过这个方法,行不通,”并转向一个新的想法。这被称为验证引导的持久性(verification-guided persistence)。系统只有在评审员验证新信息确实真实且有用时,才会进行“学习”(更新其记忆)。

他们的发现:更擅长修复代码与撰写论文

团队在一些极具挑战性的任务上测试了 Argus,以观察这种“带有记忆的团队”方法是否真的有效。

1. 代码修复测试 (SWE-Bench Pro)
他们给 Argus 提供了 731 个真实的软件漏洞进行修复。这就像是给一名程序员一个混乱、破碎的代码库,并要求他们在没有人类帮助的情况下修复它。

  • 结果: Argus 成功修复了约 78% 的漏洞。
  • 对比: 标准的 AI 工具(Direct Copilot)仅能修复其中的 59%
  • 成本: Argus 使用了标准工具约 1.41 倍 的计算“Token”(思考的基本单位)。
  • 启示: 尽管 Argus 思考得稍多一些,但其准确度显著提高。这证明了花时间检查工作并记住过去的错误是值得的。

2. “变得更聪明”测试 (自我进化)
这是最酷的部分。研究人员观察了 Argus 随时间变化的过程。他们并没有改变 AI 的大脑(模型权重保持完全不变)。相反,他们只是让系统建立起其技能和记忆的“笔记本”。

  • 结果: 随着系统运行更多任务并用经过验证的技能填满其笔记本,它变得更快、更便宜。在测试的后期阶段,与刚开始时相比,Argent 每项任务使用的 Token 减少了 21%,时间也减少了 15%
  • 含义: AI 不需要通过重新训练来变得更好;它只需要记住它学到的东西。它进化了自己的“运行时状态”,在不改变其基本大脑的情况下,成为了一个更高效的劳动者。

3. “不要自我欺骗”测试 (评审员干预)
团队追踪了评审员介入的频率。在 731 个任务中,评审员被调用了 466 次。

  • 营救:43 个案例中,评审员表示:“这还没完成,再试一次。”在工程师再次尝试后,其中 34 个任务被成功修复,且有 22 个任务因修复得非常好而通过了第二次更严格的评审。
  • 拦截: 评审员还阻止了系统对 35 个实际上不可能实现或已损坏的任务宣布胜利。这非常重要:这意味着系统学会了在无法做到时说“我做不到”,而不是产生虚假的幻觉解决方案。

超越代码:数学、芯片与论文

Argus 的能力并不止于修复代码。团队展示了它也能处理其他“长程”任务:

  • 数学研究: 在证明一个复杂数学定理的过程中,Argus 记录了一条被证明为错误的路径(“证伪路径”)。它没有删除这条路径,而是将其作为“禁止进入”的标志保留了下来。这有助于系统在以后避开该死胡同,并成功强化了定理的边界。
  • 撰写论文: 他们运行了六个不同的研究项目来撰写科学论文。系统处理了 254 个任务,经历了 16 次重大回溯(即必须返回并更改整个计划),并最终完成了全部六篇论文。其中一个项目甚至将一个失败的想法转化为了成功的“负面结果”研究,证明了有时发现什么行不通也是一种有效的科学发现。
  • 设计芯片: 在一项极具挑战性的测试中,Argus 设计了一块计算机芯片(ACE-2)。系统编写了代码,检查了时序,最终设计通过了所有严格的硬件检查。系统甚至清楚地列出了它未进行检查的内容(例如芯片在现实环境中的实际运作情况),并清晰地标注了这些局限性。

核心结论

Argus 表明,对于要从事真正的长期工作的 AI 而言,仅仅拥有一个大脑袋是不够的。它需要一个系统,该系统能将“老板”与“工人”分离,保留关于成功与失败的永久记录,并拥有一个严格的“评审员”来防止其编造答案。

论文指出,通过使用这种“基于验证的门控”方法,AI 可以解决更难的问题,在无需重新训练的情况下实现自我进化,甚至在陷入困境时承认自己的局限。它不是一个能瞬间解决一切的魔杖,而是迈出了重要的一步,旨在构建一种能够与我们在复杂、长期的现实挑战中并肩作战、能够坚持、能够转向并能进化自身方法的 AI。正如作者所言,这不仅仅是为了在测试中获得更高分,更是为了构建一个能够应对现实世界中混乱、长期挑战的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →