Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning
Argus 是一个通用型、固定权重的智能体运行时,通过利用由专门角色管理的持久且自我演进的状态,来自主验证、恢复并优化任务轨迹,从而在多种基准测试中实现了卓越的长程推理性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长程侦探:为什么 AI 需要记忆与教练
想象一下,你正在试图解决一个巨大的、跨越数日的谜题,比如研究如何从零开始制造一台可以工作的机器人,或者写一部逻辑自洽的小说。如果你是几年前的计算机程序,你可能会尝试通过阅读指令、做出猜测,然后在尝试下一次之前立即忘记刚才所做的一切来解决问题。这就是许多早期 AI“智能体”(agents)的工作方式:它们就像一个侦探,每解开一个线索就经历一次彻底的失忆,每次遇到死胡同时都必须从头开始整个调查过程。它们阅读速度很快,但在长期学习自身错误方面表现得很差。
“长程推理”(long-horizon reasoning)领域的核心正是解决这个问题。它在追问:如何让 AI 能够维持一个持续数天甚至数周的计划,记住昨天尝试过的方法,并在意识到自己走错路时改变策略?这里的关键理念是:聪明不仅仅在于拥有一个大脑袋(强大的模型),还在于拥有一本好的笔记本(持久化记忆)和一位严格的教练(验证机制),后者能在你陷入困境并试图自我欺骗时阻止你。这篇论文探讨了如何构建一个不仅不会原地打转,而且能够随着时间的推移不断进化自身方法的 AI 系统,使其无需从头开始重新训练就能变得更擅长解决难题。
认识 Argus:学会转向的 AI
认识一下 Argus,一种新型的 AI “运行时”(runtime,可以将其理解为运行 AI 大脑的操作系统的或引擎)。Argus 背后的研究人员——来自微软及多所顶尖大学的一个团队——意识到,要让 AI 处理真正困难的长期项目,它不能只是盲目地向前推进。如果 AI 试图修复巨型软件代码库中的一个漏洞,或者证明一个复杂的数学定理,它可能会花费数小时走入一条死胡同。普通的 AI 可能会继续硬推,从而浪费时间和精力。Argونها 不同:它被设计为能够转向(pivot)。
把 Argus 想象成一个在共享办公室里工作的组织严密的科研团队,而不是一个人在孤军奋战。这个团队有四个截然不同的角色,且职责绝不混淆:
- 经理(The Manager): 掌控全局的老板。他们确保团队专注于最初的目标(例如“建造机器人”),即使日常计划发生了变化。
- 规划者(The Planner): 战略家,负责将宏大目标分解为当天可执行的小任务。
- 工程师(The Engineer): 建设者,负责实际编写代码、进行实验或进行数学运算。
- 评审员(The Reviewer): 严格的质量控制检查员。他们的工作是查看工程师构建的内容,并给出评价:“这很好”、“这需要修正”或“停下,这条路是死胡同”。
Argus 的魔力在于它将失败视为数据。当工程师尝试某种方法失败时,评审员不仅仅是说一句“哎呀”。他们会记录下失败的具体原因。这些记录被保存在一个永久性的“项目状态”(团队的共享笔记本)中。随后,如果团队再次尝试走那条死胡同,系统会记得:“嘿,我们昨天试过这个方法,行不通,”并转向一个新的想法。这被称为验证引导的持久性(verification-guided persistence)。系统只有在评审员验证新信息确实真实且有用时,才会进行“学习”(更新其记忆)。
他们的发现:更擅长修复代码与撰写论文
团队在一些极具挑战性的任务上测试了 Argus,以观察这种“带有记忆的团队”方法是否真的有效。
1. 代码修复测试 (SWE-Bench Pro)
他们给 Argus 提供了 731 个真实的软件漏洞进行修复。这就像是给一名程序员一个混乱、破碎的代码库,并要求他们在没有人类帮助的情况下修复它。
- 结果: Argus 成功修复了约 78% 的漏洞。
- 对比: 标准的 AI 工具(Direct Copilot)仅能修复其中的 59%。
- 成本: Argus 使用了标准工具约 1.41 倍 的计算“Token”(思考的基本单位)。
- 启示: 尽管 Argus 思考得稍多一些,但其准确度显著提高。这证明了花时间检查工作并记住过去的错误是值得的。
2. “变得更聪明”测试 (自我进化)
这是最酷的部分。研究人员观察了 Argus 随时间变化的过程。他们并没有改变 AI 的大脑(模型权重保持完全不变)。相反,他们只是让系统建立起其技能和记忆的“笔记本”。
- 结果: 随着系统运行更多任务并用经过验证的技能填满其笔记本,它变得更快、更便宜。在测试的后期阶段,与刚开始时相比,Argent 每项任务使用的 Token 减少了 21%,时间也减少了 15%。
- 含义: AI 不需要通过重新训练来变得更好;它只需要记住它学到的东西。它进化了自己的“运行时状态”,在不改变其基本大脑的情况下,成为了一个更高效的劳动者。
3. “不要自我欺骗”测试 (评审员干预)
团队追踪了评审员介入的频率。在 731 个任务中,评审员被调用了 466 次。
- 营救: 在 43 个案例中,评审员表示:“这还没完成,再试一次。”在工程师再次尝试后,其中 34 个任务被成功修复,且有 22 个任务因修复得非常好而通过了第二次更严格的评审。
- 拦截: 评审员还阻止了系统对 35 个实际上不可能实现或已损坏的任务宣布胜利。这非常重要:这意味着系统学会了在无法做到时说“我做不到”,而不是产生虚假的幻觉解决方案。
超越代码:数学、芯片与论文
Argus 的能力并不止于修复代码。团队展示了它也能处理其他“长程”任务:
- 数学研究: 在证明一个复杂数学定理的过程中,Argus 记录了一条被证明为错误的路径(“证伪路径”)。它没有删除这条路径,而是将其作为“禁止进入”的标志保留了下来。这有助于系统在以后避开该死胡同,并成功强化了定理的边界。
- 撰写论文: 他们运行了六个不同的研究项目来撰写科学论文。系统处理了 254 个任务,经历了 16 次重大回溯(即必须返回并更改整个计划),并最终完成了全部六篇论文。其中一个项目甚至将一个失败的想法转化为了成功的“负面结果”研究,证明了有时发现什么行不通也是一种有效的科学发现。
- 设计芯片: 在一项极具挑战性的测试中,Argus 设计了一块计算机芯片(ACE-2)。系统编写了代码,检查了时序,最终设计通过了所有严格的硬件检查。系统甚至清楚地列出了它未进行检查的内容(例如芯片在现实环境中的实际运作情况),并清晰地标注了这些局限性。
核心结论
Argus 表明,对于要从事真正的长期工作的 AI 而言,仅仅拥有一个大脑袋是不够的。它需要一个系统,该系统能将“老板”与“工人”分离,保留关于成功与失败的永久记录,并拥有一个严格的“评审员”来防止其编造答案。
论文指出,通过使用这种“基于验证的门控”方法,AI 可以解决更难的问题,在无需重新训练的情况下实现自我进化,甚至在陷入困境时承认自己的局限。它不是一个能瞬间解决一切的魔杖,而是迈出了重要的一步,旨在构建一种能够与我们在复杂、长期的现实挑战中并肩作战、能够坚持、能够转向并能进化自身方法的 AI。正如作者所言,这不仅仅是为了在测试中获得更高分,更是为了构建一个能够应对现实世界中混乱、长期挑战的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。