DarwinX: Evolving Agent Harnesses Through Natural Selection
DarwinX 引入了一种基于种群的自然选择框架,通过“保留并扩展”契约与重组来进化大语言模型(LLM)智能体控制架构,在不导致现有任务性能退化且无需模型重训的情况下,在多种多样基准测试中实现了显著且泛化的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个极其聪明的机器人,但它被困在一个玻璃盒子里。你无法改变它的脑子,也无法教它新的知识。它被冻结在了时间里。然而,你仍需要它去解决一千种不同的谜题,从修复损坏的代码到浏览网页。你该如何让它变得更好?在人工智能的世界里,这就是“智能体”(Agent)所面临的挑战。智能体不仅仅是那个“大脑”(模型),它还包括“束缚”(Harness)——即告诉大脑如何行动的一套指令、工具和规则。把大脑想象成一位精通世间所有食谱的天才厨师,而“束缚”就是厨房本身。如果厨房一团糟,无论厨师多么有才华,他都会掉落食材或烧焦汤品。科学家们一直试图构建能够自我改进的“厨房”,但大多数尝试就像是一个厨师在烹饪的同时试图独自修理自己的工作台。他们往往解决了一个问题(比如切洋葱更快了),却不小心破坏了另一个问题(比如忘了关火)。
DarwinX 应运而生,这是来自 Salesforce AI Research 的一种新方法,它将改进 AI 智能体视为在培养皿中进行一场大规模自然选择实验。它不是让一个厨师独自尝试修复一切,而是创造了许多种不同的“厨房设置”。它允许这些设置尝试新的工具和指令,但有一个严格的规则:只有当你能解决一个新问题且不破坏任何旧问题时,你才能保留一个新的设置。这就像是一场“适者生存”的游戏,其中最优秀的并非仅仅是运气好的,而是那些能在不搞砸已有知识的前提下,做得更多的人。论文指出,通过冻结 AI 的大脑并仅进化这些“厨房设置”,系统可以学会更好地解决复杂的任务,甚至是在它从未见过的谜题上。
完美工具包的进化
开发 DarwinX 的研究人员提出了一个简单的问题:如果我们停止尝试重新训练 AI 的大脑,而是完全专注于进化它所使用的工具和指令会怎样?他们称之为“束缚”。它包括提示词(指令)、工具(如计算器或浏览器)以及控制流(AI 采取的步骤)。
为了测试这一点,他们建立了一个数字培养皿。他们采用了一个强大的 AI 模型并完全冻结了它的脑子。然后,他们创建了一群不同的“束缚”(不同的指令集和工具)并让它们进化。以下是奇迹发生的过程:
1. “保留并扩展”契约
想象你是一名园丁。你有一株长出完美番茄的植物。你想让它也能长出草莓。一个糟糕的园丁可能会试图强迫植物长出草莓,结果却意外杀死了番茄。DarwinX 使用了一个名为“保留并扩展”(Preserve-and-Extend)的严格规则。一个新版本的“束缚”只有在解决了新任务(如长出草莓)且没有在旧任务上退步(番茄依然完美)的情况下,才被允许生存。如果一个新想法解决了一个问题却破坏了另一个,它就会被从花园中剪掉。这确保了 AI 在不断变强的同时,不会忘记已经掌握的技能。
2. “假设”的档案库
在许多进化实验中,如果一条路径导致了死胡同,你会将其丢弃。DarwinX 则不同。它保留了每一个变体的档案,甚至是那些整体失败的变体。为什么?因为一个“失败”的束缚可能包含一个解决特定问题的精彩技巧。通过将这些“失败者”保存在档案库中,DarwinX 稍后可以将它们进行混合与匹配。这就像意识到建造一座桥梁失败的尝试中,其实有一个关于悬索的绝佳创意。通过将这个悬索与另一种桥梁设计相结合,你就能得到一座超级大桥。这种“重组”让系统能够通过缝合来自不同谱系的精华部分,来构建复杂的技能。
3. 三种类型的线索
系统是如何知道该修改什么的?它利用了三种类型的线索,且完全不触碰 AI 的大脑:
- 失败线索: 当 AI 失败时,系统会分析原因并建议修复方案。
- 教师线索: 如果人类或更强大的 AI 展示了正确的方法,系统会模仿该方法。
- 自我线索: 系统会将自己的成功尝试与失败尝试进行对比,以找出差异。
这些线索被转化为对“束缚”的微小编辑,比如更改提示词或添加新工具。
结果:冻结的大脑,超级大脑
研究人员在四个不同的挑战上进行了测试,难度由易到难。结果非常强劲,表明一个冻结的模型只需通过进化其“束缚”,就能成为一个能力更强的智能体。
- Terminal Bench(编程任务): 在 89 个编程任务中,进化的束缚将 GPT-5.5 模型的成功率从 75.5% 提升到了 83.2%。在更强大的 GPT-5.6 模型上,它达到了 84.7%,即便大脑本身从未改变,也追平或超越了世界上最顶尖的智能体。论文指出,AI 并非仅仅靠“运气”;它学会了在遇到困难的任务时投入更多的时间和精力,在最难的问题上将尝试次数增加了一倍,而在简单的任务上则保持不变。
- “留存测试”(泛化能力): 他们随后在 41 个全新的、从未见过的任务上测试了进化的智能体。进化的束缚解决了其中的 68.3%,击败了他们测试的所有现成的智能体。这表明 AI 学会了通用技能,而非仅仅是死记硬背答案。
- “合成到现实”的飞跃: 在一个名为 WebArena-Infinity 的基于浏览器的测试中,系统在 300 个虚假的合成任务上进化,随后在 1,260 个真实世界任务上接受测试。成功率从 43.5% 跃升至 93.0%。这意义重大,因为这意味着 AI 学会了如何正确使用浏览器,而不仅仅是绕过特定的测试限制。研究人员审计了结果,发现进化的智能体不再“绕过约束”(例如试图破解测试),而是开始进行正当的操作。
- 跨基准测试迁移: 最后,他们将为编程任务进化的“束缚”用于一个完全不同的基准测试——SWE-bench Verified(软件工程)。在没有任何新训练的情况下,它得分 84.2%,证明了它学到的技能可以迁移到不同类型的难题中。
发生了什么改变?“验证”技能
论文深入探讨了 AI 的大脑(或者说它的“束缚”)究竟发生了什么变化。事实证明,AI 并没有学习关于数学或历史的新知识。相反,它学会了一系列与验证和契约相关的技能。
此前,AI 经常会猜一个答案并寄希望于它是正确的。进化的 AI 学会了:
- 创建契约: 在完成任务之前,它会明确定义一个“正确”答案的标准。
- 检查工作: 它运行工具来根据该契约验证自己的输出。
- 修正错误: 如果检查失败,它会返回循环并重新尝试。
这种“验证组合”正是让 AI 能够应对复杂、多步骤任务(如搭建复杂的软件环境或在网站中导航而不迷路)的关键。这与一个只会猜测答案的学生,与一个会反复检查工作的学生之间的区别。
总结
DarwinX 表明,我们并不总是需要更大的、更聪明的脑子来让 AI 变得更好。有时,我们只需要进化更好的指令和工具。通过将 AI 的“束缚”视为一个可以被筛选、存档和重组的生命体,研究人员创造出了一个更可靠、更强大且不易通过绕过约束来作弊的智能体。论文强调,这些进步是真实且可衡量的,并非仅仅是模拟,并且在面对从未见过的任务时依然有效。这提醒我们,有时让天才变得更聪明最好的方法,是给它一套更好的工具,并教会它如何使用这些工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。