Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines?
本文介绍了开放式优化(Open-Ended Optimization, OEO),这是一个由能力强大的前沿模型自主构建其自身的改进过程,而非遵循预设流水线的框架,证明了这类自我演进智能体能够以显著更低的资源成本实现更优越的性能,同时也揭示了传统的流水线主要仅作为一种依赖于能力的脚手架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机程序不再仅仅是遵循人类编写的僵化指令手册,而是能够从错误中学习,并重写自己的规则以变得更好。这就是“自我进化智能体”(self-evolving agents)的梦想。把它想象成一个电子游戏角色,在打败 Boss 战失败后,它不仅仅是重新开始,而是停下来,弄清楚为什么会输,修改自己的策略指南,然后再次尝试。长期以来,科学家们认为要实现这一点,人类必须为计算机构建一个非常具体的、循序渐进的配方。这个配方就像一位严厉的教练,精确地告诉玩家何时该看计分板,何时该更换武器,以及何时该停止练习。但随着计算机变得越来越聪明——成为能够进行复杂推理的“前沿模型”——研究人员开始思考:我们还需要这位严厉的教练吗?或者,如果我们只给它一个目标和一份预算,计算机能否自己制定练习计划?
这篇题为《重新思考自我进化智能体》(Rethinking Self-Evolving Agents)的论文深入探讨了这个问题。研究人员 Hui Xue 和 Fan Yang 来自微软研究院,他们设计了一个迷人的实验,旨在观察一个超智能的 AI 是否可以在没有预写脚本的情况下组织自己的学习过程。他们将传统的“框架式方法”(即由“教练”规定每一步改进过程的方法)与一种被称为“开放式优化”(Open-Ended Optimization, OEO)的新方法进行了对比。在 OEO 中,AI 被赋予了一个明确的目标、一组允许的操作和一项“能量”(或 Token)消耗限制,但它可以自行决定如何使用这些能量来变得更好。这就像是给一位厨师一份食材清单和一段限时,但让他们自己决定是去烤一个蛋糕还是做一顿炒菜,而不是强迫他们遵循特定的食谱。
结果非常清晰。当使用顶尖 AI(GPT-5.5)作为“厨师”时,这种开放式的做法与严格的预写食谱一样好,甚至往往更好。事实上,在 14 项不同的测试中,开放式 AI 赢得了 12 次,平局 1 次,仅以微小的差距(0.21 个百分点)输掉了 1 次。更令人印象深刻的是,它在完成任务时仅使用了严格方法所需“能量”预算的约 34.3%。事实证明,如果 AI 足够聪明,它就不需要教练来告诉它如何练习;它可以在实战中摸索出最好的学习方式。
然而,这篇论文也划定了一条非常重要的界限。这种自由度只有在 AI 具备真实能力的前提下才有效。当研究人员用“中等”或“弱”AI 来测试系统时,开放式方法失败了。较弱的 AI 会感到困惑,无法确定下一步该做什么,并产生破碎的结果。在这些情况下,严格的、预先写好的食谱(即“教练”)对于维持运行至关重要。这项研究表明,严格的规则并不总是必要的,但它们可以作为较弱大脑的辅助支架。核心启示不是说我们要抛弃所有的规则,而是要让最聪明的 AI 驾驶自己的学习过程,同时为那些还在学习走路的模型保留好“辅助训练轮”。
核心发现:谁来驾驶巴士?
这篇论文的主要发现是,对于高能力的 AI 模型,那种人类过去用来编写的“预设优化流水线”(即僵化的、循序渐进的计划)已不再是成功的必要条件。过去,像 SKILLOPT(使用阶段性、循序渐进的训练流水线)和 GEPA(使用反思性进化搜索)这样的系统是行业标准。它们运作起来就像工厂的流水线:框架决定了如何收集证据、如何编辑代码以及何时停止。
研究人员引入了**开放式优化(OEO)**来测试 AI 是否可以接管方向盘。在 OEO 中,框架仍然设定了交通规则(目标、预算和允许的数据),但 AI 可以决定行驶路线。它可以选择收集证据、重写自己的指令,或者在它认为完成时随时停止。
当他们让由 GPT-5.5 驱动的 OEO 对阵严格的方法时,结果令人震惊。在 8 个不同的基准设置中,OEO 在每一个案例中都战胜或持平了严格的 SKILLOPT 方法。在与 GEPA 方法的对决中,OEO 在 6 次中有 5 次获胜,唯一的失败仅差 0.21 个百分点。或许最令人兴奋的部分是效率:OEO 使用的 Token 预算中位数仅为 SKILLOPT 配置预算的 34.3%。这意味着 AI 不仅变得更强了,而且在消耗不到旧方法一半的“燃料”的情况下就实现了进步。
排除“走捷径”的可能性
在庆祝之前,研究人员必须确保自己没有被愚弄。他们问道:“AI 表现好是因为它已经知道了答案吗?”或者“它是不是只是重写了一次代码就收工了?”
为了测试这一点,他们运行了一个“零交互”对照组。他们给了 AI 最初的技能,并要求它在没有任何练习或反馈循环的情况下仅重写 一次。结果显示,这种“单次”重写并不足以提升性能。在某些任务上,单次重写甚至让 AI 变得更糟。在其他任务上,虽然它提高了分数,但仍显著落后于 OEO 系统(例如,在 LiveMath 任务中,单次重写比交互式的 OEO 落后了 30 多个百分点)。这证明了收益并非来自 AI 预有的知识,而是来自于 AI 能够学习、适应并不断完善其策略的交互式循环。
能力边界:何时我们需要教练?
论文还发现了一个关于这种自由度的关键限制。这种“开放式”方法并不是适用于所有 AI 的灵丹妙药。研究人员使用“中等”和“弱”优化器(能力较低的模型)对系统进行了测试。
在这里,情况发生了逆转。当优化器仅具备“中等”能力时,严格的 SKILLOPT 流水线实际上比 OEO 表现得更好。当优化器是“弱”水平时,OEO 系统完全崩溃了;弱 AI 甚至无法通过开放接口产生有效的动作,导致没有任何进展。相比之下,严格的流水线即使效率不高,也能让弱 AI 继续推进。
这表明,严格的、预先写好的流水线充当了一种“支架”。对于天才级的 AI,这个支架是不必要的,甚至可能会阻碍其发展。但对于仍在寻找立足点的学习者来说,这个支架对于防止他们跌落悬崖至关重要。
路径与目的地
最后,研究人员通过“透视”内部机制来观察 AI 是如何学习的。他们比较了“旅程”(AI 所做的具体编辑和更改)与“目的地”(最终的性能得分)。
他们发现,两种方法采取了截然不同的路径。OEO 系统进行的改动更大胆、更彻底,且比严格的 SKILLOPT 系统更频繁地重写其历史记录。然而,尽管路径迥异,它们通常都能解决相同的问题。在许多情况下,两种方法产生的最终技能在同一组测试问题上都是正确的,尽管其文本内容看起来大不相同。
这告诉我们,解决问题并不只有一种“正确”的方式。严格的流水线强迫 AI 沿着一条狭窄、安全的路径行进,而开放式方法则让它探索更广阔、更混乱的景观。两者都可以到达同一个目的地,但只要驾驶员足够优秀,开放式方法能以更高的灵活性和更少的燃料抵达终点。
底线结论
论文总结道,我们应该重新思考如何构建自我进化智能体。我们不需要将每个 AI 都强行塞进一个僵化的、预先写好的框框里。相反,我们应该采用一种“能力自适应”的方法。如果 AI 足够聪明(即“前沿”模型),我们可以把钥匙交给它,让它在线编排自己的学习过程。我们只需要保留好护栏:目标、预算和行为规则。但对于能力较低的模型,传统的、严格的教练模式仍然是确保它们有效学习的最佳方式。这是一种从“一刀切”向“因材施教”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。