Harnessing Agentic Evolution
本文介绍了 AEvo,这是一个元编辑框架,它将智能体进化视为一个交互式环境,其中元智能体基于累积上下文对进化过程本身进行编辑,从而统一了刚性与灵活的方法,在长视野搜索与优化任务中实现了最先进性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试解决一个非常棘手的谜题,比如寻找将圆形完美装入正方形的最佳方案,或者编写一个运行速度极快的计算机程序。你有一位聪明的助手(一个 AI 智能体)来帮助你。
旧方法:两种有缺陷的途径
在这篇论文之前,人们反复利用 AI 解决这些问题主要有两种方法:
- 僵化的机器人:你给 AI 一本严格且不可更改的规则手册。“尝试这个,检查分数,如果不好,就尝试那个。”它很可靠,但如果规则手册陷入死循环,机器人就会永远重复做同样的无用之事。它无法从错误中学习以改变其工作方式。
- 放养的 genius(天才):你给 AI 一个总体目标,让它自行决定其余部分。它非常灵活且富有创造力。但当它尝试成千上万种方案时,会变得困惑。它可能会忘记什么有效,被糟糕的想法分散注意力,或者因为认为自己已经完成而过早放弃。它拥有过多的自由,却缺乏足够的结构。
这两种方法都收集了大量数据:失败的尝试、成功的案例以及笔记。但它们缺乏一种方法来审视所有这些数据集,并说:“嘿,我们这样做的方式行不通。让我们改变规则。”
新方法:AEVO(“教练”系统)
作者引入了AEVO(智能体进化)。他们将整个解决问题的过程不仅仅视为 AI 的任务,而是视为一个“元智能体”(即教练)正在游玩的游戏关卡。
以下是通过一个简单类比来解释其工作原理:
- 玩家(进化智能体):这是试图解决谜题的 AI。它生成候选方案(解决方案),接受评分,然后再次尝试。
- 游戏棋盘(环境):这里存储了游戏的所有历史——失败的尝试、分数、笔记以及当前状态。它就像记分牌和回放录像带的结合体。
- 教练(元智能体):这是 AEVO 中特殊的 AI。教练并非试图自己解决谜题,而是观察玩家。
- 转折点:教练不只是说“更努力一点”。相反,它编辑规则手册或更改玩家的训练手册。
- 如果玩家因为盯着谜题的错误部分而不断失败,教练会重写指令,告诉玩家看向别处。
- 如果玩家在浪费时间,教练会改变策略,专注于有效的方法。
“缰绳”:安全网
论文强调了一种“受控”的设计。想象玩家是一匹野马。缰绳就是马厩和缰绳。
- 它保护“裁判”(评估器),防止玩家作弊或操纵分数。
- 它保存每一次尝试的完美、有序的记录,以便教练能看到全局。
- 它确保当教练改变规则时,这些更改能够安全且清晰地应用。
尝试后的结果如何?
研究人员在三种类型的挑战上测试了该系统:
- 标准逻辑谜题:(如 ARC-AGI-2)。
- 终端任务:(如在命令行中修复计算机代码)。
- 开放式优化:(如让计算机程序运行得尽可能快)。
结果:
- 更高的分数:AEVO 击败了其他五种顶尖方法。在标准逻辑测试中,与现有最佳方法相比,其性能提升了26%。
- 更快的优化:在开放式任务中,即使在相同的时间和资金(计算能力)限制下,它也发现了比其他方法更好的解决方案。
- 突破瓶颈:当其他方法陷入停滞(即遇到无法提升的“瓶颈”)时,AEVO 的教练会介入,意识到当前策略正在失效,并重写策略以突破壁垒。
总结
将 AEVO 想象为一个系统:你不仅仅是雇佣一名工人来工作,而是雇佣一位教练,他观察工人,回顾比赛录像,然后重写工人的职位描述以使其变得更好。它将混乱的试错过程转化为一个结构化的学习循环,其中搜索的方法变得比答案本身更聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。