← 最新论文
🤖 AI

BONSAI: Evolvability-Guided Tree Search over Skills

BONSAI 是一种针对冻结智能体的创新技能优化框架,它采用演化引导的蒙特卡洛树搜索来区分过拟合峰值与可改进平台,在留出准确率方面显著优于现有基准。

原作者: Yash Priya Shastri, Anand Eswaran, Adnan Qidwai, Pankaj Thorat, Sachin Joshi

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yash Priya Shastri, Anand Eswaran, Adnan Qidwai, Pankaj Thorat, Sachin Joshi

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人完成一项复杂的任务,比如修复一个电子表格或解决一个棘手的数学问题。但问题在于,这个机器人是“冻结”的。它的脑部结构被锁定了;你无法重新训练它、调整它的神经元,也无法让它像人类学生那样从错误中学习。让它变得更优秀的唯一方法,就是用纯英文为它编写一套指令——一种“技能”。请将这种技能视为不仅仅是一个简单的命令,而是一本详细的操作手册,告诉机器人应该抓取哪些工具、需要避开哪些陷坑,以及在提交答案前如何进行自我检查。

核心问题在于:如何编写一份“完美”的手册?如果你只是尝试进行一些改动、测试、然后保留有效的结果,你可能会陷入困境。这就像是在登山,而地图只显示你当前的海拔高度。你可能会到达一个看起来很高但却极其狭窄、尖锐的山峰,那里非常危险,只要迈出下一步就可能坠入深渊。或者,你可能处于一个宽阔平缓的高原上,每向前走一步都会向更高处迈进,但仅凭当前的高度,你无法分辨两者的区别。这篇论文介绍了一种导航这种景观的新方法,它借鉴了生物学中的一个概念——“进化能力”(evolvability),即一条路径即使在你走错路时也能持续产生良好结果的能力。


问题所在:被“尖锐山峰”困住的陷阱

IBM Research 的研究人员注意到,我们通常改进这些 AI 手册的方式存在缺陷。标准的方法很简单:拿出一份手册,让 AI 重写它,测试新版本,如果分数提高了,就保留它;如果分数下降了,就丢弃它。

问题的症结在于这种方法是“盲目的”。它只关注当前手册的分数。它无法区分一份手册是位于一个宽阔的高原(一个安全、稳定的区域,微小的改变通常会带来更好的结果),还是位于一个狭窄且过拟合的尖峰(一个脆弱的山峰,虽然分数很高,但任何微小的变动都会导致分数崩塌)。如果你处于一个尖峰之上,下一次编辑可能会修复一个小错误,却破坏掉十个原本运作完美的环节。标准的方法会不断走向悬崖,因为它只看到了高分,却没看到危险。

解决方案:BONSAI 与“进化能力”指南针

为了解决这个问题,团队创建了一个名为 BONSAI 的新框架。与其仅仅观察一份手册目前有多好,BONSAI 会追问:“这份手册周围的邻里环境如何?”

他们使用了一个精妙的自然界隐喻:进化能力。在生物学中,衡量一个物种的标准不仅在于它今天是否能生存,还在于它未来持续产生有用后代的能力。处于“宽阔高原”上的物种可以通过突变并依然生存;而处于“尖锐山峰”上的物种,只要发生一点点变化就会灭绝。

BONSAI 将寻找完美手册的过程比作种树:

  1. 树木: 它从一个“种子”手册开始。
  2. 树枝: 每当 AI 尝试重写手册时,它就会长出一个新的分支(子节点)。
  3. 指南针: 在决定下一步探索哪个分支时,BONSAI 不仅仅选择那个拥有最高分数的分支。它会选择那个看起来更有“未来”的分支。它计算一个被称为进化能力的分数,这基本上是该手册所做的所有微小变化(突变)的平均得分。

如果一份手册位于“尖峰”上,它的邻居们得分会很差,因此其进化能力得分就会很低。BONSAI 会避开它。如果一份手册位于“高原”上,它的邻居们得分也会很好,因此其进化能力得分就会很高。BONSAI 会深入探索这些安全且富有成效的区域。

它是如何运作的:“嫁接”技巧

研究人员还添加了一个名为 GRAFT 的特殊功能。想象你有两个树枝:一个分支学习了如何处理“数学问题”,另一个分支学习了如何处理“电子表格”。它们在不同的路径上,互不往来。

通常情况下,AI 无法结合这些技能,因为它一次只能观察一份手册。但 GRAFT 允许 AI 窥视“数学”分支,看到其中奏效的技巧,并将该技巧复制到“电子表格”手册中。这就像园丁从一棵树上取下一段强壮的枝条,将其嫁接到另一棵树上,赋予其新的力量。这一过程不会破坏树的结构,从而允许 AI 从不同部分的搜索中混合并搭配最佳创意。

实验结果:攀登得更高

团队在三个不同的挑战上测试了 BONSAI:

  1. SpreadsheetBench: 修复 Excel 文件。
  2. SearchQA: 利用搜索结果回答测验问题。
  3. LiveMathematicianBench: 解决数学问题。

他们使用了一个拥有 300 亿参数的冻结 AI 智能体(作为“执行者”),以及一个专门编写手册的 AI(作为“优化器”)。他们将 BONSAI 与另外两种方法(GEPASkillOpt)进行了对比,并确保所有方法使用的计算资源(即“预算”)是相同的。

结果非常明确:

  • SpreadsheetBench 上,BONSAI 比初始手册提高了 5.71 个百分点,并击败了最强的竞争对手(GETA)2.14 个百分点
  • SearchQA 上,它比初始手册提高了 6.57 个百分点
  • LiveMathematicianBench 上,差距巨大。BONSAI 达到了 64.91% 的准确率,而初始手册仅为 28.23%,竞争对手 GEPA 为 56.14%

研究人员发现,当他们关闭“进化能力”指南针,仅仅让 AI 贪婪地追求最高分(像旧方法那样)时,AI 会很早就卡在那些“尖锐山峰”上并停止改进。然而,BONSAI 则能在更深的搜索中持续找到更好的解决方案,因为它知道哪些路径是安全的。

总结

本文表明,要让冻结的 AI 智能体变得更聪明,我们不应仅仅寻找眼前的最高分,而应寻找最有潜力的邻里环境。通过使用一种重视稳定性与未来潜力(进化能力)而非眼前短暂且脆弱之获的树搜索方法,BONSAI 找到了更好的指令供 AI 遵循。它不需要重新训练 AI 的大脑;它只需要写出一份更好的操作手册,并且通过识别哪些路径是安全的,它成功做到了这一点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →