💬 NLP
AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection
本文介绍了 AdaptEvolve,这是一个通过基于内在生成置信度为每个优化步骤动态选择最恰当的大语言模型,从而在保持高精度的同时将推理成本降低近 38% 以提升进化式人工智能代理效率的框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在举办一场高风险的编程竞赛,目标是解决复杂的编程谜题。你有两类评委可供协助:
- 初级实习生(小模型):速度快、成本低,擅长处理常规任务。然而,面对真正困难、棘手的难题时,他们可能会卡住或犯错。
- 资深专家(大模型):极其聪明,有能力解决最难的谜题,但他们速度慢、雇佣成本高,且给出答案需要很长时间。
问题所在:
在传统的“进化式”AI 系统(即 AI 尝试、失败、学习、再尝试)中,系统通常只选择一位评委并贯穿整个流程。
- 如果只使用实习生,你能省钱,但可能永远无法解决最难的谜题。
- 如果只使用专家,你能解决所有问题,但代价高昂且耗时极长。
- 有些系统试图使用“规则手册”(静态路由)来决定调用谁,但这些规则僵化。它们无法判断实习生何时实际上充满信心,也无法察觉问题何时突然变得过于困难。
解决方案:AdaptEvolve
本文作者创建了一个名为 AdaptEvolve 的新系统。你可以将其视为一位智能的实时管理者,他观察实习生工作,并即时决定是让实习生完成工作,还是呼叫资深专家介入。
以下是其工作原理,使用简单的类比说明:
1. 倾听“信心脉搏”
AdaptEvolve 不请外部专家猜测问题难度,而是倾听实习生自身的“状态”。
- 当实习生编写代码时,系统会检查他们的信心。
- 高信心:实习生输入流畅,对自己的答案胸有成竹,代码看起来扎实。系统会说:“太棒了!继续,实习生。你能搞定。”
- 低信心:实习生犹豫不决、反复回退,或者代码看起来不稳(高“熵”或不确定性)。系统会说:“哎呀,这看起来有风险。停下!让我们呼叫资深专家来处理这一特定部分。”
2. “热身”与“自适应管理者”
为了学习如何做出这些调用,系统会进行快速的热身(例如用 50 道题目进行练习轮次)。
- 它观察实习生解决这 50 道题,并记录:“当实习生在这里犹豫时,他们失败了;当他们在彼处充满信心时,他们成功了。”
- 基于这些数据,它构建了一个简单的决策树(流程图)。
- 关键在于,这位管理者是自适应的。随着竞赛难度增加(AI 进化以解决更难的难题),管理者会即时更新其规则。如果问题变得更棘手,管理者会学会更早地呼叫专家。它不依赖过时的静态规则手册。
3. 结果:两全其美
该论文在编程基准测试(如 LiveCodeBench 和 MBPP)上对此进行了测试。他们的发现如下:
- 成本节约:通过让廉价的实习生处理简单工作,仅在绝对必要时才调用昂贵的专家,他们将总计算成本降低了约 38%。
- 性能:质量几乎没有损失。该系统仍然解决了“全专家”系统所能解决的 97.5% 的问题。
- 效率:它创造了一个“帕累托前沿”,用通俗的话说,就是找到了完美的平衡点,让你用同样的钱获得最大的价值。
总结类比
想象你在开车。
- 旧方式:你要么全程驾驶一辆缓慢但省油的经济型轿车(解决不了任何难题),要么驾驶一辆耗油的赛车(能解决一切但代价高昂)。
- AdaptEvolve:你在高速公路上驾驶经济型轿车。但一旦你看到前方出现陡峭、崎岖的山路(难题),汽车的智能系统会瞬间将你切换到赛车。一旦翻过山头,它又把你换回经济型轿车。你节省了燃油,却依然征服了高山。
本文未声称的内容:
- 它不声称此方法适用于非编码任务(如写诗或数学证明),因为这些任务的“答案”不是可以自动测试的代码片段。
- 它不声称要完全取代人类程序员,而是旨在使 AI 编码过程更便宜、更快速。
- 它专门针对“进化式”系统,即 AI 生成代码、测试代码并随时间改进代码的系统。
简而言之,AdaptEvolve 是一个智能开关,利用 AI 自身的“直觉”(信心)来决定何时使用廉价工具,何时呼叫昂贵专家,从而在不过度牺牲质量的前提下节省成本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。