Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents
该论文介绍了 Evoflux,一种推理时进化搜索方法,它通过结构化编辑和执行反馈来动态修复并优化类型化工作流图,从而显著提高了紧凑型语言模型在工具工作流中的执行可行性,在实时工具环境中表现优于传统的监督微调和强化学习方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心愿景:“小厨师”难题
想象你有一个非常小巧、经济实惠的厨房机器人(一个紧凑型 AI 模型)。你想让它通过使用一个庞大且不断变化的仓库(一个实时工具目录)来烹饪一道复杂的菜肴。
这个机器人需要:
- 在仓库中找到正确的食材(工具)。
- 遵循一套连接正确步骤的食谱(工作流)。
- 真正地进行烹饪(执行工具)并品尝结果。
问题在于: 小机器人虽然便宜且快速,但它们很“脆弱”。它们经常写出看起来在纸面上很完美的食谱,但在实际烹饪时却失败了。也许它们抓错了工具,或者忘记把一种食材传递给下一步,又或者尝试使用一个已经不存在的工具。
通常为了解决这个问题,我们会尝试通过向机器人展示成千上万个完美食谱的例子来“教导”它(训练数据)。但本文指出,当你只有几百个例子(预算有限)时,这种教导并不奏效。机器人只是记住了食谱的形状,却没学会当厨房里的情况出错时如何进行修复。
解决方案:Evoflux(“进化维修队”)
Evoflux 并不是试图重新训练机器人的大脑,而是给机器人配备了一个在机器人实际烹饪时工作的“维修队”。
你可以把 Evoflux 理解为一个动态修复循环:
- 第一次尝试: 机器人编写一份食谱(工作流图)。
- 试运行: 系统尝试运行这份食谱。如果出错(例如“找不到工具”或“缺少食材”),系统会捕捉到该错误。
- 进化: 系统不会放弃,而是将损坏的食谱视为一种“突变生物”。它会进行细微且智能的修改(编辑)来修复特定的错误。
- 选错了工具? 换一个。
- 忘了加食材? 加上它。
- 步骤顺序错了? 重新排序。
- 适者生存: 系统运行新版本。如果效果更好,就保留它;如果失败了,就再次尝试。系统会在短时间内多次进行这种尝试,通过进化食谱,直到找到一个能成功烹饪出菜肴的版本。
文中的关键比喻
- “看似合理但已损坏”的图谱: 文中指出,小模型生成的流程图往往看起来像是一张有效的地图,但实际上却通向悬崖。Evoflux 不仅仅是看地图,它还会直接开车去测试路面是否真实。
- “修复”与“训练”之争:
- 训练 (SFT/DPO): 就像试图背诵一本食谱。如果食谱很小(样本量少),机器人只会记住食谱的“风格”,但当食材发生变化时就会失败。研究发现,在样本预算较小时,这种方法往往会让机器人的表现比直接盲猜(零样本/zero-shot)还要差。
- Evoflux (搜索): 就像有一个修理工在你开车时帮你修车。它不改变驾驶员的大脑,只是根据路况实时修复引擎。
- “Token 成本”(燃料):
- ReAct (旧方法): 这就像一个机器人一直在大声自言自语,试图弄清楚下一步该做什么。它确实能找到很好的解决方案,但会消耗大量燃料(Token),且表现不稳定。
- Evoflux: 更加高效。它尝试几次特定的修复,检查是否奏效,然后停止。它能获得比训练更好的结果,且比那种长篇大论的“自言自语”法更节省燃料。
这篇论文实际发现了什么
研究人员在名为 MCP-Bench 的基准测试上进行了测试,该测试使用了真实的实时工具(如金融、旅行和科学工具)。
- 成功率: 对于小机器人来说,食谱在第一次尝试时成功的概率非常低(约 3%)。
- 修复效果: 使用 Evoflux 后,成功率跃升至 17% 到 24% 之间。
- 训练的失败: 当他们尝试使用与 Evoflux 搜索量相同的几百个样本来“教导”机器人时,机器人的表现并没有提升。事实上,它们的表现往往比完全不教导时还要差。
- 对比: 一种名为 ReAct 的方法(允许机器人进行分步思考)有时可以获得更高的分数,但它非常不稳定且昂贵。Evoflux 则更加可靠且廉价。
总结
如果你有一个小型、廉价的 AI 智能体,并且用于教导它的示例数量有限,那么不要仅仅尝试去训练它。相反,让它去尝试、去失败,然后使用一种智能的、进化的搜索过程来实时修复它的错误。
论文的结论是:对于小型智能体而言,在运行过程中修复计划,要比试图通过背诵少量案例来学习如何运行,是一种可靠得多的策略。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。