← 最新论文
🤖 AI

VineLM: Trie-Based Fine-Grained Control for Agentic Workflows

VineLM 是一个工作流管理器,它通过将可行执行表示为带注释的字典树,并结合使用检查点与级联分析来优化成本 - 延迟 - 精度前沿,从而无需 exhaustive 离线分析即可为智能体工作流实现细粒度的动态模型选择。

原作者: Nikos Pagonas, Matthew Lou, Tianyi Peng, Dan Rubenstein, Kostis Kaffes

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikos Pagonas, Matthew Lou, Tianyi Peng, Dan Rubenstein, Kostis Kaffes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你经营着一家高风险的侦探事务所。你的目标是利用一支专家团队(即"AI 模型”)来解开一个谜团(即“请求”)。有些专家便宜且迅速,但可能会遗漏线索;有些专家昂贵且缓慢,却是天才侦探。

在过去,如果你聘请了一家侦探事务所,你必须在调查开始之前签署一份合同。你必须为“收集证据”阶段指定一名特定的侦探,为“修正错误”阶段指定另一名特定的侦探,并且无论发生什么情况,都必须坚持使用他们。如果第一位侦探发现了一个重大线索,你无法在下一步切换到更便宜的专家。如果第一位侦探耗时过长,即便你时间紧迫,你也只能被迫让这位昂贵的侦探继续处理案件的剩余部分。

VineLM 是一种管理这些侦探事务所的新方法。VineLM 不像是在开始时签署一份僵硬的合同,而是像一位智能项目经理,在每一步之后进行检查,并决定:“鉴于我们目前的情况,剩余的时间和预算有多少?谁最适合执行下一个具体任务?”

以下是其工作原理的简单概念分解:

1. 问题:“一刀切”的陷阱

现有系统(如名为 Murakkab 的系统)就像一位在开始工作前就选定“计划 A"的经理。

  • 缺陷:如果你的计划涉及循环(例如“不断修正 SQL 代码直到其运行正常”),旧系统会强制你在每一次修正中都使用同一位侦探。
  • 结果:你可能在第一次修正时雇佣了一位天才(但昂贵)的侦探,然后被迫在第二次和第三次修正中继续使用这位昂贵的侦探,即使第二次修正很简单,本可以由廉价的实习生完成。或者,你可能因为第一步耗时超出预期而耗尽时间,却无法在剩余步骤中切换到更快的侦探。

2. 解决方案:“决策树”(Trie)

VineLM 构建了一棵巨大的决策树(论文中称为"Trie")。想象一本“选择你自己的冒险”书,书中的每一页都代表调查中的一个步骤。

  • 地图:书中的每一条路径都代表你可以雇佣的侦探的不同组合。
  • 标注:在开始解决真实案件之前,VineLM 会运行数千个练习案例来绘制这棵树。它在每条路径上标记:“如果你走这条路,通常成本为 X 美元,耗时 Y 秒,正确率达到 Z%。”

3. 魔法技巧:“级联分析”(高效制图者)

绘制这本巨书中每一条路径将极其昂贵且缓慢(就像为每一种可能的场景雇佣每一位侦探)。VineLM 使用了一种称为级联分析(Cascade Profiling)的巧妙技巧:

  • 捷径:它不从零开始测试每一条路径,而是从开头开始。如果第一步成功,它就知道整条路径是成功的,无需测试其余部分。
  • 结果:它仅用测试所有情况所需努力的**1% 到 2%*就填满了地图。这就像意识到,如果你在锦标赛的第一轮获胜,你就不需要打决赛就能知道你本可以*获胜;你只需要知道概率即可。

4. 运行时:“重新生根”树

这是最令人兴奋的部分。当真实请求到来时:

  1. 步骤 1:系统根据地图为第一步挑选最佳侦探。
  2. 步骤 2:侦探完成任务。系统再次查看地图。
  3. 转折:系统说:“好的,我们刚才在第一步上花了 5 秒。我们还剩 10 秒。地图显示,如果我们走这条分支,可能会超时。让我们切换到那条分支吧。”
  4. 循环:它在每一个步骤之后都这样做。如果情况发生变化,它可以在循环中途从“超级侦探”切换到“预算实习生”。

这为何重要?

论文在两类任务上测试了该方法:

  1. 将英语问题转换为 SQL 数据库查询(NL2SQL):例如询问“上季度的销售额是多少?”,并让 AI 编写代码来查找答案。
  2. 数学推理:解决需要反复检查和复核的复杂数学问题。

结果

  • 更高的准确率:即使使用完全相同的预算,VineLM 获得正确答案的频率也比旧系统高出18%。这就像在不支付额外辅导费的情况下,在考试中取得了更好的成绩。
  • 更低的构建成本:由于“级联分析”技巧,构建地图的成本比测试每一种可能性低了98% 到 99.8%
  • 更少的超时:如果某一步耗时超出预期,VineLM 可以立即切换到更快的计划以保持在时间限制内。它将“超时”错误减少了高达85%

总结

VineLM 将 AI 工作流程视为一次动态旅程,而非僵化的、预先写好的脚本。它允许系统在每一个步骤进行微小而智能的调整,确保你以最少的时间和金钱获得最佳可能的结果,而不会仅仅因为你在开始时签署了计划就陷入糟糕的方案中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →