← 最新论文
💬 NLP

Global Optimization and Inference-Time Region Grafting for Agentic Workflows

该论文介绍了 GRAFT,这是一种无需训练的方法,它能够使智能体工作流利用无标签的质量信号,自适应地将执行失败的区域替换为更好的替代方案,从而实现实例级优化,并在无需进行计算昂贵的整个工作流重新优化的情况下,提升多种不同任务的性能。

原作者: Donghyeok Koh, Gyuwan Kim, Jinyeong Bak, Seung-Hoon Na, Tao Yang, Haneol Jang, Cheoneum Park

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Donghyeok Koh, Gyuwan Kim, Jinyeong Bak, Seung-Hoon Na, Tao Yang, Haneol Jang, Cheoneum Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解开一个巨大的、复杂的谜题。在人工智能的世界里,这些谜题被称为“智能体工作流”(agentic workflows)。我们不仅仅是要求一台聪明的计算机去“解决这个问题”,而是给它一个特定的食谱——一个包含搜索事实、提前规划、检查自身工作以及完善答案等不同工具的逐步计划。你可以把它想象成一个厨房,其中的主厨(AI)不仅负责烹饪,还有一个负责切菜的副厨、一个负责品尝并验证结果的试吃员,以及一个负责组织菜单的规划师。

长期以来,科学家们一直试图为每种类型的谜题找到一个“完美”的食谱。他们进行数千次离线测试,以确定步骤的最佳顺序。但问题在于:并非每个谜题都是一样的。一个简单的数学题可能只需要快速切菜,而一个棘手的历史问题可能需要深入研究和反复检查。如果你对每一个谜题都使用相同的僵化食谱,你可能会陷入困境或犯下愚蠢的错误,因为计划在特定时刻缺乏足够的灵活性。大问题在于:我们能否在保留一个优秀的、预先规划好的食谱的同时,还能在烹饪过程中根据当前正在制作的具体菜肴来微调步骤,而无需从头开始?

这正是论文《全局优化与推理时区域嫁接在智能体工作流中的应用》(Global Optimization and Inference-Time Region Grafting for Agentic Workflows)所探讨的内容。作者引入了一个名为 GRAFT 的新系统。GRAFT 并不强迫 AI 固守一个固定的计划,也不在面对每个问题时都重新发明轮子,它更像是一位拥有针对特定餐点的“黄金食谱”,但如果试吃员说需要调整,它愿意随时更换一两个配料的高级主厨。

以下是它在论文所述现实世界中的运作方式:首先,系统会利用标准的测试方法,为一类任务(如数学或编程)找到一个全局优化的工作流(即“黄金食谱”)。这发生在 AI 开始回答问题之前。然后,当一个具体的问题进来时,GRAFT 不会盲目地执行食谱。它会将食谱分解成小的、自包含的部分,称为“区域”(regions)。当 AI 处理问题时,它会检查每个区域。如果某个区域(例如“推理”步骤)看起来很吃力或产生了较弱的结果,GRAFT 会在运行过程中即时将其替换为一个更好的版本。

至关重要的一点是,这种替换过程不需要预先知道正确答案(这在实时使用过程中通常是不可能的)。相反,系统使用巧妙的“无标签”(label-free)信号来判断质量。例如,在数学中,它可能会对同一个问题运行五种不同的方式,看看它们是否达成一致(这被称为“自一致性”技术);在编程中,它可能会运行代码以查看是否通过了测试。如果一个新版本的步骤看起来更好,并且不会破坏与下一步骤的连接,GRAFT 就会将其“嫁接”(graft)进去。如果效果不好,它则保留原有的步骤。这种操作针对每一个输入都是即时完成的。

论文发现,这种方法是一个游戏规则的改变者。在测试了涵盖数学问题(如 GSM8K 和 MATH)、编程任务(HumanEval)以及复杂问题(HotpotQA)的五个不同基准测试后,GRAFT 的表现优于之前的最佳方法 MaAS,平均高出 3.85 个百分点。在 AI 基准测试领域,这是一个巨大的飞跃。例如,在 GSM8K 数学数据集中,GRAFT 得分为 95.04,击败了得分仅为 92.30 的次优方法。

作者还发现了关于这个“食谱”本身的一些迷人发现。他们发现,优化的工作流不仅仅是一套静态的指令,它是一种灵活的策略。即使他们在不改变工作流的情况下,将“厨师”(底层 AI 模型)更换为更强大的模型,性能也会提升。这表明一个好的工作流是具有适应性的;它可以通过拥有更聪明的工具来执行工作,从而实现进化,而无需重新设计。

然而,论文也谨慎地指出了这种魔力在何处奏效,以及在哪里碰壁。用于判断质量工作的“无标签”信号在数学和编程领域表现得非常好,因为在那里的答案非黑即白。但在处理复杂的知识类问题(如关于历史或科学的问题)时,这些信号的可靠性较低,系统的提升也不明显。作者指出,虽然 GRAFT 是实时调整工作流的一种强大方式,但它高度依赖于在不知道最终答案的情况下验证步骤质量的能力。

简而言之,GRAFT 证明了你无需在“僵化的预设策略”与“混乱的随兴应变”之间做出选择。通过在坚实的基础上嫁接微小且智能的调整,AI 智能体可以变得更加稳健、高效且准确,从而解决那些对于“一刀切”方案来说过于棘手的难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →