← 最新论文
💬 NLP

In-the-Flow Agentic System Optimization for Effective Planning and Tool Use

该论文介绍了 AgentFlow,这是一个可训练的在流中(in-the-flow)智能体框架,它采用了一种新颖的 Flow-GRPO 算法来优化多轮循环中的专门规划器,在多种推理和工具使用基准测试中,实现了相较于现有基线模型及更大规模专有模型的显著性能提升。

原作者: Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何破解谜题。你不想让它只是瞎猜;你希望它能利用地图、放大镜和计算器来寻找真相。这就是大语言模型(LLMs)的世界,它们就像是拥有巨大阅读量、能够交谈并进行推理的超级大脑。最近,科学家们发现了一种让这些大脑变得更加敏锐的方法,即让它们进行练习:它们尝试解决一个问题,在最后阶段接收到一个“做得好”或“再试一次”的信号,并从这个结果中学习。这被称为强化学习(Reinforcement Learning)

然而,这里有一个难点。当问题变得非常长且复杂时——比如一个包含二十个线索和五种不同工具(搜索引擎、代码编写器、事实核查器)的侦探故事——一次性教导机器人会变得一团糟。这就像是在蒙着眼睛的同时,试图同时学习开车、开飞机和开船。机器人会感到困惑,在早期就会犯错,并且无法弄清楚到底是哪一个具体的步骤导致了失败。目前的大多数系统要么试图用一个巨大的大脑处理所有事情(这在处理长任务时会显得力不从心),要么使用一群互不学习的机器人团队(它们被困在原始且不可改变的习惯中)。

这篇论文介绍了一种训练这些 AI 团队的新方法,叫做 AGENTFLOW。你可以把它想象成一个动态的、充满活力的工作坊,一个由专业化机器人组成的团队在实时协作。AGENTFLOW 并没有让一个巨大的大脑尝试做所有事情,而是将工作进行了拆分:一个**规划者(Planner)决定下一步行动,一个执行者(Executor)执行动作(例如搜索网页),一个验证者(Verifier)检查结果是否合理,以及一个生成器(Generator)*撰写最终答案。它们共享一块“记忆板”,并在每一步之后进行更新。神奇之处在于,规划者是在团队工作的过程中*进行学习,而不仅仅是在事后。

研究人员开发了一种特殊的训练方法,称为 Flow-GRPO。想象一下玩“热豆子”(Hot Potato)的游戏,团队在每一轮都会向每一位玩家传递一个单一的“成功”或“失败”令牌。如果团队在最后解决了谜题,那么他们所采取的每一个步骤都会得到一个“做得好!”的信号。如果失败了,每一个步骤都会得到一个“再试一次”的信号。通过这种方式,规划者能够理解,即使是早期做出的微小决策,对于最终结果也至关重要。通过这种训练方式,系统学会了即时适应、自我纠错,并为任务选择最合适的工具。

实验结果令人印象深刻。团队在十种不同类型的难题上测试了这个系统,范围涵盖了从搜寻冷门事实到解决复杂的数学问题和科学问题。尽管他们使用的是一个相对较小的“大脑”(一个 70 亿参数的模型),但 AGENTFLOW 击败了许多更大、更著名的模型,如 GPT-4o(拥有约 2000 亿参数)以及其他专门的 AI 系统。例如,在侧重搜索的任务中,它的准确率提升了近 15%,而在数学问题上,它跃升了超过 14%。这项研究表明,通过让 AI 团队在对话的流转过程中共同学习,而不是孤立学习,它们在规划、使用工具以及解决需要多步骤的问题方面变得更加出色。这不仅仅是关于拥有一个更大的大脑,更是关于教导这个团队如何有效地协同工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →