← 最新论文
💬 NLP

On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows

本文介绍蒙特卡洛投资组合规划(MCPP),这是一种轻量级闭环规划器,它通过基于模拟结果动态分配模型和并行样本,来优化在明确的预算和截止时间约束下完成代理工作流的概率。

原作者: Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名建筑工队的经理,负责建造一栋复杂的房屋(即智能体工作流)。你有一条严格的规定:房屋必须在周五下午 5 点前完工(即截止日期),且花费不得超过 10,000 美元(即预算)。

你的工队由不同的专家(即模型)组成:有些速度快但昂贵,有些速度慢但便宜,还有些表现时好时坏。施工计划是一张地图,标明了哪些房间必须比其他房间先建造(即依赖关系)。

旧方法:“优化平均值”

此前,研究人员试图基于平均值为每项工作找到“完美”的专家。他们会问:“哪名工人在速度、成本和质量方面平均表现最佳?”

问题所在: 这就像仅凭简历雇佣工队,然后派他们去现场,却未制定应对下雨或工人离职等突发状况的计划。即使你雇佣了“平均表现最佳”的工人,也可能因为未考虑到这项工作特有的混乱局面,而在周三前耗尽资金,或错过周五的截止日期。

新方法:“约束驱动的在线分配”

本文提出了一种名为**MCPP(蒙特卡洛投资组合规划)**的新方法。MCPP 不再仅仅挑选“最佳”工人,而是扮演一位超级聪明、实时运作的项目经理,根据实际发生的情况不断重新规划。

以下是 MCPP 的工作原理,采用简单的类比说明:

1. “假设”模拟器(蒙特卡洛)

在做出决策之前,MCPP 不只是猜测。它会在脑海中运行数千次剩余施工项目的模拟电影

  • 情景 A: “如果我雇佣昂贵但快速的工人负责厨房,我是否还有足够的资金按时完工屋顶?”
  • 情景 B: “如果我雇佣便宜但缓慢的工人负责厨房,我们是否会错过截止日期?”

它反复模拟这些结果,以找出哪条路径最有可能在 10,000 美元预算和周五截止日期的限制下完成整栋房屋。

2. 策略“投资组合”

MCPP 不只关注一种做事方式。它准备了一个包含不同策略的投资组合,随时待命:

  • 保守策略: “使用便宜的工人,并祈祷一切顺利。”
  • 激进策略: “现在投入大笔资金以确保速度。”
  • 混合策略: “在困难部分使用快速工人,在简单部分使用便宜工人。”

它将所有可能的策略组合与剩余的时间和资金进行测试。

3. “重新规划”循环(闭环)

这是最重要的部分。MCPP 不会在开始时制定计划后就固守不变。

  • 步骤 1: 基于模拟结果,立即选择当前最佳行动。
  • 步骤 2: 在现实世界中执行该行动。
  • 步骤 3: 观察结果。工人成功了吗?耗时是否超出预期?成本是否更高?
  • 步骤 4: 立即根据新现实重新运行模拟,并为下一步选择新的最佳行动。

这就像 GPS 导航,它不会只给你一次路线,而是在你遇到交通堵塞或改道时重新计算整条路径,确保你仍能带着剩余的资金在下午 5 点前抵达。

为何这很重要

本文在两类“建筑项目”上测试了该方法:

  1. CodeFlow(代码流): 编写计算机代码,其中某一步骤依赖于前一步骤。
  2. ProofFlow(证明流): 解决复杂的数学证明,其中步骤必须遵循逻辑链条。

结果:
当预算和时间紧张(即“硬”约束)时,MCPP 比旧方法更能成功完成任务。

  • 旧方法往往因为无法适应具体情况而耗尽资金或时间。
  • MCPP 通过为“瓶颈”任务(即房屋中最困难的部分)节省资金,并在简单部分减少开支,成功应对了严格的约束。

核心结论

本文认为,在现实世界中,我们需要的不仅仅是一个“通常高效”的智能体。我们需要一个能保证特定结果的智能体:“你能在周五前以低于 100 美元的成本完成这项具体工作吗?”

MCPP 通过不断模拟未来、适应现实,并在过程的每一步在速度、成本和风险之间做出明智的权衡,比之前的方法更频繁地回答“是”。它将僵化的计划转化为灵活、有生命力的策略,从而在现实世界执行的混乱中生存下来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →