← 最新论文
🤖 AI

Uno-Orchestra: Parsimonious Agent Routing via Selective Delegation

Uno-Orchestra 提出了一种统一的、基于强化学习的编排策略,该策略联合优化任务分解深度、工作节点选择与推理预算,从而在多样化的基准测试中,相较于僵化的多智能体系统实现显著更高的准确率与更低的成本。

原作者: Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你面临一个庞大而复杂的问题需要解决,比如规划一次横跨全国的公路旅行,其中涉及寻找酒店、预订航班、查询交通状况以及烹饪餐食。

在人工智能领域,当今大多数系统处理此类问题的方式笨拙地分为两种:

  1. “一刀切”的老板:他们雇佣最昂贵、最聪明的首席执行官(一个庞大的 AI 模型)来包揽所有工作,从预订航班到切菜。这虽然可行,但即使对于像查询天气这样简单的任务,也极其昂贵且缓慢。
  2. “僵化的流水线”:他们拥有一份预先写好的脚本,规定“首先,向首席执行官询问航班;然后,向首席执行官询问酒店”。这缺乏灵活性。如果首席执行官太忙或任务发生变化,整条流水线就会瘫痪。

Uno-Orchestra 是一种更聪明的新方式来运营这场演出。把它想象成一位精明且注重成本的巡演经理,他本人不直接干活,但确切知道为每一项微小工作该雇佣谁。

核心理念:“选择性委派”

巡演经理(Uno-Orchestra)审视你的请求,并同时提出两个问题:

  1. “我需要将其分解吗?”(分解)
  2. “谁最适合处理这个具体部分?”(路由)
  • 如果任务简单(例如"2+2 等于多少?”),经理会说:“我不需要呼叫任何人。我会立刻自己回答。”这节省了金钱和时间。
  • 如果任务复杂(例如“编写一个 Python 脚本来分析股票数据并可视化”),经理将其分解为子任务:“查找数据”、“编写代码”、“运行代码”、“制作图表”。
  • 魔法技巧:对于每个子任务,经理挑选完美的工人。他们可能会将“查找数据”任务派发给一个快速、廉价的实习生(一个更小、更便宜的 AI 模型)。但他们会将“制作图表”任务派发给一位专业、昂贵的艺术家(一个强大、昂贵的 AI 模型)。

它是如何学会如此出色的

该论文描述了一个两步训练过程,就像培训一名新员工:

  1. 实习期(监督微调):系统观察了 61,000 个“大师级经理”解决问题的案例。这位大师级经理使用了真实的工具和真实的代码执行(而不仅仅是猜测)。系统学会了模仿这些成功的模式:何时进行分解,以及为哪项工作挑选哪位工人。
  2. 模拟联赛(强化学习):随后,系统被置于一个“训练竞技场”中,必须独立解决难题。
    • 如果它正确且廉价地解决了问题,它会获得高分。
    • 如果它正确解决了问题但浪费了金钱,它会获得较低的分数。
    • 如果它失败了,它会得零分。
    • 关键在于,系统学会了将功劳(或责任)归因于具体步骤。如果它在第 3 步选错了工人,它会吸取那个具体的教训,而不仅仅是在最后得到一个笼统的“你失败了”的评价。

结果:快速、廉价且智能

研究人员将这位新的巡演经理与其他 22 个系统(包括其他“路由器”和“流水线”)进行了测试,涵盖了从数学和编程到长文档阅读等 13 种不同类型的挑战。

  • 得分:Uno-Orchestra 取得了 77% 的成功率,比排名第二的系统高出约 16%
  • 成本:更令人印象深刻的是,其每次查询的成本比重型工作流系统低了 10 倍

为何它表现更佳

论文声称,秘诀在于灵活性

  • 旧系统要么试图用一个巨大的大脑完成所有事情(太昂贵),要么遵循僵化的脚本(太愚蠢)。
  • Uno-Orchestra 就像一位爵士乐手。它知道何时演奏一个简单的单音(直接回答),何时召集整个乐队(分解任务),并且确切知道每个音符需要哪种乐器(AI 模型)。

总结

Uno-Orchestra 是一个学会成为智能项目经理的系统。它不仅仅路由问题;它决定如何分解问题以及问题分配给,同时保持严格的预算。它证明了要解决最棘手的问题,你并不需要最昂贵的 AI;你只需要在正确的时间,为正确的工作,配备正确的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →