← 最新论文
🤖 AI

Agent-as-a-Router: Agentic Model Routing for Coding Tasks

本文引入了“代理即路由”(Agent-as-a-Router)框架,该框架将模型路由视为一个动态的“上下文-动作-反馈”循环,以积累基于执行的经验,从而克服静态路由的信息缺失问题,并在编程任务中实现卓越的性能与成本效率。

原作者: Pengfei Zhou, Zhiwei Tang, Yixing Ma, Jiasheng Tang, Yizeng Han, Zhenglin Wan, Fanqing Meng, Wei Wang, Bohan Zhuang, Wangbo Zhao, Yang You

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengfei Zhou, Zhiwei Tang, Yixing Ma, Jiasheng Tang, Yizeng Han, Zhenglin Wan, Fanqing Meng, Wei Wang, Bohan Zhuang, Wangbo Zhao, Yang You

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位经营着一家繁忙编程代理机构的经理。你拥有一支由八名不同专家组成的开发人员团队,每位成员都有其独特的超能力和价格标签。

  • 开发者 A 是修复 Bug 的天才,但收费极高。
  • 开发者 B 价格低廉且擅长编写数据脚本,但极其不擅长复杂的数学运算。
  • 开发者 C 擅长编写测试用例,但其他方面的工作进度较慢。

在过去,大多数公司为了保险起见,会对所有任务都直接雇佣 开发者 A(最贵、最“强”的一个)。但这是一种浪费。如果你只需要一个简单的数据脚本,雇佣开发者 A 就像是请一位一级方程式赛车手去超市买菜一样。

这篇题为 《Agent-as-a-Router》(智能体即路由) 的论文,介绍了一种管理这个团队的新方法。与其盲目地挑选“最好”的开发者,作者构建了一个聪明的 交通控制器(称为“路由”),它会决定哪个特定的开发者应该处理哪项特定的任务。

以下是他们的发现与解决方案的详细拆解:

1. 问题所在:“信息差”

研究人员首先问道:为什么现有的智能路由效果不够好?
他们测试了一个标准的 AI 路由(“原生”路由),发现它经常出错。他们想知道:是因为路由本身的推理能力不够强吗?

为了测试这一点,他们给了路由一份包含 性能统计数据(例如:“开发者 B 在数据任务上的表现为 90%”)的“小抄”。

  • 结果: 路由的性能瞬间提升了 15.3%
  • 教训: 路由的表现不佳并不是因为它“笨”,而是因为它“瞎”。它缺乏关于不同开发者在特定任务上实际表现的信息。瓶颈在于 信息缺失,而非缺乏智能。

2. 解决方案:“学习型交通控制器”

作者提出了一种名为 ACRouter 的新系统。它不是一个静态的规则手册,而是一个 活生生的、持续学习的循环。他们称之为 C-A-F 循环

  1. Context (背景/简报): 路由查看新的编程任务,并结合从以往类似任务中学习到的经验。
  2. Action (行动/分配): 它为工作挑选出最合适的开发者。
  3. Feedback (反馈/成绩单): 开发者完成工作,随后由一个“验证器”(沙盒测试环境)检查代码是否运行正常以及消耗了多少成本。
  4. Update (更新/记忆): 路由获取该成绩单,并将其存储在它的 记忆 (Memory) 中。

类比:
将传统的路由想象成一张 静态地图。即使道路封锁,它也每次都指引同样的路线。
ACRouter 就像是一个 拥有实时 GPS 的网约车司机

  • 他们接载乘客(任务)。
  • 他们将乘客送到目的地。
  • 他们会检查乘客是否满意以及消耗了多少燃油。
  • 他们会记住:“路线 X 非常适合这类乘客,但路线 Y 太贵了。”
  • 下次有类似的乘客到来时,由于拥有了 经验,这位司机能做出更好的选择。

3. “记忆”是关键

该系统最核心的部分是其 记忆模块 (Memory module)

  • 旧的路由 就像是那些为了考试而学习、考完即忘的学生。它们无法从错误中学习。
  • ACRouter 则记录着它处理过的每一项任务的“日记”。它会记得:“上次我把一个‘数据科学’任务交给开发者 B 时,效果完美且成本很低。上次我把它交给开发者 A 时,不仅昂贵而且失败了。”

这使得路由随着工作的开展变得越来越聪明,能够适应它从未见过的全新类型的编程挑战。

4. 结果:更聪明、更便宜

团队在一个名为 CodeRouterBench(包含约 10,000 个编程任务)的大规模基准测试中对该系统进行了测试。

  • 在已知任务上: ACRouter 在挑选正确开发者的准确性方面表现最佳,甚至超越了“完美”的静态规则。
  • 在新的、奇特的任务(分布外任务)上: 这正是奇迹发生的地方。当他们给出一个全新的编程挑战类型(智能体编程,即 Agentic Programming)——一种它从未见过的类型时:
    • 旧的“静态”路由(仅靠记忆规则的路由)表现糟糕。
    • “学习型”路由(ACRouter)通过利用其对相似模式的记忆,迅速完成了适应并取得了成功。
    • 它甚至超越了“为每个任务都雇佣单一最贵、最强开发者”的策略,在提高结果质量的同时节省了成本。

总结

本文认为,要充分发挥多个 AI 编程模型的作用,你不应该仅仅挑选“最强”的那一个。相反,你需要一个 聪明的、具备学习能力的管理者,它需要:

  1. 了解每个模型的具体优势。
  2. 从自身的错误中实时学习
  3. 构建关于“什么有效”以及“什么无效”的记忆。

通过利用这种反馈循环来弥补“信息差”,该系统变成了一个高效的、能够自我进化的路由引擎,既节省了成本,又提高了代码质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →