← 最新论文
🤖 AI

TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI

TRACE-Router 是一个任务级路由框架,它在准入阶段将智能体工作流分配给单个大语言模型,并根据延迟的任务级奖励来更新策略,从而在多个基准测试中,在准确率与延迟的权衡方面优于现有的单次调用路由器。

原作者: Ritik Raj, Souvik Kundu, Sarbartha Banerjee, Dheemanth Joshi, Ishita Vohra, Tushar Krishna

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ritik Raj, Souvik Kundu, Sarbartha Banerjee, Dheemanth Joshi, Ishita Vohra, Tushar Krishna

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营着一家规模宏大、高科技的呼叫中心,这里的每一项客户请求都是一项复杂的任务。你拥有一支员工团队:有些人动作极快但可能会忽略细节,而另一些人则极其严谨但速度较慢。在人工智能的世界里,这些员工就是大语言模型(LLMs)。企业面临的巨大挑战是弄清楚该把哪项工作分配给哪位员工。如果你总是选择那位缓慢而细心的专家,就会浪费金钱和时间处理简单的任务;如果你总是选择那位快速的员工,在处理难题时可能会得到错误的答案。

长期以来,解决这一问题的标准方法是观察单个问题,然后决定:“好吧,这看起来很简单,把它交给快速员工,”或者“这看起来很难,把它交给专家。”但这种方法在处理“智能体”(agentic)AI 时存在一个隐藏的缺陷。智能体不仅仅是在回答一个问题,它是在进行一场漫长的旅程。它可能会问一个问题,使用一个工具,查看一张地图,然后再问另一个问题,以此来解决一个大问题。如果你在旅程中途更换员工,新员工并不知道第一个人在思考什么,整个任务就可能崩溃。真正的问题在于:我们如何为整个旅程挑选出正确的员工,以及我们如何从结果中学习以在下次做得更好?

这正是 TRACE-Router 背后的研究人员试图解决的问题。他们意识到,将每一个问题都视为一个独立的决策,就像是试图通过为每一英里都更换一名司机来规划一次跨国公路旅行。相反,他们提出了一个系统,为整个旅程挑选一名司机,并让他们一直跟随直到抵达目的地。

以下是他们的新系统是如何运作的,我们可以用一个简单的类比:想象一个火车站里聪明的调度员。在旧系统中,调度员会查看乘客的票,然后决定将他们安排在哪趟列车上。如果乘客稍后需要换乘,调度员会做出一个新的决定,往往会忘记乘客最初的目标。TRACE-Router 改变了规则。当一名乘客(一项任务)到达时,调度员会立即查看目的地,并将他们分配到特定的列车(特定的 AI 模型)上。一旦乘客上了这趟列车,他们就会全程留在车上,无论中间经过多少站。

奇迹发生在旅程结束之后。调度员会等待观察乘客是否安全且准时地抵达。如果旅程成功了,调度员会对最初所做的决定给予“赞赏”;如果旅程失败或耗时过长,则给予“批评”。至关重要的是,调度员不会责怪每一个停靠站,而是责怪最初选择列车的决定。这使得系统能够从整个经历中学习,而不是仅仅从孤立的瞬间中学习。

该论文介绍了一种巧妙的学习方法,称为“上下文多臂老虎机”(contextual bandit)。可以把它想象成一个游戏,调度员通过这个游戏学习哪种列车最适合不同类型的乘客。他们根据对车票的快速浏览(无需预先询问 AI),将乘客大致分为“简单”、“中等”和“困难”等类别。对于每个类别,系统都会尝试不同的列车,学习哪一个能最好地完成任务,并最终找到完美的匹配。这就像一位厨师品尝了一道菜后,学会了对于辣味食物应该始终使用红色的炉灶,而对于甜味食物,蓝色炉灶则更合适。

其研究结果非常令人印象深刻。研究人员在几个现实世界的挑战(包括复杂的数学问题和编程任务)上测试了他们的系统。他们发现,通过让一个模型全程负责整个任务,TRACE-Router 始终能找到其他方法无法触及的速度与准确性之间的“甜点区”(平衡点)。在名为 τ 2-Bench 的特定测试中,即使其他智能路由方法被给予相同的时间,TRACE-Router 仍能比它们多正确解决 7 到 8 个问题。在另一个测试 Terminal-Bench 中,它的准确率比最强的单一模型高出 7.1 个百分点,同时速度竟然快了 36%

论文还测试了几种不同的想法以观察哪些最为有效。他们尝试通过在正式开始前给予一些虚假的经验来“预热”系统,希望这样能让系统学得更快。然而,结果显示这反而让系统变得更慢且缺乏灵活性,因此他们决定坚持使用“冷启动”方法,即系统完全从真实的旅程中学习。他们还将自己的学习算法与几种流行的其他方法进行了比较,发现他们的选择在不同类型的任务中是最稳定且最可靠的。

简而言之,TRACE-Router 表明,管理 AI 智能体最好的方式不是微观管理每一个步骤,而是信任一个经过精心挑选、能陪伴整个旅程的伙伴。通过等待最终结果来评判决策,该系统学会了如何随着时间的推移做出更明智的选择,以一种以往方法无法做到的方式,平衡速度与准确性的需求。这是一种思维方式的转变:不再将 AI 视为一系列孤立的问题,而是将其视为一个连贯的、长途跋涉的任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →