← 最新论文
💬 NLP

Learning Agent Routing From Early Experience

本文介绍了 BoundaryRouter,这是一个无需训练的框架,它基于早期行为经验和评分标准引导的推理,动态地将查询路由至轻量级大语言模型推理或完整智能体执行,从而优化延迟与性能之间的权衡,在速度和准确性方面均较现有方法实现了显著提升。

原作者: Yimin Wang, Jiahao Qiu, Xuan Qi, Xinzhe Juan, Jingzhe Shi, Zelin Zhao, Hongru Wang, Shilong Liu, Mengdi Wang

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yimin Wang, Jiahao Qiu, Xuan Qi, Xinzhe Juan, Jingzhe Shi, Zelin Zhao, Hongru Wang, Shilong Liu, Mengdi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、快速但有时过于自信的助手(即大语言模型),以及一位技艺高超、细致周全但速度慢且成本高昂的专家顾问(即智能体)。

  • 助手可以瞬间且免费地回答简单问题,例如“法国的首都是哪里?”。但如果你让它解决复杂的物理问题或编写长篇多步骤代码,它可能会猜错或产生幻觉。
  • 专家则能利用工具、进行研究并逐步思考,完美地解决这些难题。但这样做耗时很长且费用高昂。

问题所在:
目前,如果你手头既有简单问题也有难题,你必须猜测该将问题派发给谁。若将所有问题都交给专家,你会在简单问题上浪费时间和金钱;若将所有问题都交给助手,则会在难题上得到错误答案。

解决方案:"BoundaryRouter"
这篇论文介绍了一个名为BoundaryRouter的新系统。你可以将其想象为一位站在助手与专家交汇处的聪明交通指挥员。它的任务是审视每一个 incoming 问题,并决定:“这个问题对助手来说是否足够简单,还是必须由专家来处理?”

棘手之处在于,这位交通指挥员必须在**没有任何先前训练数据或“正确答案作弊表”**的情况下立即开始工作。这是一种“冷启动”。

它是如何工作的(创造性类比):
与其为了考试而学习,这位交通指挥员使用了一种名为**“从早期经验中学习”**的技巧。

  1. “种子”测试:在系统上线之前,研究人员将一小批问题同时输入助手专家。他们此时并不关心正确答案,只是观察两者的行为表现。

    • 示例:他们注意到,当问题涉及特定类型的数学时,助手会在 2 秒内给出简短且自信的答案,而专家则需要 300 秒来拿出计算器并反复核对。
    • 他们将这些观察结果保存在一本小型的“记忆簿”中。
  2. “相似性”搜索:当新问题到来时,交通指挥员翻阅其记忆簿。它会问:“这个新问题是否像我们之前见过的那些?”

    • 如果找到匹配项,且在该匹配中助手速度快而专家速度慢,它就将新问题发送给助手
    • 如果找到匹配项,且在该匹配中助手表现困惑或缓慢,它就将问题发送给专家
  3. “规则手册”推理:为了确保交通指挥员不仅仅是靠猜测,它遵循一套严格的规则手册(称为“基于规则指南的推理”)。它不仅仅是“感觉”需要专家,而是检查具体标准:“之前相似的问题是否让专家耗时增加了 10 倍?助手的回答是否显得模糊?”这确保了决策的逻辑性和一致性。

结果:
研究人员在一个名为RouteBench(一系列棘手问题的集合)的新基准测试中对该系统进行了测试。

  • 速度:与将所有问题都交给专家相比,该系统快了 60%,因为它停止在简单问题上浪费时间。
  • 准确性:与将所有问题都交给助手相比,其准确率提高了 28%,因为它没有让助手在难题上胡乱猜测。
  • 对比:它的表现远优于其他仅使用简单提示或基本搜索工具的方法。

简而言之:
这篇论文表明,你不需要庞大的训练数据集就能构建一个智能系统,使其懂得何时追求速度、何时追求周全。只需通过观察两个不同系统在少量样本问题上的行为表现,你就可以训练一位“交通指挥员”完美地路由未来的问题,从而在不牺牲质量的前提下节省时间和金钱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →