Learning Agent Routing From Early Experience
本文介绍了 BoundaryRouter,这是一个无需训练的框架,它基于早期行为经验和评分标准引导的推理,动态地将查询路由至轻量级大语言模型推理或完整智能体执行,从而优化延迟与性能之间的权衡,在速度和准确性方面均较现有方法实现了显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明、快速但有时过于自信的助手(即大语言模型),以及一位技艺高超、细致周全但速度慢且成本高昂的专家顾问(即智能体)。
- 助手可以瞬间且免费地回答简单问题,例如“法国的首都是哪里?”。但如果你让它解决复杂的物理问题或编写长篇多步骤代码,它可能会猜错或产生幻觉。
- 专家则能利用工具、进行研究并逐步思考,完美地解决这些难题。但这样做耗时很长且费用高昂。
问题所在:
目前,如果你手头既有简单问题也有难题,你必须猜测该将问题派发给谁。若将所有问题都交给专家,你会在简单问题上浪费时间和金钱;若将所有问题都交给助手,则会在难题上得到错误答案。
解决方案:"BoundaryRouter"
这篇论文介绍了一个名为BoundaryRouter的新系统。你可以将其想象为一位站在助手与专家交汇处的聪明交通指挥员。它的任务是审视每一个 incoming 问题,并决定:“这个问题对助手来说是否足够简单,还是必须由专家来处理?”
棘手之处在于,这位交通指挥员必须在**没有任何先前训练数据或“正确答案作弊表”**的情况下立即开始工作。这是一种“冷启动”。
它是如何工作的(创造性类比):
与其为了考试而学习,这位交通指挥员使用了一种名为**“从早期经验中学习”**的技巧。
“种子”测试:在系统上线之前,研究人员将一小批问题同时输入助手和专家。他们此时并不关心正确答案,只是观察两者的行为表现。
- 示例:他们注意到,当问题涉及特定类型的数学时,助手会在 2 秒内给出简短且自信的答案,而专家则需要 300 秒来拿出计算器并反复核对。
- 他们将这些观察结果保存在一本小型的“记忆簿”中。
“相似性”搜索:当新问题到来时,交通指挥员翻阅其记忆簿。它会问:“这个新问题是否像我们之前见过的那些?”
- 如果找到匹配项,且在该匹配中助手速度快而专家速度慢,它就将新问题发送给助手。
- 如果找到匹配项,且在该匹配中助手表现困惑或缓慢,它就将问题发送给专家。
“规则手册”推理:为了确保交通指挥员不仅仅是靠猜测,它遵循一套严格的规则手册(称为“基于规则指南的推理”)。它不仅仅是“感觉”需要专家,而是检查具体标准:“之前相似的问题是否让专家耗时增加了 10 倍?助手的回答是否显得模糊?”这确保了决策的逻辑性和一致性。
结果:
研究人员在一个名为RouteBench(一系列棘手问题的集合)的新基准测试中对该系统进行了测试。
- 速度:与将所有问题都交给专家相比,该系统快了 60%,因为它停止在简单问题上浪费时间。
- 准确性:与将所有问题都交给助手相比,其准确率提高了 28%,因为它没有让助手在难题上胡乱猜测。
- 对比:它的表现远优于其他仅使用简单提示或基本搜索工具的方法。
简而言之:
这篇论文表明,你不需要庞大的训练数据集就能构建一个智能系统,使其懂得何时追求速度、何时追求周全。只需通过观察两个不同系统在少量样本问题上的行为表现,你就可以训练一位“交通指挥员”完美地路由未来的问题,从而在不牺牲质量的前提下节省时间和金钱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。