← 最新论文
💻 computer science

Dynamic Mixed-Precision Routing for Efficient Multi-step LLM Interaction

本文提出了动态混合精度路由(DMR),这是一个框架,它利用两阶段训练流程,在长视野多步任务的每个决策步骤中自适应地在高精度和低精度大语言模型之间进行选择,以实现精度与成本之间的最佳权衡。

原作者: Yuanzhe Li, Jianing Deng, Jingtong Hu, Tianlong Chen, Song Wang, Huanrui Yang

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuanzhe Li, Jianing Deng, Jingtong Hu, Tianlong Chen, Song Wang, Huanrui Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一个侦探团队来解决一个复杂的多步骤谜题(例如在巨大的在线商店中寻找特定商品,或在虚拟房屋中导航)。

在人工智能的世界里,这些“侦探”就是大型语言模型(LLM)。为了获得最佳结果,你通常会雇佣最昂贵、训练有素的资深侦探(高精度模型)。他们才华横溢,但运行速度慢且成本极高。或者,你也可以雇佣一支由快速、廉价的初级侦探组成的团队(低精度/量化模型)。他们速度快且成本低,但有时会犯愚蠢的错误或遗漏关键线索。

问题在于,长期且复杂的任务需要许多步骤。如果你为每一个步骤都雇佣昂贵的资深侦探,成本将过高;如果你为每一个步骤都雇佣廉价的初级侦探,他们可能会因为在对棘手部分感到困惑而搞砸整个案件。

这篇论文介绍了一种名为动态混合精度路由(DMR)的智能解决方案。你可以将其想象为一位超级智能调度员,负责管理这些侦探。

调度员如何工作

调度员并非为整个任务只雇佣一种类型的侦探,而是实时观察调查的进展,并在每一步瞬间做出决定:

  1. 简单步骤:当任务 straightforward(例如“查看门”或“搜索红色衬衫”)时,调度员将工作分配给廉价、快速的初级侦探。他们能够快速且足够准确地处理这些任务。
  2. 关键步骤:当任务遇到“陷阱”或复杂谜题(例如“找出哪把钥匙能打开上锁的盒子”或“协商最终价格”)时,调度员会立即切换到昂贵、资深的侦探,以确保工作正确完成。

目标是在绝对必要时才使用昂贵的侦探,从而节省金钱和时间,同时仍能成功解开谜题。

调度员如何学习

该论文描述了一个两步训练过程,以教导这位调度员如何识别“关键步骤”:

  • 第一步:“影子跟随”阶段(KL 散度)
    想象调度员并排观察资深侦探和初级侦探处理同一个案件。大多数时候,他们对该做什么意见一致。但偶尔,初级侦探会感到困惑并提出错误的行动建议。调度员学会识别这两个侦探意见不一致的特定时刻。它学会了:“啊,每当初级侦探开始动摇时,我就需要叫上资深侦探。”

  • 第二步:“实战演练”阶段(强化学习)
    一旦调度员掌握了基础知识,它就开始进行实际的演练。它尝试不同的策略:“如果我在这一点叫上资深侦探会怎样?如果我等待一下会怎样?”它根据两点获得评分:**我们是否解决了案件?以及我们花费了多少时间/金钱?**随着时间的推移,它学会了以最低的成本解决最多案件的完美平衡。

结果

研究人员在两个现实场景中测试了该系统:

  1. WebShop:一个代理试图通过搜索和点击来在线购买特定商品。
  2. ALFWorld:一个代理试图通过拿起和放下物体来整理虚拟房间。

研究结果非常明确

  • “始终廉价”的方法:速度快,但经常因初级侦探在困难步骤上卡住而失败。
  • “始终昂贵”的方法:非常成功,但极其缓慢且成本高昂。
  • “调度员”(DMR)方法:其成功率与昂贵的资深侦探几乎相同,但速度快得多且成本低得多。在许多情况下,它的表现几乎与资深侦探一样好,但约 60–80% 的工作都使用了廉价的初级侦探。

核心结论

这篇论文表明,你不必在“昂贵且聪明”与“廉价且笨拙”之间做出选择。通过使用一个智能路由器,根据当前步骤的难度在两者之间动态切换,你可以兼得两者之长:在显著降低成本的同時保持高成功率。这就像拥有一个团队,其中初级员工处理常规工作,而专家仅在情况变得真正棘手时才介入。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →