← 最新论文
🤖 AI

Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems

本综述全面概述了基于大语言模型的系统中的路由策略,分析了如何通过将查询动态导向合适的模型,来解决单体架构的低效问题,从而优化资源消耗、降低成本并提升性能。

原作者: Clovis Varangot-Reille, Christophe Bouvard, Antoine Gourru, Mathieu Ciancone, Marion Schaeffer, François Jacquenet

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Clovis Varangot-Reille, Christophe Bouvard, Antoine Gourru, Mathieu Ciancone, Marion Schaeffer, François Jacquenet

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:每当你提出一个问题,都有一支专家团队冲过来为你解答。有些专家才华横溢但反应迟钝且收费昂贵,就像一位按小时计费的诺贝尔奖得主;另一些则快速且廉价,就像一位知识渊博的朋友,能处理大多数事情,但在遇到极其复杂的谜题时可能会出错。在人工智能的世界里,这些“专家”就是大语言模型(LLM)。目前,大多数计算机系统都像是一家固执的餐厅,无论你点的是一杯简单的水还是一顿复杂的五道菜大餐,都会把订单发给厨房里最贵的厨师。这样做虽然可行,但既浪费又缓慢,而且非常耗能。科学家们正在思考的大问题是:我们如何构建一个更聪明的“领班”,能够一眼看出你的订单,并立即决定是将它交给那个快速、廉ски的助手,还是交给那位昂贵的天才?这就是一个被称为“路由”(routing)的新兴领域的核心,其目标在于以更少的投入实现更多的产出。

这篇题为《事半功倍》(Doing More with Less)的论文是对研究人员试图构建那个聪明“领班”的各种方法的一次大规模巡礼。作者们来自法国,他们不仅仅发明了一个新技巧,而是整理并归纳了目前正在测试的整个策略图谱。他们发现,节省成本和能源的最佳方式并不是为所有事情都使用一个巨大的大脑,而是创建一个系统,根据问题的难度将问题路由到合适的工具。他们发现,你通常可以使用一个微小的、廉价的模型来处理简单的问候语,而只把那些真正困难的逻辑谜题留给庞大且昂贵的模型。然而,他们也警告说,这目前还不是一根“魔杖”。有些方法在节省资金方面表现出色,但可能会牺牲准确性;而另一些方法则在实际应用中过于复杂。论文指出,未来的方向在于“自适应”系统,这类系统可以随着新工具的出现而学习并改变主意,而不是被困在僵化的规则之中。

核心问题:“一刀切”的厨师

把大语言模型(LLM)想象成一位超级聪明的厨师。有些厨师是全才;他们几乎什么都能做,从三明治到舒芙蕾。但他们雇佣成本高,且工作时间长。其他厨师则是专才;也许他们擅长做披萨,但做蛋糕却很糟糕。

目前,大多数 AI 系统就像是一家忽略菜单的餐厅。如果你要一杯水,系统会调用最昂贵、最强大的厨师(如 GPT-4 或 Claude)来完成。这是一种巨大的浪费。它成本高昂,消耗大量电力,而且比实际需要的时间更长。论文认为,我们需要一个“路由器”——也就是一位聪明的服务员——他会观察你的请求并决定:“嘿,这只是个简单的披萨订单,把它交给那个快速、廉价的实习生吧。”但如果你问了一个复杂的数学问题,服务员应该说:“好吧,这需要主厨出马。”

论文回答的三个大问题

作者将问题分解为三个简单的问题:我们要优化什么?我们何时做出决策?以及我们究竟如何构建这个路由程序?

1. 我们在节省什么?

大多数人认为唯一重要的就是钱。但论文指出,我们也需要关注时间(延迟)和环境(能源)。

  • 金钱: 每次 AI 回答问题,都会产生微小的单词(token)费用。
  • 时间: 等待一个缓慢而强大的 AI 来回答一个简单的“你好”,是非常令人恼火的。
  • 地球: 大型 AI 模型消耗大量电力。如果我们能用较小的模型处理 80% 的问题,就能节省大量的能源并减少碳足迹。

2. 我们何时做决定?

论文确定了“服务员”可以做出选择的两个主要时刻:

  • 生成答案之前(预生成): 服务员在任何人开始烹饪之前观察你的问题。他们猜测:“这看起来像是一个简单的披萨订单,”然后立即将其发送给廉价的厨师。这很快且省钱,因为大厨根本不会介入。
  • 生成答案之后(后生成/级联): 服务员让廉价的厨师先尝试。如果答案看起来不好或者厨师显得不确定,服务员随后再将问题发送给昂贵的厨师。这就像点了一份披萨,尝了一口,如果发现烤焦了,再打电话请主厨重新做一份。这种方式更稳妥,但速度较慢,且如果廉价厨师经常失败,成本也会更高。

3. 我们如何构建这个服务员?

这是最有趣的部分。论文回顾了几十种不同的“服务员”策略,并将它们分为四大类:

  • “找相似”型服务员(基于相似度): 这个服务员保留着过去问题的剪贴簿。如果你提出的问题听起来和你上周问过的问题很像,服务员就会把这个问题发给回答过那个问题的同一个厨师。这就像是在说:“上次你问关于猫的问题时,那位猫类专家表现得很好,所以这次关于猫的问题我也发给他们。”
  • “教师”型服务员(监督式): 这个服务员像学生一样接受训练。它学习识别模式。例如,它会学习到关于“数学”的问题通常需要数学专家,而关于“笑话”的问题则需要创意模型。这就像一个背诵了“哪位厨师负责哪道菜”教科书的学生。
  • “赌徒”型服务员(强化学习): 这个服务员通过试错来学习,就像电子游戏中的角色。它尝试不同的厨师,观察答案是否良好,如果它节省了成本且得到了好的答案,就会获得“奖励”。久而久之,它无需教科书就能学会最佳策略。
  • “自我反思”型服务员(生成式): 这是 AI 与自己对话的过程。服务员会询问廉价厨师:“你确定你能回答这个问题吗?”如果厨师说:“我不确定,”服务员会立即将问题转交给大厨。这就像问朋友:“你知道这个吗?”如果对方犹豫了,你就去请教专家。

论文排除了什么(“不必尝试”清单)

作者非常明确地指出了哪些不属于好的路由策略。他们明确表示,仅仅收集五个不同厨师的答案并从中挑选最好的做法(称为“集成方法”)并不等同于路由。那就像是订了五份披萨,然后扔掉坏掉的那几份;这太贵了。目标是在开始烹饪之前就选出正确的厨师,而不是把所有东西都做出来然后再进行挑选。

他们还指出,某些方法(例如让 AI 猜测自己的置信度)可能会遇到困难。有时 AI 会过度自信,在实际上并不知情的情况下说:“我知道!”这会导致如果系统信任了错误的厨师,从而产生错误的答案。

结论:前景广阔,但并不完美

论文总结道,路由是一个强大的工具,但它还不是一个已解决的谜题。

  • 它有效: 在许多测试中,智能路由可以减少一半或更多的成本,同时保持与使用大模型相当的答案质量。
  • 它很复杂: 最好的策略取决于具体情况。有时“找相似”的方法效果最好;而有时“教师”方法则更胜一筹。
  • 未来: 作者建议,下一个大步是让这些路由程序具有“自适应性”。目前,如果你在厨房里增加了一位新厨师,你往往需要重新训练整个服务员系统。未来的目标是创建一个能够瞬间理解新厨师技能并开始使用他们的服务员,而无需漫长的训练期。

简而言之,这篇论文是一本关于如何构建更聪明、更便宜、更环保的 AI 系统的指南。它告诉我们,不需要用大锤来砸一颗坚果。通过构建一个知道何时使用小锤子、何时使用大锤子的智能系统,我们可以让 AI 变得更快、更便宜,也对地球更友好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →