← 最新论文
🤖 AI

Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads

本文提出了一种延迟感知型查询路由系统,该系统集成了一个轻量级的首字时间估计器,并采用针对准确性、成本和延迟的联合优化策略,与标准负载均衡方法相比,在不增加响应时间的情况下,实现了高达 40% 的准确性-成本效用提升。

原作者: Shivam Patel, Akaash R. Parthasarathy, Ankur Mallick, Gauri Joshi

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Shivam Patel, Akaash R. Parthasarathy, Ankur Mallick, Gauri Joshi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你拥有一支厨师团队,每位厨师都有不同的技能水平和价格标签。有些是名厨,能做出米其林星级大餐,但收费昂贵且耗时较长。另一些则是快速、实惠的流水线厨师,能迅速做出还不错的汉堡。在人工智能的世界里,这些“厨师”就是大语言模型(LLM)——它们是背后支撑着编写故事、解决数学问题或总结新闻的聊天机器人的大脑。当你提出问题时,一个“路由”(router)会决定由哪位厨师来接单。目标很简单:以最低的价格获得最好的答案。

但有一个问题,大多数路由器至今都在忽略它:排队。即使你选到了完美的厨师,如果他们正忙于处理其他订单,你的食物可能会在厨房里搁置很久。在 AI 世界中,这种等待时间被称为“延迟”(latency)。如果你在聊天机器人忙碌时向它提问,你可能会盯着旋转的等待光标看上好几分钟。这是一个问题,因为有时候你需要的是“立刻”得到答案,而不仅仅是一个“好”的答案。研究人员试图解决的核心问题是:我们如何在不破坏预算的前提下,既能选出合适的厨师获得优秀的答案,又能快速得到结果,即便是在厨房一片混乱的情况下?

来自卡内基梅隆大学和微软的研究人员推出了一项新研究,试图解决这个确切的问题。他们意识到,目前的系统在平衡质量和成本方面做得很好,但它们是“延迟无关”(latency-agnostic)的,这意味着它们对实际排队情况是盲目的。为了解决这个问题,团队构建了一个聪明的、轻量级的“模拟器”,它就像一个数字水晶球。它不仅仅是猜测服务器有多忙,而是实时观察厨房的情况。它观察有多少订单正在等待,当前的菜肴需要多久才能做熟,甚至观察厨房工作人员是如何进行批量化工作的。然后,它会精确预测你的特定订单需要多久才能吃到第一口食物(他们称之为“首个 Token 生成时间”,即 Time-to-First-Token)。

通过将这种预测输入到他们的路由系统中,研究人员创建了一个智能调度器,它不仅看菜单价格或厨师的声誉,还会观察等待时间。他们使用不同类型的提问和不同程度的厨房混乱情况对该系统进行了测试。结果令人振奋:与标准方法相比,他们的新方法将整体“价值”(平衡了质量、成本和速度)提升了高达 40%,同时保持了与现有最佳负载均衡技巧相当的低等待时间。简而言之,他们找到了一种方法,通过最终关注“排队情况”,让 AI 聊天机器人变得更快、更便宜、更聪明。

他们创新的核心是一个被称为“服务框架模拟”(Serving Framework Simulation, SFS)的工具。把它想象成繁忙高速公路上的交通控制器。旧的方法可能只是计算路上的车辆总数并猜测行驶时间。但 SFS 更聪明;它模拟实际的驾驶条件。它知道有些车快但重(比如长而复杂的提问),而有些车轻但数量多。它还知道高速公路有特定的规则,关于车辆如何汇入以及行驶速度有多快。通过模拟这些规则,SFS 可以精确预测一辆新车何时到达出口匝道。

研究人员发现,仅仅根据路上的车辆数进行猜测(他们称之为“基于吞吐量的估计法”)往往会导致错误的预测。如果高速公路上堵满了缓慢、沉重的卡车,那么即使总车辆数并不多,一辆新车也可能会被卡住。然而,他们的模拟器考虑到了这种“交通拥堵”效应。他们在各种任务(从写短篇故事到总结长篇报告)上测试了他们的系统,发现它始终优于旧方法。在模拟中,他们的方法比现有的最佳基准方法在“及时效用”(OnTimeUtility,一个衡量答案质量、成本以及是否按时到达的分数)上提高了 33% 到 40%。

该系统处理“突发性”流量的方式也是最有趣的发现之一。想象一下突然涌入的大量订单,就像午餐高峰期的顾客。旧系统经常会被压垮,并将所有人发送给最便宜但最慢的厨师,从而导致严重的延迟。而新系统则会动态地转移负载。它可能会因为排队较短,将一个简单的问题交给一个快速且廉价的模型;或者将一个复杂且紧急的问题交给一个功能强大、虽然排队稍长但整体完成任务速度更快的模型。这种灵活性使其即使在需求激增时也能保持高性能。

团队还展示了其模拟器本身的速度极快。运行模拟并做出决策所需的时间不到一毫秒,这意味着它不会拖慢它试图帮助的系统。这至关重要,因为如果路由器决策耗时过长,就违背了节省时间的初衷。他们验证了预测的准确性,在测试中误差率低于 5%,这比他们观察到的旧式简单猜测方法的 85% 误差率有了显著提升。

最终,这篇论文表明,高效 AI 的未来不仅仅在于构建更大的模型或寻找更便宜的模型,而在于成为一个更好的“交通管理者”。通过将“哪个模型最好”的智慧与“排队有多长”的现实相结合,我们可以创造出即使在高负载下也让人感觉即时且响应迅速的系统。虽然这些结果来自模拟和受控实验,但作者认为,这种方法为使 AI 服务在现实世界中更加可靠和用户友好提供了一条切实可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →