← 最新论文
🤖 machine learning

Ranking Before Serving: Low-Latency LLM Serving via Pairwise Learning-to-Rank

原作者: Yiheng Tao, Yihe Zhang, Matthew Dearing, Xin Wang, Yuping Fan, Michael E. Papka, Zhiling Lan

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiheng Tao, Yihe Zhang, Matthew Dearing, Xin Wang, Yuping Fan, Michael E. Papka, Zhiling Lan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营一家繁忙的咖啡店。你有一排等待点单的顾客(即请求/Requests),而你只有一名咖啡师(即大语言模型/LLM),他一次只能制作一杯饮品。

问题:“长订单”瓶颈

在传统的咖啡店中,你使用“先到先得”的规则。如果排在第一位的人点了一杯需要制作 20 分钟的复杂拿铁,那么后面所有的顾客——即使是只想买一杯快速浓缩咖啡的人——也必须等待 20 分钟。这被称为队首阻塞(Head-of-Line blocking,简称 HOL blocking)

在 AI 世界中,这是一个巨大的问题。有些 AI 问题非常简单,只需一秒钟就能回答;而另一些问题,特别是那些能够进行逻辑推理、逐步思考数学问题或代码的新型“推理型”AI 模型,可能需要几分钟时间来生成响应。如果一个耗时较长的、需要深度思考的请求卡在了队伍的最前面,它会延迟所有人,让整个系统显得缓慢且迟钝。

解决方案:“智能预测器”(PARS)

这篇论文介绍了一个名为 PARS(提示词感知排序调度器/Prompt-Aware Ranking Scheduler)的新系统。你可以把 PARS 想象成一位站在柜台后方的超级聪明的、隐形的经理,他能在咖啡师甚至还没开始制作之前,通过观察顾客的订单单据(即提示词/Prompt),瞬间猜出这杯饮品制作需要多长时间。

PARs 不再按照到达的顺序进行服务,而是重新排列队伍,让“快速浓缩咖啡”类的订单先走,接着是“中等难度”的订单,最后才轮到那份“20 分钟拿铁”。这被称为**最短作业优先(Shortest-Job-First/SJF)**调度。

它是如何工作的:“成对比较”的小技巧

棘手之处在于,AI 是不可预测的。有时同一个问题可能会得到很短的回答,有时则会得到很长的回答,这纯粹取决于随机性。如果经理试图猜测确切的时间(例如:“这会花费 42 秒”),他可能会猜错,从而搞乱整个队列。

为了解决这个问题,PARS 使用了一个聪明的技巧——成对学习(Pairwise Learning)

  • 旧方法: 尝试为每一个订单预测确切的时间。(就像是在猜一个西瓜的具体重量)。
  • PARS 方法: 每次只比较两个订单。问自己:“订单 A 是否可能比订单 B 需要更长的时间?”(就像是说:“这个西瓜肯定比那个苹果重”)。

该系统经过训练,可以忽略那些微小的、令人困惑的差异,而只专注于明显的差异(例如:“这个数学题显然比那个简单的问候语要难得多”)。通过专注于这些清晰的对比,这位经理变得非常擅长对队伍进行排序,而不会被 AI 的随机波动所干扰。

结果:为每个人提供更快的服务

研究人员在一种流行的 AI 服务工具 vLLM 中对该系统进行了实测。他们发现:

  1. 巨大的提速: 通过让短任务优先执行,他们将用户的平均等待时间与标准的“先到先得”方法相比,最高降低了 15.7 倍
  2. 无额外成本: 这个“经理”(预测器)非常轻量化。排序几乎不占用时间,因此不会拖慢咖啡师的速度。
  3. 适用于任何模型: 该系统的预测能力非常出色,如果你在一个类型的 AI(如 GPT-4)上训练它,它仍然可以有效地为完全不同的 AI(如 Llama 或 DeepSeek)进行排序,而无需重新训练。这就像是一位学会在咖啡店里处理订单的经理,可以立即胜任茶馆的工作。
  4. 公平性: 为了确保“20 分钟拿铁”的订单不会等待太久,系统设置了一个安全阀。如果一个长订单等待时间过长,它会被提升到队伍的前列,以确保没有人会“饿死”。

总结

这篇论文提出了 PARS,一个像 AI 请求交通警察一样的智能调度系统。它不再让一个漫长且复杂的请求阻塞队伍,而是利用一种聪明的、基于比较的猜测游戏,让快速请求先行。这使得整个 AI 系统感觉更加快速且响应迅速,尤其是在处理那些喜欢在回答前进行长时间“思考”的新一代 AI 时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →