Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics
本立场论文主张,大语言模型推理服务已超越通用启发式方法的范畴,亟需针对其独特性开发数学优化模型与算法基础,以确保在多样化工作负载下提供可证明的性能保障。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在经营一家规模宏大、高速运转的餐厅厨房。这家厨房不仅仅制作汉堡,而是根据陆续到达的订单,制作复杂的多道菜大餐。问题在于?你无法预知每道菜需要多长时间才能做好,而且厨师烹饪得越多,这道菜占用的柜台空间就越大,从而挤占其他订单的空间。
这正是当今大型语言模型(LLM) 所面临的处境。它们就是为搜索引擎、编程助手和聊天机器人提供动力的“厨房”。
这篇论文指出,目前这些数字厨房正依靠猜测和简单规则(启发式方法) 运行。作者认为,是时候转向数学精确性和坚实的算法基础,以使其更快、更便宜、更可靠。
以下是使用日常类比对该论文论点的分解:
1. 问题所在:“足够好”的规则正在失效
目前,像 vLLM 和 SGLang(运行这些模型的软件)这样的系统,使用的是从通用计算中借用的老式规则。
- 队列: 如果你有一排顾客,厨房只是按照他们到达的顺序提供服务(先到先得)。
- 路由: 如果你有多位厨师,厨房会将下一个订单发送给排队最短的厨师,或者只是随机轮转来选择一位。
- 清理: 如果柜台满了,厨房会扔掉柜台上最旧的物品,为新物品腾出空间。
论文的观点: 这些规则在普通汉堡店运作良好。但 LLM 很特殊。
- “生长”的菜肴: 与从开始到结束占用相同空间的汉堡不同,LLM 的菜肴在烹饪过程中会生长。AI 生成的每一个单词都会占用更多内存。
- “两阶段”烹饪: 订单的第一部分(读取提示)很快,但需要大量的计算能力(compute)。第二部分(生成答案)很慢,但需要大量的内存带宽。
- 未知: 在菜肴完成之前,厨房不知道它会有多长。
由于这些怪癖,旧的“最短队列”或“最旧物品出局”规则往往会导致混乱,让一些厨师闲置,而另一些厨师则不堪重负,或者导致柜台意外地空间不足。
2. 解决方案:引入数学家
作者表示,我们需要停止猜测,开始使用数学优化。这就像聘请一位精通物流的规划师,他使用超级计算机来计算运行厨房的完美方式,而不仅仅是遵循规则手册。
论文强调了数学可以修复厨房的四个具体领域:
平衡厨师(负载均衡):
- 当前方式: 将订单发送给票据最少的厨师。
- 数学方式: 精确计算每个订单随着其增长所需的“柜台空间”和“计算能力”,并分配它们,确保没有任何一位厨师因等待最慢的那一个而卡住。论文引用了一个真实系统(DeepSeek),它使用线性规划(一种数学方法)完美地做到了这一点,节省了时间和金钱。
等待队列(调度):
- 当前方式: 服务队列中的第一个人。
- 数学方式: 观察队列并意识到:“那个人点了一份 10 页的论文,但下一个人只想要一个一句话的笑话。”先服务笑话!它能更快地清空柜台,让更多人用餐。数学可以预测哪些订单会快速完成,以保持厨房的运转。
柜台空间(缓存):
- 当前方式: 当柜台满了时,扔掉最旧的物品。
- 数学方式: 意识到为了腾出空间给“微小缩略图”而扔掉“高分辨率视频”是一笔糟糕的交易。重新制作视频需要很长时间且代价高昂。数学可以计算扔掉物品的“成本”,并将昂贵的物品保留在柜台上。
规划人员(容量规划):
- 当前方式: 当队伍太长时,不断增加厨师。
- 数学方式: 使用公式,在开门营业之前就知道确切需要多少厨师,这基于预期的顾客数量。这从根本上防止了厨房变得不堪重负。
3. 为什么不坚持使用规则?
论文回应了那些说“当前规则运作良好,为什么要改变?”的怀疑论者。
- “它在规模上运作良好”:作者承认当前的规则运作得还可以,但它们很脆弱。如果一个病毒式应用突然发送一种奇怪的订单类型,厨房可能会崩溃。数学提供了一个安全网(保证),确保即使在最坏的情况下,厨房也不会失败。
- “硬件变化太快”:作者认为,虽然硬件(烤箱)在变化,但组织厨房的逻辑保持不变。数学为你提供了一张蓝图,即使你更换了烤箱,它依然有效。
- “系统工程更重要”:作者表示,数学和工程是合作伙伴。你可以拥有世界上最快的烤箱,但如果你的调度很差,烤箱就会闲置。数学告诉你如何让烤箱保持忙碌。
4. 大局观
论文得出结论,LLM 服务领域已经超越了其“童年”时期的简单规则。它已经成熟为一个复杂的系统,需要来自数学家和算法专家的“成人监督”。
通过将这些视为数学谜题而不仅仅是工程调整,我们可以获得:
- 可预测性: 确切知道系统将如何表现。
- 效率: 节省大量的能源和资金。
- 可靠性: 确保当情况变得疯狂时系统不会崩溃。
简而言之:停止猜测,开始计算。 AI 服务的未来不仅仅在于构建更大的模型,更在于构建更智能、经数学证明的运营方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。