← 最新论文
🤖 machine learning

A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints

本文提出了一种新颖的排队论框架,该框架整合了计算与 GPU 内存约束,以推导大语言模型推理的严格稳定性条件,从而实现精准的集群规模规划,并通过真实世界实验验证,其偏差小于 10%。

原作者: Chengyi Nie, Nian Si, Zijie Zhou

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengyi Nie, Nian Si, Zijie Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你经营着一家非常受欢迎的高科技面包店,名叫“大语言模型面包店”。顾客(请求)走进来,要求定制蛋糕(答案)。但这不是一家普通的面包店;它有两条非常具体且棘手的规则,使得经营变得困难。

两大难题

1. “记忆冰箱”(KV 缓存)
在普通面包店里,你烤好一个蛋糕,端给顾客,然后擦干净柜台。但在这家面包店里,每当一位顾客订购蛋糕时,你就必须为迄今为止使用过的每一种原料保留一张特殊的“食谱卡”。

  • 关键点: 在蛋糕制作过程中,你必须将所有这些食谱卡都保存在你的冰箱(GPU 显存)里。
  • 问题所在: 如果同时涌入太多顾客,或者他们订购了巨大而复杂的蛋糕,你的冰箱就会被食谱卡塞满。一旦冰箱满了,即使你的烤箱空着,你也无法接受任何新订单。系统会崩溃。

2. “缓慢的烤箱”(计算)
制作这些蛋糕需要很长时间。你不能一次性把所有蛋糕都烤好;你必须一层一层地烤。

  • 关键点: 如果你试图同时烤太多蛋糕,烤箱就会过载,烘烤速度会慢如蜗牛。
  • 问题所在: 如果顾客到来的速度快于你能烘烤的速度,就会排起长队。如果队伍太长,面包店就失去了作用,因为人们要永远等待。

旧方法与新方法

旧方法:
此前,试图经营这些面包店的人只关注烤箱(计算)。他们认为:“如果我有足够的烤箱,就能应对人群。”他们忽略了冰箱(显存)。这导致了灾难:他们拥有充足的烤箱,但冰箱里塞满了食谱卡,以至于无法烤制任何新蛋糕。

新方法(本文):
本文的作者构建了一个数学蓝图(排队论框架),同时审视烤箱冰箱

他们创造了一个简单的公式,来回答一个重大问题:“我需要购买多少台烤箱(GPU),才能确保我的面包店永远不会不堪重负,同时也不会因购买过多而浪费资金?”

蓝图如何运作

作者意识到,一位顾客的“成本”不仅仅在于烘烤他们所需的时间,还在于他们在整个服务期间,其食谱卡在冰箱中占据的空间。

  1. “生命周期占用”:他们计算了单个顾客从进店到离开期间,总共占用的“冰箱空间”。
  2. 稳定性分界线:他们在沙地上画了一条线。
    • 线以下:如果顾客数量少于你的冰箱与烤箱组合所能处理的容量,队伍就会保持短小,每个人都能迅速拿到蛋糕。系统是稳定的。
    • 线以上:如果顾客涌入过多,冰箱会填满,烤箱会卡住,队伍将无限增长。系统是不稳定的。

现实世界测试

作者们不仅仅在白板上做数学题。他们走进了一家真实的面包店(使用实际的 NVIDIA A100 高端计算机芯片),并测试了他们的蓝图。

  • 结果:他们的公式准确预测了面包店每秒能处理多少蛋糕。
  • 准确性:他们的预测与实际情况极其接近——通常与实际数值相差在**10%**以内。

为何这很重要(根据本文)

这份蓝图为面包店老板(系统操作员)提供了一件可靠的工具。他们不再需要猜测,也不必购买过多昂贵的烤箱(这会浪费资金)或过少的烤箱(这会让顾客生气);他们可以利用这套数学方法,计算出在特定顾客数量下,保持面包店顺畅运行所需的确切 GPU 数量

简而言之:本文提供了一本规则手册,用于平衡“烤箱速度”和“冰箱空间”,以确保你的 AI 面包店既不会耗尽空间,也不会陷入无尽的排队困境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →