Theoretically Optimal Attention/FFN Ratios in Disaggregated LLM Serving
本文提出了一种分析框架和一种闭式配置规则,用于在解耦式大语言模型服务中确定理论最优的注意力层与前馈神经网络资源比例,该规则考虑了随机工作负载动态和同步开销,以最小化设备空闲时间和步级阻塞。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在运营一家庞大且高速的工厂,为巨型人工智能大脑生产“思想”(token)。这家工厂有两条主要的装配线协同工作,以完成每一个“思想”的生成:
- 记忆线(Attention):这支团队就像图书管理员。他们必须来回奔跑,从一本不断变大的巨书书架(KV 缓存)中为每个请求查找特定的页面。随着书架越来越大,这支团队的速度会越来越慢,因为他们必须搬运更重的负载。他们是受限于内存的。
- 计算线(FFN):这支团队就像超级快速的计算器。他们不需要查看书架;他们只需根据图书管理员交给他们的内容进行数值运算。他们是受限于计算的,并且如果有足够的工作量,他们可以以极快的速度工作。
问题所在:“不匹配的舞蹈”
在过去,这两支团队被困在同一个房间里。如果图书管理员动作缓慢,计算器就必须坐等,无所事事;如果计算器速度很快,图书管理员就会成为瓶颈。
为了解决这个问题,工程师们发明了一种名为**AFD(Attention-FFN 解耦)**的新布局。他们将图书管理员和计算器移到了不同的房间。现在,你可以让多支图书管理员团队为同一个巨型计算器房间提供数据。
但这里有个陷阱:一个计算器房间需要多少支图书管理员团队?
- 图书管理员太少? 计算器会因缺乏数据而闲置。
- 图书管理员太多? 计算器会不堪重负,而图书管理员则不得不站在一旁等待计算器跟上进度。
找到完美的比例(我们称之为 r),就像试图为一个厨师寻找完美数量的服务员一样。如果猜错了,整个工厂的速度都会变慢。
论文的解决方案:工厂管理者的“水晶球”
这篇论文的作者意识到,猜测这个比例之所以困难,是因为工作是随机的。
- 有些客户的问题很短;有些则是长篇大论。
- 有些请求很快完成;有些则耗时良久。
- 每个请求的“书架”(内存)增长方式都不同。
由于这种随机性,你不能仅仅使用基于平均值的简单数学公式。你需要一种方法来预测这种混乱。
他们的“秘密武器”是一个新的数学框架,它能做到三件事:
- 衡量“平均混乱度”:他们开发了一种方法,通过查看过去的请求日志(traces),计算出一个单一数值(称为 θ),该数值代表了真实的平均工作负载,同时考虑了这样一个事实:在任意随机时刻,更长的请求更有可能被观察到。
- 考虑“最慢的跑者”:在这家工厂里,所有图书管理员团队必须完成他们的工作,计算器才能开始。如果有一支团队被一本巨书卡住,整条生产线都会等待。作者们创建了一个公式,用于预测因这些“落后者”(最慢的工人)而损失了多少额外时间。
- 提供“黄金比例”配方:利用这两个洞察,他们推导出了一个简单的、封闭形式的规则。你只需输入硬件规格和请求日志,该公式就能告诉你,为了让计算器房间以最大速度运行,你需要多少支图书管理员团队。
结果:“它奏效了!”
该团队构建了一个数字模拟器(虚拟工厂)来测试他们的理论。
- 他们尝试了不同数量的图书管理员团队(从 1 到 32)。
- 他们将“黄金比例”预测值与模拟器找到的实际最佳性能进行了比较。
- 结论:他们的预测极其准确,与真实世界模拟的误差在 10% 以内。
他们还发现,随着图书管理员团队数量的增加,由最慢团队引起的“等待时间”确实会增加,但他们的公式考虑到了这一点,确保你不会添加过多的团队而浪费资金。
核心要点
这篇论文为构建这种拆分式 AI 工厂提供了一本科学规则手册。系统设计师不再需要猜测或进行试错,而是可以利用这套数学方法,精确地计算出如何平衡内存和计算资源,从而确保人工智能即使在负载不可预测的情况下,也能以最快速度和最高效率运行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。