Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling
本文提出了 AFlex,这是一个通过解耦的 Attention-FFN 执行、资源与频率联合优化,以及能够适应算子级频率敏感性并满足严格延迟 SLO 的交错流水线,从而将 LLM 服务中的能耗降低高达 49% 的框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在一个巨大的数据中心里运行着一个庞大的、超级聪明的机器人大脑。这个被称为“大语言模型”(LLM)的大脑是聊天机器人、编程助手和创意写作背后的引擎。但问题在于:这些大脑非常贪婪。它们消耗着海量的电力,通常让它们的处理器以全速运转,就像赛车引擎即使在堵车时也保持着最高转速一样。这是一个问题,因为这不仅耗资巨大,还会产生大量的热量。
为了让这些机器人运行得更快,科学家们已经发现了如何拆分工作。把机器人的思考过程想象成有两个主要步骤:首先,它阅读并理解你的问题(“预填充”阶段),其次,它逐字逐句地写出答案(“解码”阶段)。最近,工程师们意识到,将这两个步骤放在不同的房间里,由不同的团队来完成,比让一个团队同时做这两件事更好。这种做法被称为“解耦”(disaggregation)。它能让机器人回答得更快,但并不一定会减少电力的消耗。事实上,如果你只是降低工人的速度来节省能源,机器人可能会变得太慢而错过截止日期。大问题在于:我们如何在不让机器人卡顿或失败的前提下,通过减速来节省能源?
这篇论文介绍了一个名为 AFlex 的巧妙新系统,它通过将机器人的大脑视为一个拥有不同能量需求的专家团队,解决了这个难题。研究人员发现,机器人大脑的两个主要部分——关注你词汇的部分(注意力机制,Attention)和处理逻辑的部分(前馈网络,即 FFN)——是不一样的。它们就像两位不同的运动员:一位是需要高速冲刺的短跑选手,而另一位是如果过度推挤就会疲劳、但能保持稳定且高效节奏的长跑选手。
此前,系统将整个大脑视为一个整体,强迫短跑选手和长跑选手以完全相同的速度奔跑。如果你为了帮助短跑选手而加速,长跑选手就会浪费能量;如果你为了节省长跑选手的能量而减速,短跑选手就会变得太慢。作者发现,这两个部分实际上会根据机器人在做什么、问题的长度以及有多少人同时提问,而偏好不同的速度。
为了解决这个问题,AFlex 扮演了一个聪明经理的角色,它可以为短跑选手和长跑选手提供各自独立的赛道以及各自的个人速度设置。它使用一个“全局调度器”(Global Scheduler)来规划大局,决定为每个任务分配多少工人,并使用一个“局部控制器”(Local Controller)来实时(秒级)微调他们的速度。该系统还使用了一种特殊的流水线技术,让工人在工作时互相传递笔记,这样就没人会闲坐等待。这种“交错式”(interleaved)的方法让装配线平稳运行,没有任何间隙。
研究人员在强大的计算机芯片(NVIDIA A800 GPU)上,利用来自编程和对话任务的真实世界数据对 AFlex 进行了测试。他们发现,通过让注意力机制和 FFN 部分以各自独特的节能速度运行,该系统生成的每个单词所消耗的能量,与目前最好的拆分工作的方法相比,最多可减少 49%;与那些仅仅尝试降低整个芯片速度的系统相比,减少了 48%。至关重要的是,机器人的回答速度与之前一样快,达到了所有的速度承诺。这篇论文表明,这种赋予 AI 大脑不同部分不同速度的方法,是让人工智能在不牺牲性能的前提下实现更高能源效率的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。