HYDRA: A Heterogeneous Chiplet DSE Framework for Serving Dynamic Hybrid LLM Workloads
本文提出了 HYDRA,这是一个综合性的设计空间探索框架,通过对异构芯粒架构与动态运行时策略进行联合优化,显著提升了服务混合 Transformer-Mamba 大语言模型的吞吐量与延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代世界正运行在一种新型的数字智能之上,即能够编写故事、解决问题并进行对话的大型语言模型。这些系统已经变得如此庞大,以至于旨在运行它们的计算机芯片已难以跟上其步伐。多年来,业界一直依赖单个大型处理器来处理每一项任务,但随着这些模型变得越来越复杂,这种方法遇到了瓶颈。这些芯片变得造价过高、散热困难,且由于要同时处理为数百万用户提供服务的复杂任务组合,其速度也显得过于缓慢。为了解决这个问题,工程师们正在转向一种模块化的方法,将计算机分解为被称为“芯粒”(chiplets)的更小、更专业的组件。想象一下一辆高性能汽车,其发动机、变速器和燃料箱是独立的、经过优化的模块,可以被更换或重新排列,而不是一个单一、不可更改的金属块。这使得系统更加灵活且高效,但也引入了一个新问题:如何精确地安排这些部件以及如何管理它们之间的数据流,这是一个极其困难的谜题。
研究人员开发了一种名为 HYDRA 的新框架来解决这个谜题。这是一个复杂的工具,旨在探索这些模块化芯片可以组装的无数种方式,以及在运行时应如何管理它们。挑战在于,可能的排列组合数量如此之巨,以至于即使使用强大的计算机,逐一测试也需要数年时间。此外,这些模型所做的工作并非恒定不变;它会随着用户的需求不断变化。有时系统需要快速读取长文档,而有时则需要逐字生成响应。这些不同的阶段对资源的需求各异,且来自用户的请求组合是不可预测的。如果系统没有经过完美调优,就会浪费能量和时间,导致用户等待答案。
HYDRA 背后的团队创造了一种方法,可以在不需要测试每一种可能性时来应对这种复杂性。他们并没有尝试模拟每一种可能设计的每一个细节(这既缓慢又繁琐),而是构建了一个快速、智能的估算器。这个工具就像一位熟练的领航员,通过快速扫描潜在设计的景观来寻找最有希望的路径。它使用一种基于系统在不同活动状态之间移动的数学方法,从而能在几分钟内而非几周内预测性能。一旦该工具识别出最佳候选方案,研究人员随后会对这些顶尖选择进行详细且较慢的模拟,以确认其是否按预期工作。这种两步走的过程使他们能够探索以前无法处理的庞大设计空间,找到在速度和效率之间取得平衡的配置方式,而这些方式在之前并不明显。
探索的结果是显著的。当研究人员将他们最好的设计与现有的最先进系统进行对比测试时,他们发现这种新方法在相同时间内可以处理 1.55 倍的工作量。同时,用户收到第一个词响应的时间缩短了近一半。在某些特定场景下,改进甚至更为剧烈,系统的处理能力达到了以往方法的两倍以上。这些收益来自于硬件架构与运行其上的软件之间的精心协同设计。研究人员发现,仅仅增加功率是不够的;系统必须进行排列,使正确的部件靠近它们所需的数据,并且软件必须足够灵活,以便在工作类型发生变化时瞬间转移资源。
这项工作的一个关键发现是,物理组件的排列方式与组件本身同样重要。研究人员根据不同芯粒之间通信的需求程度,制定了一套将它们放置在硅板上的策略。通过将通信最频繁的部件聚集在一起,他们减少了数据在系统中传输的时间。这种具备通信感知能力的布局,结合一种动态分组用户请求的方法,使系统运行得更加顺畅。软件不会在等待一整批请求到达后再开始工作;而是在资源空闲时立即接入新的请求,使系统保持持续忙碌且高效。这种灵活性至关重要,因为它防止了系统在等待下一组用户到来时处于闲置状态。
研究还探讨了这些设计在所使用的特定模型发生变化时的表现。他们将针对某一特定模型优化的配置应用于其他不同的模型进行测试。他们发现,为一个特定模型构建的设计在运行不同模型时表现不佳。然而,一个旨在处理多种不同模型的优化设计,在执行各自任务时,其表现几乎与专门设计的模型一样出色,同时在面对新的、未见的模型时仍保持稳健。这表明,对于一个旨在服务于许多不同用户和应用的系统而言,一个灵活的通用设计比高度专业化的设计更有价值。它提供了一个安全网,确保系统在支持的人工智能类型不断演进时,依然能保持高效。
最终,这项工作证明了运行大型语言模型的未来在于硬件架构与软件管理的伙伴关系。你不能仅仅制造一个更快的芯片并期望它解决问题;你还必须构建一种更聪明的方式来管理流经该芯片的信息流。HYDRA 框架为这种协同设计提供了一个蓝图,它表明,通过仔细考虑部件如何组合在一起以及如何实时管理它们,我们可以构建出显著更快、更高效的系统。研究人员已向他人开放了他们的工具,希望能加速下一代计算系统的开发,从而为未来的人工智能提供动力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。