HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization
HeraSys 是一个 LLM 服务系统,它通过结构化节点合并来消除跨工作流的计算冗余,并采用负载感知的联合调度策略,通过优化并发多租户工作流的端到端性能,从而显著降低尾部延迟并提高吞吐量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个繁忙的厨房,一群厨师正试图同时烹饪数百道复杂的菜肴。在人工智能的世界里,这些“菜肴”就是大语言模型(LLM)执行的任务——这些是能够写故事、回答问题并解决问题的超级智能计算机大脑。通常情况下,当你要求 AI 做某事时,它被视为一个单一、孤立的订单。但在现实世界中,应用程序正变得越来越像一场盛大的宴会:一个请求可能涉及搜索信息、查询数据库,然后撰写一份摘要,这一切都在一次操作中完成。这些被称为“工作流”。
问题在于,当许多人同时订购这些复杂的宴会时,厨房就会变得混乱。如果两名顾客都要求切同一种食材,厨房可能会切两次,从而浪费时间和精力。更糟糕的是,如果一位顾客订购了一份需要长时间炖煮的大型炖菜,厨师们可能会卡在上面,导致其他所有人都在等待他们的快速沙拉上桌。这就是“服务”AI 的挑战:你如何管理大量复杂且重叠的请求,而不至于让系统停滞不前或让某些人永远等待下去?
这就是名为 HeraSys 的新系统发挥作用的地方。把 HeraSys 想象成一位革命性的厨房经理,她不仅关注单个订单,还会观察整个厨房地面,看看不同的订单之间如何相互协作。HeraSys 不再将每个请求视为独立的孤岛,而是寻找重叠之处。如果两个不同的顾客需要分析同一个文档或使用同一个工具,HeraSys 会说:“嘿,让我们只做一次并共享结果!”它还扮演着交通警察的角色,确保快速简单的订单不会被卡在缓慢沉重的订单后面,同时也确保那些慢速订单不会因为缺乏关注而被“饿死”。
HeraSys 背后的研究人员构建了一个系统,将这些复杂的 AI 任务分解成微小的、细粒度的部分。他们发现,通过合并重复的步骤并智能地调度谁可以使用厨房的资源(比如强大的计算机芯片),他们可以让整个系统运行得更快。在测试中,他们展示了 HeraSys 可以将最慢请求的完成时间缩短高达 2.17 倍(这意味着速度提高了两倍多),并且与现有最优秀的系统相比,将系统能处理的任务总量提升了高达 1.85 倍。
该论文反对传统的方法,即系统将每个请求视为一个独立、孤立的任务。他们指出,这种“孤立性”会造成不必要的浪费和瓶颈。相反,他们提出了一种协作式的方法,即系统会主动寻找共同的工作。他们还反对简单的调度规则,例如“先来先服务”(这会导致长任务阻塞所有人)或“最短作业优先”(这会让长任务等待太久)。HeraSys 建议采用一种平衡的、“负载感知”的策略,即为重型任务保留部分资源,同时优先处理快速任务,从而确保对每个人都公平且高效。
通过在真实硬件上的广泛实验所得到的结果表明,这种细粒度、协作式的方法是一个重要的进步。通过融合冗余步骤并动态调整任务的分组和执行方式,HeraSys 能够保持较低的平均等待时间,同时防止了经常困扰复杂 AI 系统的“尾部”缓慢且令人沮丧的延迟。这有点像意识到如果你组织一群朋友打扫房子,你不应该只是给每个人分配一个房间;你应该注意到两个人都在同时吸尘同一个走廊,并让他们协同工作,同时确保洗窗户的人不会因为等待吸尘器而停滞不前。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。