Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems
本文介绍了 Borg,这是一个利用可组合动态图和编码智能体来自动演进统一的大语言模型(LLM)服务模拟器的智能体驱动框架,与现有工具相比,该框架显著缩短了开发时间并提高了吞吐量准确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大语言模型已成为能够编写代码、解决复杂问题并进行对话的强大工具。然而,运行这些模型并不像按下按钮那么简单;它需要一个复杂的系统来管理信息流、决定优先处理哪些请求,并高效地分配计算能力。这个被称为“推理服务”(serving)的领域,是维持这些智能系统为数百万用户平稳运行的引擎室。由于技术正以惊人的速度演进,新的模型和方法层出不穷,工程师们无法总是等待构建出物理机器后再去测试他们的想法。相反,他们依赖于计算机模拟——这些虚拟实验室让他们能够在投入数百万美元购买硬件之前,预测新系统设计的性能表现。
多年来,这些虚拟实验室一直像僵化的、预制好的结构一样被构建出来。研究人员会将每一种可能的情景手动编码进一个单一且固定的流水线中。当技术变化缓慢时,这种方法效果良好,但人工智能的格局已经发生了剧变。使用这些模型的新方式已经出现,例如“智能体”(agentic)工作流,即单个请求会触发一系列多次决策和工具调用;或者是“解耦式”(disaggregated)系统,其中处理的不同部分发生在不同的机器上。这些现代行为无法适配旧有的、僵化的流水线。每当出现一项新功能,工程师们都必须拆解模拟器并从头开始重建,这是一个缓慢且易出错的过程,导致虚拟模型落后于它们本应代表的真实系统。
来自韩国 KAIST 的一个研究团队引入了一种解决此问题的新方法,称为 Simthesizer。他们并没有为每一个新功能构建一个新的模拟器,而是创建了一个灵活的框架,允许计算机程序自行编写模拟器本身。该系统的核心是一个动态的工作流地图,其中的每一个步骤都是一个节点,可以随时被添加、删除或重新排列。这张地图不是固定的;它是一个活性的结构,可以不断增长以适应新方法,而不会导致整个系统崩溃。为了实现这一点,研究人员聘请了一个编码智能体(coding agent)——一个专门的人工智能助手——来充当构建者。当研究人员要求增加一项新功能时,该智能体会阅读请求,理解模拟规则,并编写必要的代码将其集成到地图中。
整个过程由严格的护栏引导,以确保智能体不会犯错。系统要求智能体首先写出关于新功能应如何运作的清晰规范,然后精确绘制其在现有结构中的位置,最后编写代码。在接受新功能之前,系统会根据真实世界的数据或既定证据对其工作进行检查,以确保其行为正确。这种方法使模拟器能够随着其所建模的技术同步演进。在测试中,研究人员要求智能体为模拟器添加三个复杂功能:一种压缩内存使用的方法、一种通过预测后续词汇来加速文本生成的技术,以及对一种新型模型架构的支持。该智能体成功构建了这些扩展,且生成的模拟结果非常精确。
当研究人员将这些新模拟器的性能与在实际硬件上运行的真实系统进行对比时,结果令人瞩目。使用这种新框架构建的扩展功能在匹配真实世界吞吐量时的平均误差仅为 2.51%。相比之下,当同一个编码智能体尝试使用旧有的、僵化的方法向现有模拟器添加相同功能时,误差率跳升至 6.03%。新系统不仅更准确,而且速度显著更快。它的运行速度比一个领先的竞争对手快达 284.96 倍,比另一个快 23.19 倍。这种速度优势源于新系统不需要为每一个微小的变化都重新运行整个模拟引擎;它只需更新地图中需要改变的特定部分即可。
研究人员证明,这种方法适用于不同类型的编码智能体,而不仅仅是他们最初使用的那一个,这表明该方法具有鲁棒性和通用性。通过将灵活、可组合的基础设施与自动化构建者相结合,Simthesizer 弥合了人工智能的快速演进与其研究工具之间的鸿沟。它提供了一种方式,使人们能够跟上这个变化速度超过人类工程师手动更新工具的速度,确保用于设计未来计算的虚拟模型保持准确、可靠,并为即将到来的任何变革做好准备。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。