Benchmarking LLM Serving Systems for Agentic AI Workloads with XPerf
本文介绍了 XPerf,这是一个基准测试框架,它通过利用细粒度的追踪重放方法来克服非确定性控制流带来的挑战,从而实现对多样化智能体 AI 工作负载下 LLM 服务系统的可复现负载测试和详细性能分析。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,新一代软件已经涌现,它们不仅仅是简单地回答问题,而是能够执行任务。这些被称为“智能体”(agents)的程序可以将复杂的任务分解为较小的步骤,利用数字工具收集信息,并根据所发现的内容做出决策。与在每次响应后都等待新提示的标准聊天机器人不同,智能体可能会规划一个研究项目,在网上搜索数据,编写代码来分析这些数据,然后根据结果优化其方法。这个过程涉及一个持续的“思考与行动”循环,软件在单次会话中会多次调用大语言模型来引导其旅程。
为了让这些智能体在现实世界中发挥作用,为其提供动力的计算机系统必须极其快速且高效。这些被称为“推理引擎”(serving engines)的系统负责处理语言模型的计算。然而,测试这些引擎的表现非常困难,因为智能体所采取的路径是不可预测的。就像人类解决一个问题在某天可能需要五步,而在另一天可能需要十步一样,即使给予完全相同的初始指令,智能体的旅程每次运行都会发生变化。这种不可预测性使得工程师很难判断一个系统是真的快,还是仅仅因为某次测试恰好比较简单而显得“运气好”。
为了解决这个问题,来自伊利诺伊大学和 IBM 研究院的研究人员开发了一种名为 XPerf 的新工具。该系统允许工程师记录智能体在执行实际任务期间所采取的确切路径,然后反复回放该路径,以测试不同的计算机系统。通过捕捉决策和行动的具体序列,XPerf 消除了偶然因素。它确保当工程师测试新的软件更新时,他们是在针对完全相同的负载进行对比,而不是在猜测系统如何处理一组不同的、随机的步骤。这种精确性对于识别瓶颈以及理解系统为何在压力下变慢至关重要。
研究人员使用 XPerf 研究了八种不同类型的智能体应用,涵盖了从编写代码和调试软件到进行深度研究及回答复杂问题的工具。他们发现,这些应用的运行方式与标准聊天机器人截然不同。虽然典型的对话可能涉及几次往返消息,但一个智能体在完成单个用户请求时,可能会触发数十次内部对语言模型的调用。在某些情况下,向一个编程智能体发送单个请求会导致平均十七次单独的语言模型调用,有些请求甚至会触发近四十次。这种复杂性意味着系统必须管理一个相互依赖的任务网络,其中一个步骤必须在前一个步骤完成后才能开始。
他们测试中的一个重大发现是,这些系统的性能对请求的处理方式高度敏感。研究人员观察到,当许多智能体同时运行时,系统往往难以记住之前步骤的上下文。语言模型依赖一种称为“缓存”(cache)的短期记忆形式,以避免重复读取已处理过的信息。然而,当系统处于高负载状态时,它有时会为了腾出空间给新请求而剔除旧信息,即使这些信息在稍后就会再次被需要。这迫使计算机从头开始重新计算,从而浪费时间和能源。研究表明,这种“抖动”(thrashing)效应会导致系统速度显著下降,在某些应用中,当请求数量增加时,其速度下降了近百分之四十。
团队还测试了管理多个计算机处理器的不同策略的效果。他们发现,仅仅将工作均匀地分配到所有可用处理器上的做法并不总是能获得最佳结果。事实上,一种将单个智能体旅程的所有步骤保留在同一个处理器上的策略要高效得多。这种方法允许系统保留必要的上下文,从而避免了重新计算信息。通过使用 XPerf 在不同条件下重放完全相同的负载,研究人员可以清晰地看到,这种针对性的方法比传统的随机分配工作的方法将处理速度提高了三倍多。
除了测量速度之外,XPerf 还提供了对计算机硬件本身内部运作情况的详细观察。研究人员可以精确看到计算机使用了多少内存以及处理器芯片的工作强度。他们发现,当系统由于内存管理不善而被迫重新计算信息时,计算机的处理器虽然在努力工作,但并没有产生有用的结果。这是一种“高投入、低效率”的情况。这种细致的程度有助于工程师不仅了解系统为什么慢,还能了解其缓慢的具体原因,从而修复导致问题的特定软件部分。
该研究还强调,智能体的设计方式与它运行的计算机同样重要。研究发现,某些应用之所以比其他应用更高效,并不是因为它们更聪明,而是因为它们的设计更好地契合了计算机的内存。例如,一个研究工具在发送每条消息时都会添加一个变化的时刻戳,这在无意中破坏了它复用内存的能力,迫使系统每次都从头开始。通过移除这一不必要的改动,研究人员能够显著提高系统的效率。这表明,软件编写方式的微小变化会对性能产生巨大的影响。
最终,XPerf 充当了人工智能智能体世界的可靠镜像。它允许开发者清晰地观察他们的系统,而不受随机变化带来的失真影响。通过提供一种测试、测量和理解这些复杂应用的方法,该工具有助于确保下一代人工智能软件是稳健、快速且准备好应对现实世界需求的。研究人员已将此工具向公众开放,希望它能加速为所有人开发更好系统的进程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。