← 最新论文
💬 NLP

AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

本文介绍了 AGENTSERVESIM,这是一种硬件感知的模拟器,它能够准确地模拟多轮 LLM 智能体服务的动态过程——包括程序编排、工具诱发的间隙以及 KV 缓存驻留——从而实现在无需大规模实际系统部署的情况下,在通用 CPU 上对服务策略进行可扩展且具成本效益的评估。

原作者: Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营一家繁忙的餐厅。

旧方式(标准 LLM 服务):
过去,提供 AI 模型服务就像是在经营一个快餐驱动窗口。每辆车(请求)进来,点一个汉堡(一个问题),拿到后就开车离开。厨房并不关心这辆车之前做了什么,或者接下来要做什么。每个订单都是独立的。如果这辆车稍后又回来了,它会被视为一个全新的顾客。

新方式(多轮对话智能体服务):
现在,想象这家餐厅正在举办一场复杂的烹饪比赛。一个团队(一个“智能体”)会在桌旁停留很长时间。他们会索要一种食材,然后厨师必须等待,直到团队去储藏室寻找一种香料(一次“工具调用”),然后他们再回来询问下一步的操作。这种情况在一个会话中会发生数十次。

  • 问题在于: 厨师(AI)必须记住整个食谱的过程。如果团队离开桌子去储藏室待了 5 分钟,厨师不应该把台面上的笔记(“KV 缓存”)扔掉,因为当团队回来时,他们还会需要这些笔记。如果团队回来时去了另一张桌子(另一台服务器),新的厨师必须从头开始重新阅读整个食谱,这既浪费时间又浪费资源。
  • 挑战在于: 管理这种场景非常困难。你必须决定:要把笔记留在昂贵且快速的柜台上吗?还是把它们移到后面较慢的架子上?如果团队离开的时间太长,是否应该把它们扔掉?以及谁应该处理该团队的下一轮操作?

解决方案:AGENTSERVESIM
作者构建了一个名为 AGENTSERVESIM虚拟餐厅模拟器

与其尝试在真实且昂贵的超级计算机上测试这些复杂的规则(这不仅耗资巨大,而且极其缓慢),他们构建了一个可以在普通、廉价计算机上运行的数字孪生系统。

以下是他们的模拟器是如何工作的,我们沿用餐厅的比喻:

  1. 程序编排器(领班):
    在旧的模拟器中,每个订单都被视为独立的。而这个模拟器有一个“领班”来追踪整个烹饪比赛,将其视为一个单一的“程序”。领班知道 A 队目前正在等待储藏室的反馈,并且不会在储藏室行程结束前允许下一个订单开始。

  2. 工具模拟器(储藏室计时器):
    有时团队需要去储藏室(运行像 greppytest 这样的工具)。这些行程可能耗时几毫秒或几分钟。模拟器有一个特殊的计时器,可以精确模拟这些延迟,以便系统测试:在等待期间,是将食谱笔记留在柜台上更好,还是移到架子上更好。

  3. 会话感知路由(桌位分配器):
    如果餐厅有多个厨师(服务器),这个路由器会尝试将 A 队送回他们开始时的那个厨师那里。这能让食谱笔记保留在原处,从而节省时间。如果那位厨师太忙了,路由器会计算将笔记移动到另一位厨师那里与直接重新开始之间的成本差异。

  4. KV 驻留模型(记录员):
    这是最聪明的部分。它决定将“食谱笔记”(KV 缓存)存储在哪里。

    • HBM(高速柜台): 快但空间小。
    • DRAM/CXL(后方货架): 慢但空间大。
      该模型会询问:“团队是在 10 秒后回来,还是在 10 分钟后回来?”如果是 10 秒,就把笔记留在柜台上;如果是 10 分钟,就将笔记移到货架上,以便让柜台为其他团队腾出空间。

为什么这很重要?
在真实的超级计算机上测试这些策略,就像是通过实际建造餐厅、雇佣员工并运营数周来测试一个新的餐厅布局一样,既昂贵又缓慢。

  • 结果: 作者使用他们的模拟器与真实的超级计算机(使用真实的 AI 模型和真实的硬件)进行了对比。他们发现,该模拟器预测“烹饪比赛”完成速度的误差小于 6%
  • 益处: 现在,工程师可以在普通的笔记本电脑上运行数千个“假设”场景,以找出管理这些 AI 智能体的最佳方法,而无需为每一次测试都去租用昂贵的超级计算机。

简而言之,他们构建了一个高度准确的 AI 智能体“飞行模拟器”,让研究人员可以在不导致“真实飞机失事”(或挥霍巨额燃料费用)的情况下,练习并优化如何运行复杂的、多步骤的 AI 任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →