← 最新论文
🤖 AI

Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective

本文提出了一种名为 Helium 的感知工作流的服务框架,它从数据系统视角出发,通过将智能体工作流建模为查询计划并整合主动缓存与感知缓存的调度技术,有效解决了现有 LLM 服务系统忽视跨调用依赖的问题,从而显著提升了智能体工作流的执行效率。

原作者: Noppanat Wadlom, Junyi Shen, Yao Lu

发布于 2026-03-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Noppanat Wadlom, Junyi Shen, Yao Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Helium 的新系统,它的目标是让现在的"AI 智能体”(AI Agents)工作得更快、更省钱。

为了让你轻松理解,我们可以把AI 智能体想象成一家超级繁忙的咨询公司,而Helium就是这家公司的超级调度员

1. 背景:现在的“咨询公司”有多乱?

想象一下,你雇佣了一群 AI 助手(智能体)来帮你分析股市。

  • 传统做法(像现在的 vLLM 等系统): 你给每个助手发任务,他们就像一个个独立的“单干户”。
    • 助手 A 说:“我要读这篇财报。”
    • 助手 B 说:“我也要看这篇财报,还要读那个新闻。”
    • 助手 C 说:“我也要看财报,还要看新闻,然后写个总结。”

问题出在哪?
现在的系统就像是一个只懂“单线程”的老板

  1. 重复劳动: 助手 A、B、C 都要读同一篇财报。老板却让他们每个人重新读一遍,完全不知道他们读的是同一份文件。
  2. 记忆浪费: 读财报需要“预热”大脑(在技术上是加载 KV 缓存)。助手 A 刚读完,助手 B 来了,老板却把助手 A 刚热好的大脑清空了,让助手 B 重新预热。
  3. 缺乏全局观: 老板只盯着眼前这一个任务,不知道后面还有 100 个任务在排队,也不知道这些任务里有很多内容是重复的。

这就导致了效率极低,算力(钱)被大量浪费

2. Helium 的解决方案:像“数据库”一样思考

这篇论文的作者(来自新加坡国立大学)发现,AI 智能体的工作流程其实和数据库处理查询非常像。于是,他们把数据库的优化技术搬到了 AI 领域,造出了 Helium

Helium 就像是一个拥有上帝视角的超级调度员,它做了三件大事:

第一招:把“黑盒”变成“白盒” (Query Optimization)

  • 以前的情况: 老板把 AI 当作一个黑盒子,只知道“输入问题,输出答案”,不知道中间发生了什么。
  • Helium 的做法: 它把 AI 的每一次调用都看作是一个具体的操作步骤(就像数据库里的“算子”)。
  • 比喻: 就像在厨房里,以前的老板只说“做顿饭”,不管过程。Helium 则拿着菜单说:“哦,A 厨师和 B 厨师都要切洋葱,那我们就只切一次,切好放在中间,大家直接拿,不用每个人都去切。”
  • 效果: 自动发现并砍掉重复的步骤(比如重复的提示词、重复的中间结果)。

第二招:主动缓存 (Proactive Caching)

  • 以前的情况: 只有当 AI 真的开始读文件时,系统才去缓存。如果两个任务隔得太远,缓存就过期了。这是“被动”的。
  • Helium 的做法: 它会在任务开始前,先预演一遍整个流程。
  • 比喻: Helium 就像是一个聪明的图书管理员。在大家还没开始读书之前,他就发现:“哎呀,这 100 个人都要读第一章,而且第一章内容都一样。”于是,他提前把第一章复印好,放在每个人手边。大家一伸手就能拿到,完全不用重新去书架上找。
  • 效果: 把那些“预热大脑”的时间(Prefill)省掉了,直接复用。

第三招:智能排班 (Cache-Aware Scheduling)

  • 以前的情况: 任务来了就随机分配给空闲的 AI,不管它们之间有没有关系。
  • Helium 的做法: 它画了一张关系树(Templated Radix Tree),知道谁依赖谁,谁和谁有共同的前缀。
  • 比喻: 想象你在安排一群工人搬砖。
    • 普通调度: 工人甲搬完 A 区的砖,工人乙去搬 B 区的砖,工人丙又去搬 A 区的砖。工人甲刚把 A 区的路理顺,工人丙又得重新走一遍。
    • Helium 调度: 它说:“工人甲、乙、丙都要先走 A 区的路。那就让他们排成一队,一个接一个地走,路刚铺好,下一个人直接接着走,不用重新铺。”
  • 效果: 让 AI 们连续处理相似的任务,最大化利用“缓存”,减少等待和重复计算。

3. 结果有多好?

作者做了很多实验,比如让 AI 模拟“金融交易员”、“多轮辩论”等复杂场景。

  • 速度提升: Helium 比目前最顶尖的系统快了 1.34 倍到 1.56 倍。在某些极端重复的场景下,甚至快了 100 倍(因为旧系统完全不懂批量处理,而 Helium 把重复工作全砍了)。
  • 省钱: 既然速度快了,用的显卡(GPU)时间就少了,电费自然也就省了。

总结

简单来说,Helium 就是把AI 智能体从“各自为战的单干户”,变成了“懂得协作、懂得复用、懂得规划的团队”。

它不再把 AI 当作一个个独立的黑盒,而是把它们看作数据流水线上的零件。通过提前规划、消除重复、智能排队,它让 AI 干活时不再“瞎忙”,而是聪明地忙

这就好比从“让 100 个人每个人单独去井里打水”进化到了“让 100 个人排好队,用一根水管直接引水”,效率自然天差地别。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →