MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems
MARS 是一个高效、自适应的协同调度系统,它通过将准入与执行解耦并优化状态保留,全局协调异构的 GPU-CPU 资源以服务于自主大语言模型智能体,从而在保持高吞吐量的同时显著降低端到端延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你经营着一家繁忙的高科技厨房。过去,这家厨房只烹饪简单、一次性的菜肴(例如单个文本回复)。厨师(GPU)是唯一重要的角色,目标仅仅是尽可能多地提高每小时出菜量。
但如今,厨房已经变了。它现在运行着自主智能体——你可以把它们想象成超级厨师,它们不仅仅烹饪一道菜,而是踏上复杂的旅程去解决问题。它们可能先烹饪一会儿,然后跑去储藏室取食材(使用工具),查阅食谱书(读取文件),回到炉灶继续烹饪,如此循环数十次,直到任务完成。
这篇论文介绍了MARS,一种专为这种混乱的多步骤烹饪风格设计的新型“厨房经理”。以下是其工作原理,使用简单的类比说明:
问题:旧厨房正在崩溃
旧的厨房经理(现有的 AI 系统)是为“一次性菜肴”时代设计的。当面对这些新的、复杂的智能体旅程时,它们犯了三个大错误:
- “停停走走”陷阱:当厨师停止烹饪跑去储藏室(CPU 工具执行)时,旧经理要么为了节省空间而扔掉厨师的笔记(KV 缓存),要么将它们永久保留,导致柜台拥堵。如果笔记被扔掉,厨师返回时就必须从头重写整个食谱,浪费大量时间。
- “大订单”阻塞:如果一个大而复杂的订单(长上下文)到来,它会占据炉灶,阻塞后面所有小而快速的订单,即使那些小订单已经准备就绪。
- “盲区”:经理只盯着炉灶(GPU)。他们没有看到储藏室(CPU)已经堵塞。因此,即使储藏室已满,他们仍不断向炉灶派遣厨师,导致交通堵塞,厨师们空等食材。
解决方案:MARS(智能厨房经理)
MARS 通过充当一个中央神经系统来解决这个问题,它能看见一切——包括炉灶和储藏室——并完美协调它们。
1. “统一信息流”(对讲机)
MARS 不再靠猜测,而是拥有连接炉灶和储藏室的实时馈送。
- 工作原理:每当厨师暂停去储藏室,或带着食材返回时,都会立即发送信号。经理确切知道厨师为什么停止以及何时返回。
- 优势:经理无需猜测。他们确切知道需要为厨师的笔记保留多少柜台空间(内存),以及何时为新订单腾出空间。
2. “外部控制平面”(守门人)
在新订单进入厨房之前,MARS 会检查厨房是否真的能处理它。
- 工作原理:它检查两件事:炉灶空闲吗?储藏室空闲吗?如果储藏室被工具任务堵塞,即使炉灶是空的,MARS 也会说:“现在没有新订单。”这防止了厨房不堪重负。
- 优势:它阻止厨房一次性接受过多订单,从而避免导致无法完成任何任务的全面崩溃。
3. “内部以智能体为中心的调度器”(智能调度员)
一旦订单进入内部,MARS 决定谁先烹饪。它不仅仅遵循“先来先服务”的排队规则。
- 工作原理:
- 优先级:如果厨师正处于快速交互步骤中,MARS 让他们优先。如果厨师卡在巨大而缓慢的食谱上,MARS 可能会暂时暂停他们,让其他人完成,从而防止“大订单”阻塞。
- “热恢复”技巧:MARS 智能地决定是否将厨师的笔记(KV 缓存)保留在柜台上。如果厨师将在 2 秒后返回,MARS 保留笔记(节省时间)。如果他们要离开 20 分钟,MARS 则清除笔记以为他人腾出空间。它仅在真正节省时间时才保留笔记。
结果:更快、更顺畅
论文在现实场景中测试了 MARS(例如编写和测试软件的编程助手)。
- 速度:在受控测试中,MARS 使智能体完成任务的速度比旧系统快高达5.94 倍。在现实世界的编程设置中,它将任务完成速度提高了1.87 倍。
- 可靠性:旧系统会因严重拥堵而完全停止完成任务(高“吞吐量”但零“有效吞吐量”),而 MARS 保持厨房顺畅运行,确保任务能按时实际完成。
总结
将MARS想象成一位厨房经理,他不再只是数炉灶上有多少锅,而是理解整个餐厅的流动。通过同时监控炉灶和储藏室,并就谁先烹饪以及保留哪些笔记做出明智决策,MARS 确保复杂的多步骤 AI 智能体能够高效工作,而不会陷入交通堵塞。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。