← 最新论文
💻 computer science

Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications

本文提出了一种统一的两阶段框架,该框架将先进的模型定制技术与投机解码和 FP8 量化等推理优化技术相结合,旨在实现面向企业级应用的、可扩展、高性价比且鲁棒的基于大语言模型(LLM)的多智能体系统部署,并实现了 4.48 倍的吞吐量提升。

原作者: Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你经营着一家繁忙且高端的汽车经销店。你拥有一支由五位才华横溢、各司其职的专家组成的团队(一个多智能体系统),他们通力合作,帮助客户预约试驾。

  1. 理解者 (The Understander):倾听客户的需求。
  2. 规划者 (The Planner):制定最佳步骤。
  3. 评估者 (The Evaluator):充当安全卫士,检查计划是否安全且合乎逻辑。
  4. 执行者 (The Executor):实际完成预约工作。
  5. 讲解者 (The Explainer):向客户告知最终的细节。

在过去,这个团队是由一位“超级专家”(一个巨大的 AI 模型)来领导的。虽然这位超级专家极其聪明,但他们动作缓慢、雇佣成本高昂,而且占用了大量的办公空间(计算能力)。如果客户提出一个复杂的问题,团队必须调用超级专家五次,这导致了漫长的等待时间和高昂的账单。

这篇论文的作者们(来自 Capital One)希望在保留团队智慧的同时,让它变得更快、更便宜、更容易运行。他们通过两个主要阶段实现了这一目标:培训一名新实习生优化工作流

第一阶段:培训一名新实习生(智能体模型定制化)

他们并没有依赖缓慢的超级专家来处理每一项任务,而是决定训练一个更小、更快、更精干的“实习生”(一个紧凑型 AI 模型)。但他们不仅仅是给实习生一本教科书;他们还使用了一个巧妙的三步训练营:

  • 第一步:背景知识速成班(持续预训练):
    通常,当你教一名新员工特定行业(如汽车销售)的知识时,他们可能会忘记如何说正常的英语或失去通用的聪明才智。为了解决这个问题,作者在每节课之前都会给实习生提供“上下文线索”。想象一下,在开始阅读一章内容之前,先读一下前一章的简要总结。这让实习生保持了语言的流畅性,并防止他们在学习汽车经销规则时遗忘通用技能。

  • 第二步:模仿大师(监督微调):
    实习生观察了超级专家处理成千上万次真实客户对话的过程。然而,超级专家有时会犯一些小错误,或者给出的答案虽然技术上正确,但并不“完美”。为了解决这个问题,他们使用了一个更聪明的“裁判”AI 来审查超级专家的工作,并重写出完美的答案。实习生随后从这些被重写的“完美答案”中学习,而不是从原始答案中学习。

  • 第三步:学习客户真正的偏好(偏好优化):
    有时,回答一个问题有两种方式:一种是安全的,另一种是有风险的。实习生需要学习哪种方式是客户更喜欢的。团队向实习生展示了一对对答案:“这个很好(被选中)”对比“那个不好(被拒绝)”。实习生学会了选择“被选中”的那条路径,使其行为与业务的实际需求保持一致。

结果: 他们现在拥有了一个既聪明又快速的小型实习生,其表现与原本庞大的超级专家一样出色,但更加轻量化且易于管理。

第二阶段:为工作流注入动力(推理优化)

即使有了快速的实习生,由于计算机处理信息的方式,系统仍然显得有些缓慢。于是他们添加了两个“涡轮增压”:

  • “猜想与校验”技巧(投机采样/Speculative Decoding):
    通常,AI 每次只写一个词,并在写完每个字母后都进行自我检查。这就像你每打一个字母就按一次“回车键”一样。
    作者添加了一个微小的“草稿助手”(一个极小的 AI),它会在主实习生编写单词之前,先“猜”出接下来的几个词。主实习生随后快速检查这些猜测是否正确。如果正确,它就会一次性接受所有猜测。这就像草稿助手在餐巾纸上写好了整个句子,而实习生只需要盖个“批准”的印章。这节省了大量时间。

  • “轻量化制服”(FP8 量化):
    AI 模型通常穿着厚重的“衣服”(高精度数学数字),这会占用大量内存。作者将这些厚重的衣服换成了“轻量化制服”(一种特定的压缩数学形式,称为 FP8)。这使得模型的内存占用减半,运行速度提升了一倍,同时实习生也不会忘记如何完成工作。

最终成果

通过将聪明的实习生“猜想与校验”技巧以及**“轻量化制服”**结合在一起,团队实现了一些了不起的事情:

  • 速度:系统现在比原来的设置快了 4.48 倍
  • 质量:新系统并没有变笨;它在处理复杂、棘手的情况(如长对话或特殊请求)时,甚至比原来的巨大模型做得更好。
  • 成本:因为它更快且占用内存更少,所以运行成本也更低。

核心启示:
这篇论文告诉我们,你不需要一个巨大且缓慢的大脑来解决复杂问题。如果你能通过正确的数据和教学方法来精心训练一个较小的“大脑”,并赋予它正确的工具(如“猜想与校验”技巧),你就能构建出一个既极其快速又极其聪明的系统。这关乎于“更聪明地工作”,而不仅仅是“更努力地工作”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →