← 最新论文
💻 computer science

Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study

本文介绍了 Salesforce 在生产环境中部署的一种模块化、与平台无关的推理架构的研究,该架构能够可扩展、经济高效且低延迟地服务于 Agentforce 和 ApexGuru 等复合 AI 系统,在显著提升吞吐量、降低尾部延迟并优化运营成本的同时,解决了多模型扇出和级联冷启动等独特挑战。

原作者: Srikanta Prasad S V, Utkarsh Arora

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Srikanta Prasad S V, Utkarsh Arora

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你经营着一家名为Agentforce的繁忙高端餐厅。过去,这家餐厅只有一个巨大的厨房(一种“静态”设置),由一位主厨试图包揽所有工作:切菜、煎牛排、烤甜点,甚至洗碗。如果餐厅变得繁忙,厨房就会堵塞。如果主厨需要休息(即“冷启动”),整个餐厅就会停止供餐。最糟糕的是,即使无人用餐,你也必须全天候支付主厨的薪水。

本文描述了 Salesforce 如何重建他们的“餐厅”以应对复合 AI 系统。他们不再依赖一个大型厨房,而是建立了一个按需调用的模块化食品配送网络

以下是他们如何实现这一点的简单解释:

1. 问题:“一刀切”的厨房

现代 AI 应用(如 Agentforce 或 ApexGuru)非常复杂。当客户提出问题时,系统并非只让一个机器人来回答。它更像是一个专家团队在协同工作:

  • 专家 A(嵌入模型)查阅客户的历史记录。
  • 专家 B(大语言模型)撰写回复。
  • 专家 C(SQL 执行器)检查数据库。
  • 专家 D(分类器)判断客户真正想要什么。

在旧的“静态”设置中,所有这些专家都被困在同一个房间的同一硬件上。

  • 瓶颈:如果数据库专家速度慢,整个订单就会延迟。
  • 浪费:即使凌晨 3 点只需要“切菜”专家,你也必须让所有专家全天候保持清醒和待命状态。
  • “冷启动”噩梦:如果餐厅关闭一小时后重新开放,所有专家都必须醒来、伸展身体并准备好工具。客户必须等待最慢的那位醒来后才能得到任何食物。

2. 解决方案:“智能配送网络”

Salesforce 构建了一种新架构,其作用类似于智能、动态的配送服务

  • 接单员(预测服务):当客户下单时,智能调度员不会将订单发送给一个大厨房。相反,它将订单拆分成部分,并发送给最适合该任务的具体专家。
  • 独立扩展:如果有 100 人点“牛排”(大语言模型调用),系统会立即雇佣 100 位牛排厨师。如果只有 5 人点“沙拉”(嵌入调用),则只雇佣 5 位沙拉厨师。他们不会在同一个厨房里争夺空间。
  • 无服务器(按使用付费):专家们并不坐在建筑物里等待订单。他们是“云工人”,只在订单到达时出现,并在完成后离开。你只需为他们实际工作的分钟数付费。

3. 解决“唤醒”问题(级联冷启动)

该论文发现了一个棘手的问题:在复合系统中,专家们相互依赖。专家 A 必须完成,专家 B 才能开始。

  • 旧方法:如果餐厅重新开放,专家 A 醒来(30 秒),然后专家 B 醒来(150 秒),接着专家 C 醒来(20 秒)。客户总共等待180 秒
  • 新的“预热”技巧:系统足够智能,能够知晓“食谱”。一旦调用专家 A,系统就会在后台同时唤醒专家 B 和 C。
  • 结果:客户不再等待 180 秒,而只需等待约65 秒。论文指出,这将“唤醒”时间缩短了65%

4. 结果:更快、更便宜、更流畅

在真实客户中运行该系统一年多后,发生了以下变化:

  • 速度:“尾部延迟”(慢速客户的最坏情况等待时间)下降了50%。以前需要 37 秒的订单,现在大约需要 10–11 秒。
  • 容量:与旧厨房相比,该系统在同一时间能处理3.9 倍的订单量。
  • 成本:由于不再为闲置工人付费,他们节省了**30–40%**的成本。
  • 可靠性:如果一位专家生病(失败),系统不会关闭整个餐厅。它只是将订单绕过该人(例如,“我们无法检查数据库,所以让我们提供一个通用答案”)。即使部分组件损坏,餐厅仍能保持95% 的时间正常营业。

5. 关键经验教训(“主厨的秘密”)

作者为任何构建此类系统的人分享了几个主要启示:

  1. 冷启动是相乘的,而不是简单相加的。如果你有一系列任务,等待时间会层层叠加。你必须一次性唤醒整个链条,而不是一次唤醒一个。
  2. 关注整个流水线,而不仅仅是单个工人。一个工人单独可能很快,但如果他们因等待他人而卡住,整个订单就会变慢。你需要看到订单的“大局”。
  3. 单独测试各个组件。由于系统是模块化的,你可以只更换“沙拉厨师”而无需解雇“牛排厨师”。这使他们能够在几天而不是几周内改进其 AI 模型。
  4. 优雅降级优于完美。如果系统的一小部分发生故障,整个系统不应崩溃。给出一个稍微不那么详细的答案,总比完全不给答案要好。

总结

本文讲述的是从僵化、昂贵、“单一厨房”式的 AI 设置,转向灵活、“零工经济”风格网络的过程。通过将每个 AI 工具视为一个独立的、可按需即时扩展的工人,Salesforce 使其 AI 代理对数千名企业用户来说变得更快、更便宜且更加可靠

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →