← 最新论文
💬 NLP

From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems

本调查将复合人工智能系统定义为一种新兴范式,该范式将大型语言模型与检索器和智能体等外部组件相整合,并提出统一的分类体系,对检索增强生成和大型语言模型智能体等基础范式进行分析,以解决当前的碎片化问题并指导系统级人工智能的未来研究。

原作者: Jiayi Chen, Junyi Ye, Guiling Wang

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiayi Chen, Junyi Ye, Guiling Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位博学多才、阅书无数的图书管理员,名叫"LLM"(大语言模型)。这位管理员几乎读过截至某个日期之前写下的所有书籍。他们撰写故事、回答问题以及聊天时速度极快。然而,他们存在三个大问题:

  1. 他们会遗忘事物:他们无法记住停止学习之后发生的事实(他们的知识是“过时的”)。
  2. 他们会编造事物:有时,当他们不知道答案时,会自信地编造虚假事实(这被称为“幻觉”)。
  3. 他们无法做数学或使用工具:他们擅长交谈,但无法实际计算复杂的方程式、搜索实时互联网或控制机械臂。

本文介绍了一种构建人工智能的新方法,称为复合人工智能系统(Compound AI Systems, CAIS)。CAIS 不再仅仅依赖那位图书管理员,而是围绕这位管理员组建一个团队乐团,以解决上述问题。

以下是本文如何利用简单的类比来拆解这个“团队”:

1. 四位关键团队成员(四大支柱)

本文将这一新的人工智能世界组织为四个协同工作的主要角色:

  • 研究员(RAG - 检索增强生成):

    • 问题: 图书管理员不知道今天的新闻或你公司的私人文件。
    • 解决方案: 在图书管理员回答之前,一位研究员会跑到图书馆书架(或互联网)上,查找具体、最新的文档。他们将笔记交给图书管理员,以便其基于事实而非猜测来回答。
    • 类比: 这就像在考试前给图书管理员一张小抄。
  • 项目经理(LLM 智能体):

    • 问题: 图书管理员擅长单一任务,但面对需要多步骤的漫长复杂项目时会感到困惑。
    • 解决方案: 智能体是具备规划能力的图书管理员版本。它将一个大任务(如“规划一次旅行”)分解为小步骤(预订航班 -> 寻找酒店 -> 查看天气)。它还能使用工具,例如调用旅行 API 或进行数学计算,并检查自己的工作以修正错误。
    • 类比: 这就像一位工头,他不仅砌砖,还绘制蓝图、订购材料并检查工程。
  • 多感官专家(MLLMs - 多模态大语言模型):

    • 问题: 图书管理员只能阅读文本。如果你给他们看一张损坏引擎的照片或一场风暴的视频,他们就“失明”了。
    • 解决方案: 这些是获得了眼睛和耳朵的图书管理员。他们可以查看图像、聆听音频并观看视频,然后描述所见内容或回答相关问题。
    • 类比: 这就像给图书管理员戴上眼镜和耳机,让他们能够理解一个不仅仅是文字的世界。
  • 指挥家(编排):

    • 问题: 如果你拥有研究员、项目经理和多感官专家,他们可能会互相抢话,或者对谁该做什么感到困惑。
    • 解决方案: 指挥家是管理整个团队的系统。它决定何时呼叫研究员、何时要求智能体进行规划,以及如何将他们的回答整合为一个最终结果。它确保团队顺畅协作。
    • 类比: 想象一个交响乐团。图书管理员是小提琴手,但指挥家确保鼓、长笛和小提琴都在正确的时间演奏,从而奏出音乐而非噪音。

2. 他们如何协同工作(流水线)

本文指出,现实世界中的复合人工智能系统并非仅仅是其中某一种;它通常是所有这些同时存在

想象你问系统:“分析这张损坏机器的照片,并找到修复它的说明书。”

  1. 多感官专家查看照片并理解那是什么机器。
  2. 研究员外出查找该机器型号的具体说明书。
  3. 项目经理(智能体)规划修复步骤,并决定使用工具检查该零件是否有库存。
  4. 指挥家(编排)管理流程,确保照片分析在搜索说明书之前进行,并将所有内容整合成一个清晰的回答给你。

3. 当前的挑战

本文承认,虽然这种“团队”方法很强大,但目前也很混乱:

  • 它很复杂:组建一个团队比雇佣一个人更难。如果其中一部分损坏,整个系统可能会失败。
  • 他们不说同一种语言:不同的工具和智能体通常使用不同的格式,使得连接它们变得困难(就像试图将欧洲充电器插入美国插座)。
  • 难以测试:我们还没有完美的测试方法来评估整个团队是否运作良好,尤其是当它们同时查看图片并与工具交互时。

4. 未来:标准化

本文强调,人们开始创建“通用适配器”(如模型上下文协议MCP)。这些就像通用电源排插,可以让任何人工智能工具轻松插入任何人工智能系统。目标是停止为每一个连接构建定制桥梁,转而采用一种标准方式,让所有这些人工智能组件彼此对话。

总结

简而言之,本文指出:不要试图打造一个能完美完成所有事情的巨大大脑。 相反,要构建一个智能系统,将大脑(LLM)与记忆库(检索)、规划者(智能体)、眼睛/耳朵(多模态)以及管理者(编排)连接起来。这种“复合”系统是人工智能的未来,因为它克服了任何单一模型的局限性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →