← 最新论文
💬 NLP

More Is Not Always Better: Cross-Component Interference in LLM Agent Scaffolding

本文表明,为大型语言模型智能体添加更多脚手架组件往往会导致破坏性的跨组件干扰,从而证明针对特定任务的子集选择优于传统的“全包含”方法,且贪婪选择方法因频繁违反次模性而不可靠。

原作者: Ming Liu

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Ming Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试为计算机程序(一个 AI 智能体)构建一个终极“超级大脑”,以解决高难度的谜题。专家们的标准建议始终是:“越多越好。”其理念是,如果你赋予 AI 一个规划器、一个记忆库、一套工具、一种逐步推理的能力以及一种自我检查其工作的机制,它将表现完美。

然而,这篇论文指出,这一建议往往是错误的。事实上,堆砌过多的功能实际上会让 AI 变得更“笨”。

以下是研究人员发现的要点,使用了简单的类比进行说明。

1. “厨师太多”的问题

研究人员在两种不同类型的谜题上测试了五种常见 AI 功能(规划、工具、记忆、推理和自省)的所有可能组合:

  • HotpotQA:就像一种 trivia 游戏,你需要搜索许多文档来找到答案。
  • GSM8K:就像一份数学作业。

他们发现,对于较小的 AI 模型("8B"版本),在最基本且最有效的设置上添加额外功能,实际上会损害性能。

  • 类比:想象你正在试图在干草堆里找到一根特定的针。
    • 最佳设置:你只用一块磁铁(“工具”)。它效果极佳。
    • “全都要”设置:你给拿着磁铁的人一张地图(规划)、一个笔记本(记忆)、一个手电筒(推理)和一个大声喊叫指令的教练(自省)。
    • 结果:这个人变得困惑。地图分散了他们对磁铁的注意力;教练的声音淹没了他们自己的思考。他们弄丢了那根针。仅使用简单的磁铁比整套花哨的工具包效果好 32%。

2. 这取决于任务和“大脑尺寸”

该论文表明,功能的“最佳”数量取决于 AI 正在做什么以及 AI 有多聪明。

  • 任务依赖性
    • 对于Trivia 游戏,最佳设置仅包含一个功能:工具。添加任何其他功能都会使其表现变差。
    • 对于数学游戏,最佳设置包含三个功能:工具 + 推理 + 自省。在这里,“教练”和“逐步思考”实际上起到了帮助作用。但添加“规划器”或“记忆”仍然会使表现变差。
  • 大脑尺寸(模型规模)
    • 小型 AI(8B):非常敏感。添加额外功能会导致大量干扰。简单设置与“全都要”设置之间的差距巨大(32%)。
    • 中型 AI(70B):更强壮。它能处理更多功能,但“全都要”设置仍然不是最佳。差距缩小到 19%。
    • 非常聪明的 AI(Claude Haiku):能力如此强大,以至于添加额外功能既不会帮助也不会造成太大伤害。这就像一位天才,能够忽略干扰。差距消失了,但简单设置与复杂设置的效果一样好。

3. 为什么会发生这种情况?(“拥挤房间”效应)

研究人员将这种现象称为跨组件干扰(CCI)

  • 类比:想象在一个拥挤的小房间里,一个团队正试图解决问题。
    • 如果你添加一个不断大喊关于日程安排的“规划者”,“工具使用者”就听不到指令。
    • 如果你添加一个不断提醒所有人旧事实的“记忆者”,“推理者”就会陷入过去。
    • 这些组件正在争夺 AI 的注意力(即其“上下文窗口”)。它们没有协同工作,而是互相绊倒。

4. 你不能只是“添加并检查”

构建这些系统的一种常见方法是“贪婪选择”:从零开始,添加一个功能,看看它是否有帮助。如果有,就保留它。再添加另一个。如果有帮助,就保留它。当不再有帮助时停止。

该论文指出,这种方法不可靠

  • 类比:想象你在制作三明治。
    • 面包 + 火腿 = 好。
    • 面包 + 火腿 + 奶酪 = 更好。
    • 面包 + 火腿 + 奶酪 + 酸黄瓜 = 更差(因为酸黄瓜让火腿变得湿软)。
    • 但是,面包 + 火腿 + 奶酪 + 酸黄瓜 + 芥末 = 再次变得惊人!
    • 如果你因为酸黄瓜造成了负面影响而在“更差”阶段停止,你就永远找不到那个惊人的三明治。该论文发现,有时某个功能单独存在时是糟糕的,但与特定其他功能结合时却非常棒。你必须测试整个组合,而不能只是逐个添加。

5. 主要结论

研究人员进行了超过 32,000 次测试来证明这一点。他们的结论很简单:

不要假设“全功能加载”的 AI 智能体就是最好的。

  • 对于许多任务,一个仅拥有合适工具的简单智能体,比一个拥有规划器、记忆和自省功能的复杂智能体更好。
  • “最佳”设置完全取决于具体的任务和你所使用的特定 AI 模型。
  • 如果你只是把所有东西都扔向墙壁,你很可能会制造出混淆 AI 的噪音,而不是帮助它。

简而言之:有时,最简单的工具是最强大的。添加更多部件并不总是让机器运行得更快;有时,它只会让它绊倒。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →