← 最新论文
🤖 AI

Scaffold Effects on GAIA: A Controlled Comparison

这项预注册对照研究表明,脚手架(scaffold)的选择显著影响智能体在 GAIA 基准测试上的表现,揭示了测得的能力得分具有高度的脚手架条件性,并且预期的随着模型改进而导致的脚手架敏感度降低这一现象并不成立,其中结构化的多智能体设计通常比标准的 ReAct 方法能带来显著的准确率提升。

原作者: Jason Starace

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Jason Starace

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图评判一位厨师在烹饪复杂菜肴时的水平。为了测试他们,你准备了三种不同的厨房(脚手架/架构):

  1. 独行大厨 (ReAct): 厨师边思考、边拿食材、边烹饪,然后再次思考、再拿下一个食材,整个过程是一个连续的流。
  2. 厨房团队 (Planner-Actor-Rater): 一位经理编写食谱,一位厨师执行步骤,而一位评论家在每一步完成后进行品尝,以确保在进入下一步之前一切正确。
  3. 蓝图与建造者 (Planner-then-Executor): 首先,规划者在没有任何工具的情况下编写一份详细的、分步骤的蓝图。然后,建造者根据这份蓝图制作菜肴。

这项研究提出了一个简单的问题:你把厨师放在什么样的厨房里,会改变他们“看起来”有多好吗?

答案是肯定的 yes。事实上,“厨房”本身与厨师真正的天赋一样重要。

重大发现:“厨房”比你想象的更重要

研究人员测试了五种不同的“厨师”(来自 Anthropic、Google 和 OpenAI 的 AI 模型)在一组困难的谜题(称为 GAIA)上的表现。他们发现,仅仅更换厨房设置,就能让模型的得分改变 28 个百分点

为了让你理解,如果在一个“独行大厨”厨房中测试某个模型得到了 56% 的分数,但当你把它放进“厨房团队”设置中时,它可能会突然得到 84% 的分数。厨师并没有改变,改变的是他们被允许工作的方式。

这意味着,当我们看到类似“模型 X 有 80% 的智能”这样的新闻标题时,这个数字并不只关于模型本身。它是模型的“大脑”加上它所获得的特定指令和工具的结合体。如果你在不同的厨房里比较两个模型,你比较的不是它们的大脑,而是它们的厨房。

破除迷思:“更聪明”的模型不需要更多帮助吗?

研究人员有一个直觉(假设):最强大的“前沿”模型会非常聪明,以至于它们不太在意厨房的设置。他们认为一个超级大脑在凌乱的厨房里也能表现得和在整洁的厨房里一样好。

他们错了。

事实上,在测试的最强模型(Anthropic 的 Opus)中,当任务变得困难时,它从结构化、有组织的厨房(“厨房团队”设置)中获益最多。“最聪明”的模型并不是最独立的;它反而是最需要经理和评论家辅助的模型。最强模型与最弱模型之间的差距并没有因为模型变聪明而缩小;反而保持不变,甚至变得更大了。

“家族” vs. “排名” 的惊喜

另一个惊喜是,拥有高级厨房的益处取决于模型属于哪个家族,而不只是看它的排名

  • Anthropic 家族(Haiku, Sonnet, Opus)都从“厨房团队”设置中获得了巨大的提升。
  • 来自 Google 和 OpenAI 的模型并没有获得同样的提升。

这就像是在说,某种特定类型的汽车引擎在配合特定品牌的燃料时表现得更好,但不同品牌的引擎则不在乎。你不能仅仅假设一个“更高层级”的模型总能从更好的工具中受益;这取决于谁制造了那个引擎。

成本与效率

研究还查看了“收据”(成本)。

  • “独行大厨”(ReAct)是最昂贵且最慢的。它犯了很多错误,并且经常需要重试。
  • “厨房团队”和“蓝图”设置更快,错误更少,并且在任务中途出错时恢复能力更强。
  • 胜出者: 将 Google 的 Gemini 模型与“蓝图”设置相结合,是处理最难任务时最便宜且最准确的选择。

底线结论

这篇论文告诉我们,能力数值是具有条件的。 你不能在真空状态下说一个模型“具备 X% 的能力”。你必须说,“在使用了这套特定的指令和工具时,它具备 X% 的能力”。

如果你想知道一个 AI 到底有多好,你不能只看一个分数。你必须意识到,这个分数是模型加上支撑它的脚手架的一个快照。如果你改变了脚手架,分数就会改变,有时变化巨大。模型“能做到的”与它在测试中“实际做到的”之间的“差距”是巨大的,而且并不会仅仅因为模型变得更聪明就缩小。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →