← 最新论文
💬 NLP

Signal or Noise? A Benchmark Study of Agent Skills in Web Development

本文通过引入 WebDev-Skills-Bench 证明,在网页开发任务中注入可重用的智能体技能往往会降低性能并增加成本,揭示了由于提示词长度带来的干扰或误导性内容而非真正的效用,导致这些技能频繁产生负面影响,因此有必要进行每次部署的审计以及长度匹配的对照实验,以进行有效评估。

原作者: Ziyue Yang, Fan Ding

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyue Yang, Fan Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代软件创作的版图中,人工智能已从一个简单的问答工具演变成了一个持续性的合作伙伴,能够编写代码。为了让这些数字助手更加可靠,开发者开始为它们附加“技能”。请不要将这种技能视为一次性的指令,而应将其视为一种伴随 AI 在整个工作阶段携带的永久规则手册或习惯集。这些规则手册包含了关于如何针对特定技术编写代码的指南、关于应避免哪些常见错误的警告,以及如何解决问题的示例。人们希望通过赋予 AI 这些额外的上下文,使其表现得更像一名经验丰富的资深工程师,而非在每一步都靠猜测的初学者。然而,这种方法隐藏着一种代价。每增加一项技能,AI 在回答问题之前必须阅读的文本量就会随之增加。这引发了一个关键且悬而未决的问题:额外的知识究竟是帮助了 AI 更好地完成工作,还是仅仅因为文本量的庞大而使其感到困惑,从而导致速度变慢并增加错误?

百度的一支研究团队致力于通过将添加技能视为一项科学实验而非默认设置来回答这个问题。他们专注于 Web 开发领域,这是一个 AI 经常被要求使用 JavaScript 和 HTML 等语言来构建网站和应用程序的海量领域。他们收集了 31 种不同的公开技能指南,涵盖了从通用编程建议到针对流行软件框架的具体指令。为了测试它们,他们使用了一个严谨的测试场,由 50 个真实的 Web 项目组成,每个项目包含 20 个循序渐进的任务。这为 AI 创造了总计 1000 个不同的挑战。研究人员随后在四种不同的条件下运行了相同的任务。在第一种场景中,AI 完全没有收到额外的技能指南。在第二种场景中,它收到了专门针对该项目的特定技能指南。在第三种场景中,为了隔离文本长度的影响,AI 收到了一个体积完全相同但填充了无关且无意义内容的指南。最后,他们拆解了那些有用的指南,以观察哪些具体部分——例如规则、警告或代码示例——真正发挥了作用。他们在四种不同的大型语言模型上测试了这些设置,这些模型涵盖了从广泛使用的商业系统到专门的编程模型。

结果挑战了“更多上下文总能带来更好表现”这一普遍假设。在测试的所有四个模型中,添加预期的技能指南实际上降低了 AI 的成功率。平均而言,当技能存在时,AI 完成正确任务的数量比技能不存在时要少。性能的下降并非微不足道;其降幅从轻微下降到成功率损失近四个百分点不等。此外,AI 的效率也降低了,完成同样的工作需要消耗更多的计算资源。在某些情况下,处理额外文本的成本增加了近 400%。研究人员发现,AI 仅在极少数情况下能提高性能,大约在五分之一到三分之一的特定技能与特定项目的配对中。这表明,在绝大多数情况下,注入这些技能是适得其反的,它们引入的是噪声而非信号。

研究还揭示了这种失败的原因完全取决于正在使用哪种 AI 模型。对于其中的两个模型,问题仅仅在于文本的长度。当这些模型被给予长度相同但内容无关的指南时,它们的表现与使用真实技能指南时一样糟糕。这表明,无论这些文字的含义如何,它们的注意力都被庞大的文本量所稀释了。而对于另外两个模型,文本长度并不是问题;它们可以很好地处理无关文本。相反,技能指南中的具体内容误导了它们,使它们偏离了正确答案。这种区别至关重要,因为这意味着不存在单一的解决方案。对于某些系统,解决方案是缩短文本;而对于其他系统,则必须重写或完全移除内容本身。

或许最令人惊讶的发现是,一个对某个 AI 模型效果良好的技能,往往会对另一个模型造成破坏甚至产生负面影响。研究人员发现,一个技能在一种系统上的表现与在另一种系统上的表现之间几乎没有任何联系。一个帮助某个模型解决问题的指南,可能会导致另一个模型在同一任务上失败。这种缺乏一致性的现象意味着,开发者不能简单地看一个流行的技能指南并假设它适用于自己的特定设置。相反,使用技能的决策必须基于具体情况进行,需要考虑特定的模型、特定的项目以及特定的任务。研究还显示,当任务难度较低时,这些技能往往危害最大。当 AI 已经知道如何解决问题时,额外的规则似乎将其锁定在一种僵化的思维方式中,阻止了它轻松修正原本可以轻易修复的小错误。

最后,研究人员剖析了那些有用的技能,以探究其奏效的原因。他们发现,最有价值的部分通常是关于“不要做什么”的简短警告,即“反模式”(anti-patterns)。这些简短的规则在各种情况下都非常有效。相比之下,包含长篇代码示例的部分则表现不一。虽然这些示例有时能帮助较弱的模型,但往往会令最先进的模型感到困惑,这表明向 AI 展示过多的示例可能是有害的。研究结论认为,盲目为 AI 智能体附加技能指南的时代已经结束。相反,注入这些工具应当被视为一种谨慎的路由决策,即在每次部署时,都要权衡额外文本带来的潜在收益与成本。研究结果表明,如果没有这种细致的、针对每个项目的审计,这些旨在让 AI 变得更聪明的工具往往会让它变得更慢且更不可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →