AI Agents Do Not Fail Alone:The Context Fails First
本文确立了上下文工程质量是 AI 智能体可靠性的一个主要且可衡量的预测因子,通过 ProofAgent-Harness 证明了特定的上下文标准——例如接地充分性和护栏覆盖范围——直接决定了诸如幻觉抵抗力和指令遵循等行为结果,且这种影响独立于底层语言模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何从事一项复杂的任务,比如诊断病人或起草一份法律合同。你可能会认为,机器人的成功完全取决于它的“大脑”有多“聪明”,或者你最初的指令表达得多么完美。但在人工智能的世界里,存在着一个经常被忽视的隐藏层:上下文(Context)。不要仅仅把上下文看作一条指令,而要把它看作机器人工作的整个房间。它是墙上的地图、工作台上的工具、口袋里的规则手册、五分钟前发生的事情的记忆,以及门外传来的嘈ole声。如果房间很乱、工具是坏的或者规则手册缺了页,即使是最聪明的机器人也会感到困惑、编造事实或不小心弄坏东西。这就是 AI 智能体(AI agents) 的问题:它们的失败并不只是因为它们“笨”,往往是因为它们工作的环境设计得很糟糕。科学家称之为“上下文工程(context engineering)”,直到现在,这在很大程度上仍是一个黑盒——团队只能靠猜测来判断设置的好坏,但他们并没有一把尺子来衡量它。
这篇题为《AI 智能体并非独自失败:首先失败的是上下文》(AI Agents Do Not Fail Alone: The Context Fails First)的论文指出,我们需要停止猜测,并在要求机器人开始工作之前,先去衡量那个“房间”的质量。作者们利用一个名为 ProofAgent-Harness 的开源工具,创建了一种方法,通过七个特定的标准来给 AI 智能体的设置进行评分,例如指令是否清晰、工具描述是否完善,以及机器人是否受到了针对错误建议的保护。他们不仅仅观察机器人的成功或失败;他们隔离出了“设置”本身,以观察更好的设置是否能预示更好的行为。
以下是他们的发现:上下文确实会先于智能体失败。 在一项受控实验中,他们保持机器人的“大脑”(底层 AI 模型)完全不变,但将“房间”(上下文)从一个混乱、模糊的设置改为结构化的设置,最后改为一个带有额外安全规则的“强化型”设置。结果令人震惊。当他们从“差劲”的上下文转向“结构化”的上下文时——即角色明确、工具定义清晰且事实有据可查时——机器人的行为得到了显著改善。它抵抗编造事实(幻觉)的能力大幅提升,工具使用的可靠性更高,且关键故障率下降了约 68%。
研究还发现了一个违反直觉的现象:更便宜的设置并不总是更好的设置。 “差劲”的上下文由于短小且稀疏,使用了较少的 Token(AI 的数字货币)。然而,这种“廉价”的设置实际上是最危险的,会导致最糟糕的行为。而“强化型”的上下文包含了更多的安全规则和更清晰的指令,虽然使用了更多的 Token,却产生了一个更加可靠且安全的智能体。作者们认为,弱上下文的代价不在于金钱,而在于可靠性。
至关重要的是,这项研究表明,仅通过观察其上下文,你就可以预测智能体的行为。如果“落地性/锚定性”(提供给机器人的证据)足够强,机器人就不太可能产生幻觉。如果“护栏”(安全规则)足够清晰,机器人就能更好地抵御操纵。这意味着上下文工程不仅仅是一种创意写作练习;它是一个可衡量的、可审计的安全层。通过在机器人开始工作之前对上下文进行评分,团队可以及早发现潜在的失败,在“机器人”进入“房间”之前就修复好这个“房间”。这篇论文并不声称解决了所有的 AI 问题,但它证明了,如果你想要一个可靠的智能体,你必须先建立一个可靠的环境。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。