← 最新论文
💻 computer science

Does Provenance Add Value Beyond Matched Skill Guidance?

这项预注册研究发现,智能体技能中的来源元数据并不能可靠地在匹配的普通指导之外提升任务效用,这表明其价值是依赖于上下文的,并且主要仅在通过改变可执行动作而非仅仅通过捆绑的技能评分时才得以实现。

原作者: Haocheng Lu

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Haocheng Lu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,出现了一类新一代计算机程序,它们不仅能回答问题,还能采取行动。这些系统通常被称为“智能体”(agents),它们可以通过使用一套数字工具来浏览网页、编写代码或管理文件。为了让这些智能体变得更聪明、更可靠,开发者经常会向它们喂入“技能”(skills)。可以将技能想象成一份预先写好的指令手册,告诉智能体如何解决特定类型的问题。这些手册通常会附带被称为“溯源信息”(provenance)的额外信息。这种元数据就像是一张数字收据或引用,显示了指令的来源、支持该指令的证据以及适用的条件。虽然这些额外的上下文对于需要审计或调试系统的开发者来说无疑非常有用,但一个悬而未决的问题一直困扰着研究人员:这些额外的信息究竟是真的能帮助计算机智能体更好地执行任务,还是仅仅是智能体会忽略的噪音?

纽约大学的一位研究人员着手通过一项严谨的实验来回答这个问题,旨在将指令本身的价值与其历史信息的价值区分开来。他们想知道,如果给智能体提供的技能中包含了来源详情,是否比提供一个将这些详情替换为空白占位符的相同技能版本,能更有效地解决问题。为此,他们创建了一个受控环境,让智能体面对 250 个不同的任务,涵盖了从处理文件冲突到处理内存错误等各种情况。对于每一个任务,智能体接收到的核心指令、工具和配置都是完全相同的。唯一的区别在于技能槽的内容:一个版本包含带有来源和证据字段的完整溯源信息,而另一个版本则包含一个占据相同空间但没有任何实际意义的固定宽度空白空间。

这一直接对比的结果是令人惊讶且违反直觉的。当研究人员测量智能体的成功率时,带有完整溯源信息的版本表现实际上略逊于带有空白占位符的版本。具体而言,带有额外历史信息的智能体在 38.8% 的任务中取得了成功,而带有简化、无历史信息的指令版本的成功率为 42.0%。这代表带有溯源信息的版本下降了 3.2 个百分点。研究人员非常谨慎地考虑了带有溯源信息的版本在单词数量或 Token(字符单元)长度上更长这一事实。他们进行了第二次独立的实验,涉及 100 个任务,并精确匹配了消息的长度,确保智能体在两种情况下接收到的文本量完全一致。在这种长度匹配的情景下,带有溯源信息的版本显示出 2.0 个百分点的微弱提升,但数据不够精确,无法证实这是一种真实的收益而非随机偶然的结果。

这项研究表明,在智能体的指令中添加来源历史信息的表象价值并非简单的收益。在主要测试中,额外的信息并没有帮助智能体取得成功;事实上,它似乎反而阻碍了性能,原因可能是额外的文本分散了模型的注意力,或者改变了它处理指令的方式。研究人员发现,结果在很大程度上取决于实验是如何设计的。当他们构建了一个如果不通过溯源信息就无法确定正确动作的特定场景时,溯源信息就变得至关重要,此时带有历史信息的智能体成功率远高于其他情况。然而,在正确动作可以仅从指令本身判定的通用任务池中,元数据并没有提供优势,有时甚至会导致性能下降。

这项工作挑战了“信息越多越好”这一针对人工智能的普遍假设。研究人员得出结论,不能通过观察将指令与历史信息混合在一起的“捆绑技能得分”来判断溯源信息的效用。相反,这些来源详情的价值取决于具体的上下文以及信息的呈现方式。对于开发这些系统的开发者而言,这一发现意味着,仅仅向每条指令添加引用或来源日志,并不一定会提高智能体完成任务的能力,如果智能体被额外的文本搞混,甚至可能产生负面影响。该研究主张采取一种更谨慎的方法,即根据任务的具体需求来测试溯源信息的必要性,而不是假设它是所有 AI 智能体的通用升级。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →