← 最新论文
🤖 AI

Right Family, Wrong Skill: Benchmarking Risk Exposure in Agent Skill Retrieval

本文介绍了 SameCapRisk-Bench,这是一个旨在评估并缓解智能体技能检索中“同类能力风险暴露”的新型基准测试,它通过衡量系统检索出有害技能之于有益技能的“兄弟技能”的频率,证明了尽管现有方法实现了高召回率,但除非辅以针对性的评分和聚类机制,否则它们经常会暴露风险替代方案。

原作者: Jiandong Ding, Honglei Ji, Ming Liu, Tao Duan

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiandong Ding, Honglei Ji, Ming Liu, Tao Duan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能的新兴世界中,软件智能体正在学习代表我们采取行动。这些数字助手不仅仅是回答问题;它们通过进入一个庞大的专门工具(或称“技能”)库来执行任务,以完成工作。想象一位图书管理员,他不仅能找到一本书,还能打开它,阅读其中的说明,然后使用文中提到的锤子或计算器来修理一把坏掉的椅子。为了实现这一点,智能体必须在特定时刻检索出正确的工具。如果任务需要精细的操作,智能体需要一个精确且安全的技能。如果任务是粗放式的,它则需要不同的处理方式。挑战在于,这些库正在变得庞大且混乱,其中充满了表面看起来非常相似、但在底层行为却截然不同的工具。

问题不仅在于寻找看起来相关的工具,还在于避免陷入选错同一类工具中正确版本的陷al。研究人员可能需要一个能安全处理数据的技能,但库中包含了一个几乎完全相同但忽略了安全检查的技能。如果智能体抓错了,后果可能从任务失败演变为危险的错误。这种特定的失败——即找到了正确的工具家族,却选择了该家族中错误的代表——直到现在都难以衡量。来自华为技术有限公司和同济大学的研究团队致力于绘制这一危险图谱,创建了一种新的方法来测试智能体区分有益工具与其危险“孪生兄弟”的能力。

研究人员构建了一个名为 SameCapRisk-Bench 的测试场,这是一个旨在捕捉这种特定类型错误的受控环境。他们创建了 1,100 多个测试用例,要求智能体解决一个问题。对于每个问题,都有一个完美的技能符合工作需求,以及一个“风险兄弟”——一个属于同一类别但具有隐藏缺陷的工具,例如缺少安全检查或使用了错误的资源。目标是观察智能体的检索系统能否挑选出完美的技能,同时忽略掉那个危险的孪生体。测试包括两类挑战。第一类涉及一个拥有数千个技能的大型公共库,以观察智能体是否能在众多干扰项中找到正确的一个。第二类是一个更难的测试,其中两个技能的角色被互换了:在稍微不同的场景下,原本有益的工具变成了风险工具,这迫使系统必须关注请求的具体细节,而非仅仅关注一般主题。

当研究人员运行测试时,他们发现目前的系统非常擅长找到正确的工具大类,但往往无法选出安全的版本。使用标准的公共检索系统,智能体在近 90% 的案例中成功找到了有益的技能。然而,在其中约 35% 到 37% 的成功案例中,系统也将风险兄弟拉入了前列结果。这意味着,即使智能体找到了正确的工具家族,它也经常让自己暴露在错误的代表之下。研究人员使用他们称为“有害兄弟率”的指标来衡量这一点,该指标追踪了危险的孪生体出现在最终选择列表中的频率。数据表明,虽然这些系统在召回率(即找到正确的工具)方面表现出色,但在过滤掉不安全版本方面却表现不佳。

为了解决这个问题,团队测试了一种将过程分为两步的新方法。首先,系统识别哪些工具属于同一个家族。其次,它做出一个特定的选择,在排序最终结果之前仅挑选该家族中的一个代表。当他们应用这种方法时,结果发生了戏剧性的变化。系统仍然以很高的比例找到了有益的技能,但意外包含风险兄弟的次数从超过 30% 下降到了在最佳情况下低于 1%。这证明了失败之处不在于寻找正确的主题,而是在于选择特定工具的最终决策。研究表明,仅仅列出一份相关的工具清单是不够的;系统必须主动决定某个工具的版本是否适用于当前任务。

这些发现凸显了目前构建 AI 智能体时的一个关键差距。大多数系统侧重于将用户的提问与正确的主题进行匹配,并假设只要主题正确,工具就是安全的。本文证明了这一假设是有缺陷的。两个工具可以共享相同的名称和描述,但其操作规则却不同。一个可能需要特定的权限才能运行,而另一个则不需要。如果智能体选择了那个没有权限检查的版本,它可能会崩溃或产生不可预测的行为。研究人员展示了通过增加一个解决这些家族冲突的步骤——本质上是询问:“在这些相似的工具中,哪一个才是针对此特定请求的正确工具?”——可以将暴露风险显著降低,且不会牺牲寻找正确工具的能力。

这项工作并不声称已经解决了 AI 的所有安全问题,也不意味着库中的每个工具都是危险的。相反,它为一种特定的、被忽视的风险提供了一个清晰的衡量标准。研究人员发现,即使是最先进的公共系统也在这种区分上表现挣扎,在找到正确家族的案例中,往往在超过三分之一的情况下暴露了错误的工具。然而,他们也表明这是一个可以解决的问题。通过将特定工具的选择视为与一般主题选择不同的独立决策,开发者可以构建出既强大又谨慎的系统。研究结论指出,未来的 AI 智能体基准测试不应只衡量是否找到了正确的工具,还应衡量是否将错误的、有风险的版本排除在最终选择之外。这种重心的转移可以引导开发出更可靠的智能体,它们不仅理解自己需要做什么,还明白如何安全地去做。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →