SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment
SkillConsist 是一个通过构建双向行为图并进行图对齐与差异分析,从而检测智能体声明技能与实现技能之间不一致性的新颖框架,该框架在一个新构建的包含 633 种技能的基准测试上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你的电脑不再仅仅是听从指令,而是像一个得力的助手,一个数字管家,它能浏览网页、管理文件,甚至为你预订假期。为了实现这一点,它使用了“技能(Agent Skills)”——即预设的工具或配方,告诉计算机如何执行特定任务。你可以把这些技能想象成食谱中的说明:“声明(declaration)”就像菜单上美味可口的“香辣塔可”描述,承诺了这道菜;而“实现(implementation)”则是厨房里实际进行的烹饪过程。
问题在于,如果菜单撒了谎怎么办。也许厨师(代码)不小心加入了一种会让塔可变有毒的秘密成分,或者尽管菜单承诺了有莎拉酱,但他们却忘了加。在数字世界中,这种不匹配是危险的。如果计算机代理根据一个虚假的承诺选择了某项技能,它可能会意外删除你的文件、泄露你的隐私数据,或者被黑客误导。科学家们正试图构建一个“美食评论家”,能够品尝菜肴并将其与菜单进行对比,以便在代理端上菜之前捕捉到这些谎言。这就是验证一项技能“所言”是否与“所做”相符的挑战。
于是有了 SkillConsist,一个旨在解决这一谜团的新型数字侦探。这项工具背后的研究人员意识到,以往的方法就像是在试图将一段只有一句话的菜单描述与一本长达50页的食谱进行对比,却缺乏清晰的匹配方式。菜单可能说“制作塔可”,而厨房的工作则涉及切洋葱、烤肉、热饼皮和调制莎拉酱。简单的逐字检查将会失败,因为“制作塔可”是一个宏大的概念,而厨房的工作则是许多细小步骤组成的链条。
SkillConsist 通过扮演一位超级组织有序的图书管理员来解决这个问题,它构建了两张独立的地图:一张用于菜单承诺,另一张用于厨房动作。首先,它利用智能 AI 梳理杂乱无章的文本和代码,将“我们承诺什么”与“我们实际做什么”区分开来。然后,它将这些内容绘制成图(graphs)——你可以把它们想象成流程图,其中的每一步都是一个节点,每条连接都是一条线。
奇迹发生在下一步:双向图对齐(Bidirectional Graph Alignment)。想象一下,尝试将菜单地图上的一个巨大的“制作塔可”气泡,与厨房地图上的一整簇相连的气泡进行匹配。SkillConsist 不仅仅寻找单一的匹配,它会向外扩展,沿着厨房地图中的线条,观察是否可以将一组步骤(切碎、烧烤、混合)捆绑在一起,从而完美地解释那单个的菜单承诺。它进行双向检查,确认每一个厨房步骤都有对应的菜单承诺,并且每一个菜单承诺都有对应的厨房计划。
一旦地图对齐,侦探就会寻找不一致之处。它会标记三种类型的麻烦:
- 冲突(Conflicts): 菜单说“香辣”,但厨房代码却加入了“甜味”。
- 未实现(Unimplemented): 菜单承诺有“莎拉酱”,但厨房里完全没有莎拉酱的原料。
- 未声明(Undeclared): 厨房正在偷偷往混合物里添加“毒药”,但菜单从未提及。
研究人员在包含 633 个真实世界代理技能(包括一些已知具有误导性或恶意性的技能)的大规模基准测试中测试了 SkillConsist。结果令人印象深刻:该工具正确识别不一致技能的准确率达到了 87.93%(这是一个被称为 F1 的得分),这比之前的最佳方法提高了超过 20 个百分点。它还能在约 62% 的情况下精准定位谎言在代码中的具体位置。
或许最重要的一点是,论文表明这不仅仅是在修复拼写错误,这关乎安全。当研究人员使用 SkillConsist 来筛选恶意技能时,它有助于在无需先在风险环境中运行的情况下,捕捉到更多危险工具。通过捕捉承诺与现实之间的不匹配,SkillConsist 为我们提供了一种让我们更加信任数字助手的方法,确保当计算机说它正在制作塔可时,它提供的不是某种危险的东西。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。