← 最新论文
💬 NLP

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

CaSKG 是一个反事实因果框架,它通过离线证据聚合和文本反事实探测来构建并校准有向技能图谱,从而增强可扩展的大语言模型智能体技能检索,与现有方法相比,该框架显著提高了多种基准测试下的任务成功率和效率。

原作者: Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu, Yi Chang

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu, Yi Chang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个能够交谈、推理并在现实世界中行动,就像人类助手一样的计算机程序。这些被称为大语言模型智能体(LLM agents)的程序,正通过将生成文本的能力与访问外部工具和环境的能力相结合,变得越来越擅长解决复杂问题。它们可以学习使用 API、在模拟房间中交互,或遵循科学实验步骤。然而,随着这些智能体积累起庞大的可重用技能库——从烹饪一顿饭到进行化学测试的各种程序——挑战便从仅仅拥有工具转向了如何知道该使用哪些工具。如果智能体试图一次性记住所有可能的动作,它会被噪声淹没;如果它只寻找与当前任务匹配的词汇,它可能会错过一个虽然听起来不相似但逻辑上必不可少的关键步骤。核心问题在于,如何在海量的技能库中检索出正确的动作序列,而不至于迷失在无关细节中,或遗漏隐藏的依赖关系。

吉林大学和蚂蚁集团的研究人员开发了一种名为 CaSKG 的新方法来解决这一检索问题。该团队并没有将技能视为孤立的文本片段,也没有简单地基于它们听起来有多相似来建立连接,而是构建了一个系统,在智能体使用技能之前,先测试这些技能之间连接的可靠性。他们构建了一个有向图,即一个以技能为节点、以箭头表示动作先后顺序的网络。其创新之处在于他们如何决定保留哪些箭头。在发布最终的地图之前,该系统会对潜在的连接进行一系列严格的测试。它要求人工智能想象一些场景:如果某个技能被移除、被替换为另一个技能,或者执行顺序发生错误,会发生什么。通过观察在这些假设情况下任务是如何失败或变得混乱的,系统可以判断一个连接是真实的依赖关系,还是仅仅是巧合。

研究人员在两个不同的基准测试上测试了这种方法:一组涉及寻找和移动物体的家务任务,以及一组需要特定观察和操作序列的科学实验。他们使用六种不同的语言模型进行了这些测试,涵盖了从小型高效模型到大规模强大模型的范围。结果显示,这种新方法始终优于现有方法。在每种模型和任务类型的组合中,CaSKG 都实现了最高的成功率。对于科学任务,所有模型的平均得分从大约 72.6 提升到了 80.5;对于家务任务,成功率从 80.01% 上升到了 86.79%。或许更重要的一点是,使用这种方法的智能体能以更少的步骤达成目标,这表明它们不会因为尝试随机动作或纠正由错误建议导致的错误而浪费时间。

成功的关键在于系统过滤掉弱连接的能力。以往的方法通常依赖于基于技能共同出现频率或描述相似性的图谱。这项研究发现,这些方法往往会误导智能体,导致其遵循无关路径或错过关键的前置条件。通过使用反事实推理——本质上是询问“如果这个步骤没有发生会怎样?”——系统可以校准每个连接的置信度。它保留了那些构成连贯工作流的强有力且必要的链接(例如,在测试电路之前需要接通电源),同时丢弃了那些仅仅看起来相关但关联微弱的联系。这使得智能体能够检索出一个紧凑且可执行的技能包,从而保持操作的逻辑顺序,确保准备、行动、验证和完成等步骤都完整且按正确顺序呈现。

该研究还探讨了这种方法在技能库规模增长时表现如何。当可用技能的数量从几百个增加到两千个时,新方法的优势依然稳定,在某些情况下甚至变得更加显著。这表明,随着智能体积累更多知识,寻找可靠的导航方式变得愈发关键。研究人员发现,当系统能够利用多种证据(如技能的输入和输出要求,或它在工作流中的位置)而非仅仅依靠文本描述时,效果最好。他们还发现,虽然该方法对大多数任务都有显著帮助,但对于答案显而易见的简单直接搜索,其重要性较低,这证实了该系统的价值在于处理复杂的多步程序。

最终,这项工作证明了知识点之间连接的质量与知识本身同样重要。通过将检索过程视为验证因果关系而非仅仅是匹配单词的问题,研究人员创建了一个让智能体能够更有效地访问其记忆的框架。该方法并不改变智能体的行为方式或其可使用的工具;它只是确保在正确的时间提供正确的指令。这种方法为构建能够处理日益复杂任务的智能体提供了一条可扩展的路径,证明了经过良好校准的技能地图比一个庞大且无序的库更有价值。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →