← 最新论文
🤖 AI

TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

TRUSS 是一个循证框架,它通过在受控环境中将静态安全性检查与动态执行轨迹相结合,以迭代优化技能的功能有效性与安全性,从而生成任务可靠且用户安全的自动化智能体技能。

原作者: Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能快速发展的世界中,软件智能体正从简单的规划转向直接在现实世界中执行任务。为了处理复杂或专门的工作,开发者通常会赋予这些智能体“技能”——即一种将可重用步骤、特定知识和数字工具访问权限相结合的封装指令。这些技能使智能体无需从头开始重新训练即可学习新的能力。然而,创建这些技能传统上是一个手动过程,需要深厚的专业知识以确保指令既有用又安全。随着对自动化智能体需求的增长,研究人员正转向利用人工智能来自动编写这些技能。其中的核心挑战在于一种微妙的平衡:一项技能必须足够有效以完成工作,但同时也必须足够安全,以防止智能体意外删除文件、窃取数据或执行危险命令。如果一项技能编写得不好,它可能会将一个得力的助手变成安全风险,使用户的计算机面临危害。

一个研究小组开发了一个名为 TRUSS 的新框架来解决这个问题。TRUSS 不仅仅是检查生成的技能所编写的指令是否看起来正确,而是会在技能投入使用之前对其进行严格的试运行。该系统运作起来就像一条严格的质量控制线,结合了仔细的文档审查和实时的受监督试驾。首先,系统读取技能的指令,并根据已知事实和安全规则对其进行检查。如果指令通过了这一初步的静态检查,该技能并不会立即发布。相反,它会被加载到一个安全的隔离环境中,由一个“影子智能体”尝试使用它。这个影子智能体会尝试执行任务,同时一组自动化监控器会监视该技能试图采取的每一个动作。这些监控器会记录发生的每一件事,生成一份关于技能行为的详细日志,包括任何尝试访问受限区域或执行危险命令的行为。

这种方法的强大之处在于它能够捕捉到在纸面上不可见的错误。一项技能在文本描述中可能看起来无害,但在实际执行时可能会触发导致安全漏洞的连锁反应。TRUSS 利用从这些实时测试中收集到的证据来识别失败。如果技能尝试做一些不安全的事情或未能完成任务,系统会将该特定失败与导致该问题的技能部分联系起来。这些信息随后被反馈给生成器,由生成器重写技能以修复问题。这种测试、识别和改进的循环会一直持续,直到技能被证明既功能有效又完全安全。研究人员在数百个不同的场景中测试了这种方法,其中包括专门设计包含隐藏攻击的技能案例。

这项研究的结果令人瞩目。当研究人员要求 TRUSS 识别脆弱的技能时,它实现了完美的准确率,在用于评估的 168 个匹配的 SkillInject 工件中,它抓住了每一个恶意案例且没有出现任何误报。相比之下,仅查看指令文本的系统漏掉了大部分此类威胁。当系统被要求修复已经具有危险性的技能时,它成功地将攻击成功率降低了近一半,同时确保技能仍能完成其预期任务。在涉及为 187 个不同任务自动创建新技能的更广泛测试中,该框架将智能体的成功率从较低的基准提升到了超过一半的尝试次数,同时在基准评估中将安全性通过率提高到了 100%。这意味着,该系统首次能够生成不仅更擅长完成工作,而且符合测试场景中安全评估标准的技能。

研究人员发现,仅仅依赖静态分析(即在不运行代码或文本的情况下对其进行检查的做法)是不够的。许多危险行为只有在技能与真实环境交互时才会显现,这是基于文本的检查往往会忽略的细微差别。通过坚持要求提供实际执行的证据,TRUSS 能够引导创建在实践中可靠而非仅仅在理论上可靠的技能。这项研究表明,只要系统在允许接触用户数据之前,在受控设置中验证技能的行为,自动化技能生成就可以变得既安全又有效。这项工作指明了一条前进的路径,即人工智能可以安全地扩展其能力,赋予智能体解决问题的新工具,而不会损害其运行系统的安全性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →