← 最新论文
🤖 AI

Distributing Security Controls Through Harness Engineering

本文介绍了 SHarD,这是一种可分发的安全护栏,它成功地在商业 AI 编程智能体中嵌入并扩展了操作系统沙箱、技能扫描和工具限制控制,在不损害智能体性能的情况下,实现了缓解 OWASP Top 10 风险 100% 的有效性。

原作者: William Robert Gore

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: William Robert Gore

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你的电脑拥有一个超级聪明的助手,它不仅能回答问题,还能为你编写代码、修复漏洞并构建软件。这些被称为“AI 编程智能体”(AI coding agents),它们正变得极其流行,数百万人正利用它们来提高工作效率。但问题在于:就像一个现实生活中的实习生,如果你问错了问题,可能会不小心删掉你的整个硬盘一样,这些数字助手如果被诱骗,也会变得非常危险。如果黑客在智能体读取的文档中偷偷植入了一条恶意指令,智能体可能会将其误认为是一条正常的命令,从而开始破坏文件或窃取机密。这就是大问题所在:我们如何让这些强大的智能体在工作的同时,又不至于失控?

为了解决这个问题,研究人员正在研究一种叫做“护栏”(harness)的东西。把 AI 模型(大脑)想象成赛车的引擎,而把护栏想象成汽车的车架、刹车和安全笼。引擎虽然强大,但如果没有安全笼,它就是一个随时可能发生的危险爆炸。护栏是包裹在 AI 周围的一层代码,用来控制它能接触什么、能说什么以及能做什么。科学家们提出的重大问题是:我们能否构建一个通用的安全笼,无论谁制造的 AI 智能体都能适用,并且像简单的软件更新一样分发给所有人?

这篇由佐治亚理工学院的 William R. Gore 撰写的论文,正是深入探讨了这个问题。作者想要测试,我们是否可以把标准的安全工具——比如将 AI 困在安全房间里的“数字沙盒”,或者在 AI 接触代码前对其进行检查的“扫描器”——全部打包成一个任何人都能通过一条命令安装的单一“护栏”。目标是证明,你不需要等待特定公司(如微软或谷歌)在其产品中内置安全性;相反,你可以构建自己的安全笼,并将其叠加在任何商业 AI 智能体之上。

研究团队建立了一个实验室来进行测试。他们使用了两种流行的商业 AI 编程智能体,并尝试用一系列 23 种不同的攻击手段来欺骗它们,这些攻击手段基于一份著名的前十大 AI 系统被黑名单。首先,他们在没有任何安全装备的情况下测试了这些智能体,以观察情况会变得多糟。然后,他们直接在智能体中添加了安全工具,以观察其效果。最后,他们构建了自己的自定义护栏,称为 SHarD(安全护栏分发系统),该护栏包裹在一个不同的开源智能体周围,并包含了相同的安全工具。

结果非常令人兴奋。研究发现,你完全可以将这些安全工具包裹在 AI 智能体周围并轻松分发。当他们测试自定义护栏时,在具有主动控制功能的类别中,其表现与经过商业安全加固的智能体一样出色。具体而言,该护栏在针对三个工作工具(技能扫描、操作系统沙盒和工具限制)的“调整后”指标上取得了完美得分,达到了顶尖商业级的结果。然而,研究人员必须从这个完美得分中剔除“内容保护”测试,因为该特定工具过于沉重且与其他工具存在冲突,因此未被纳入最终的护栏中。表现最好的三个主要工具是:

  1. 操作系统沙盒(OS Sandboxing): 这就像把 AI 关进一个玻璃箱里。即使 AI 被诱骗尝试删除文件,这个箱子也会阻止它触碰指定区域以外的任何东西。
  2. 技能扫描(Skill Scanning): 在 AI 使用新“技能”(工具或插件)之前,扫描器会检查其是否存在病毒或恶意指令。
  3. 工具限制(Tool Restriction): 这是一本简单的规则手册,规定:“你可以使用计算器,但不允许使用‘删除一切’按钮。”

然而,论文也指出了一些重要的局限性。一种被称为“内容保护”(试图读取 AI 的想法并在坏主意产生前将其拦截)的安全工具在这一设置中表现并不理想。它太沉重了,并且实际上阻碍了其他工具的运行,因此研究人员不得不将其移除。他们还注意到了一些诡异的现象:有时 AI 表现得安全只是因为偶然,并不是因为规则,而是因为它遇到了“好运的一天”。但当你下次询问同样的问题时,它可能又会表现出危险的行为。这证明了你不能依赖 AI 的大脑来保证安全;你需要通过护栏来强制执行安全。

最后,论文建议,AI 安全的未来不仅仅在于制造更聪明的人工智能大脑,而在于构建更好的安全笼(护栏),让工程师能够轻松安装和共享。它表明,安全性可以像软件一样进行规模化扩展,为团队提供了一种无需等待供应商修复即可保护其 AI 智能体的方法。虽然这是一个针对特定工具集的成功实验,但作者承认,他们需要测试更多的控制措施,以建立一套完美的规则手册,来定义什么是“护栏就绪”的安全工具。但核心结论是明确的:有了合适的护栏,我们可以让我们的 AI 智能体自由奔跑,而不至于被它们碾压。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →