← 最新论文
🤖 AI

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

该论文介绍了 RePolicy,一种基于强化学习的智能体防护机制,它通过动态调用特定上下文的安全策略来生成有据可依的安全判定,并证明了与现有的提示词工程和微调方法相比,其在多种基准测试中具有更优越的适应性和检测性能。

原作者: Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,新一代系统已经涌现,它们不仅仅是回答问题或编写文本。这些是自主智能体(autonomous agents),即能够规划复杂任务、使用软件工具并与外部世界交互以实现特定目标的数字实体。想象一下,一个不仅能预订机票,还能在无需人类持续指导的情况下,自主导航网站、填写表格并管理日历的个人助手。随着这些智能体的能力不断增强,对其安全性的要求也随之提高。危险不再仅仅关乎单句不当言论,而在于一系列行为——这些行为在孤立状态下看似无害,但串联在一起时可能会导致有害的结果。要确保这些智能体安全运行,需要一个能够监控其整个旅程、理解交通规则并在错误演变成灾难之前进行干预的系统。

多年来,保障这些智能体安全的标准方法一直依赖于静态规则或简单的提示词。开发者会将安全系统编程为包含固定禁止行为列表,或者要求模型根据一套通用的准则来检查其工作。然而,现实世界过于复杂,单一且不变的规则列表无法涵盖所有情况。一项任务在一种语境下是安全的,但在另一种语境下可能就是危险的,这取决于谁在提问、有哪些可用工具以及适用哪些法律。此外,安全政策本身也会随时间变化。仅仅依靠模型去死记硬背一套固定的规则,往往会导致它在面对新场景或从未见过的规则组合时感到困惑。这就像试图用一张只显示你已访问过的街道的地图来导航城市;当你转入一个新的街区时,地图便无法提供任何帮助。

为了解决这个问题,研究人员开发了一种名为 RePolicy 的新方法。RePolicy 不再将安全规则视为被动阅读的文本列表,而是将其视为安全检查器必须选择并使用的主动工具。其核心思想是教会安全系统如何观察特定情境,扫描可用规则库,并挑选出真正适用的那一条。一旦选中正确的规则,系统就会阅读其具体细节,并利用这些信息对智能体的行为是否安全做出最终判断。这种方法将安全检查从被动的阅读练习转变为主动的决策过程,使系统学会如何根据手头的任务从“抽屉”里取出正确的规则。

研究人员通过首先创建一个包含超过 20,000 个示例的海量数据集来构建这个系统。这些示例包括智能体执行任务的详细记录,以及管理这些任务的具体安全规则。他们为每个记录进行了标注,以展示应该应用哪条规则以及原因。利用这些数据,他们首先通过监督学习过程(类似于学生通过教科书学习)教会了系统如何阅读情境并找到匹配的规则。然而,仅仅通过记忆示例不足以应对现实世界任务的不可预测性。为了进一步提升系统的能力,研究人员随后应用了一种被称为强化学习的技术。在这个阶段,系统被允许反复练习进行决策。当它选择了正确的规则并做出了正确的安全判断时,它会获得奖励;当它选错了规则或遗漏了危险时,它会受到惩罚。随着时间的推移,系统学会了优化其选择,变得更擅长区分那些看起来相似但适用于不同情境的规则。

这项训练的一个关键部分涉及一个巧妙的技巧,旨在防止系统利用捷径进行投机取巧。在练习过程中,研究人员会在正确的规则旁边混入无关规则和虚假的“诱饵”策略。这迫使系统必须真正理解智能体行为的语境,而不是仅仅根据列表中存在的规则进行猜测。如果系统无法区分相关规则与诱饵,它就会测试失败。这确保了最终的系统学会了根据任务细节来识别管理该情境的具体政策,而非仅仅基于关键词的存在。

在针对评估智能体安全性设计的六个不同基准测试中,这一新系统表现得显著优于现有方法。它在检测各种场景下的不安全行为方面达到了极高的准确率,超越了通用人工智能模型和专门的安全工具。在六项测试中的四项中,它排名第一,展示了其在发现其他系统所遗漏风险方面的明显进步。或许最重要的一点是,该系统展现出了强大的能力,即使在可用规则列表发生变化或语境发生转移时,也能调用正确的安全政策。它不仅仅是在猜测,而是积极地选择正确的规则并利用其内容来证明其决策的合理性。

这项研究表明,通过教导安全系统主动选择并应用规则,而非仅仅被动阅读,我们可以为自主智能体创造出更具适应性和可靠性的守护者。这种方法使得安全机制能够随着其保护的智能体同步进化,在处理新工具和变化规章时无需重新进行完整的编程。虽然该系统并非完美解决方案,且仍取决于所提供的规则质量,但其结果指明了一条充满希望的前进路径。通过将安全政策调用转化为一项学习任务,研究人员在确保人工智能智能体在变得更加独立的同时,仍能处于清晰、具备上下文感知能力且有效的安全标准控制之下,迈出了重要的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →