Governance by Construction for Generalist Agents
本文介绍了CUGA,这是一种策略即代码的模块化系统,它通过五个结构性检查点将治理直接嵌入通用大语言模型智能体的执行流程中,从而在不进行模型微调的情况下,使企业环境中的自主操作具备安全性、可审计性和合规性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一位才华横溢、速度极快但略显混乱的私人助理来运营你的业务。这位助理(即“通用智能体”)极其聪明,能够学会使用你办公室里的几乎任何工具,从电子邮件到银行数据库。然而,由于他们过于热心助人,可能会意外删除错误的文件、泄露机密密码,或尝试从事违反公司规定的行为。
论文《通用智能体的构建式治理》提出了一种名为 CUGA 的解决方案。请将 CUGA 视为一种在你开始工作前扣在助理身上的“智能隐形安全 harness",而非一种让助理变得“更好”的重新训练方法。这种 harness 并不改变助理的思维方式;它只是确保他们在思考和行动时遵守规则。
以下是这种“安全 harness"的工作原理,分解为五个简单的检查点:
1. 门口的保镖(意图守卫)
在助理拿起任何工具之前,意图守卫会检查他们试图做什么。
- 类比:想象俱乐部门口的保镖。如果你试图带着武器或假身份证进入,保镖会立即阻止你。
- 在论文中:如果用户要求智能体“删除数据库中的每个联系人”,保镖会看到这一危险请求并立即关上门。智能体甚至没有机会思考如何去做。
2. 分步食谱(操作手册)
一旦智能体进入,操作手册就会为复杂任务提供一份具体的食谱供其遵循。
- 类比:与其让厨师猜测如何制作舒芙蕾,不如递给他们一张严格的食谱卡,上面写着:“第一步,搅拌鸡蛋。第二步,加热烤箱。第三步,检查温度。”
- 在论文中:如果用户要求“查找医生”,智能体不会随意猜测。操作手册强制其遵循严格顺序:先检查保险,再查询医生代码,最后搜索名单。这阻止了智能体跳过步骤或编造事实。
3. 工具手册(工具指南)
当智能体拿起工具(如数据库或搜索引擎)时,工具指南会更新他们正在阅读的手册。
- 类比:想象你正在使用电钻。工具指南就像贴在电钻上的一张便利贴,上面写着:“警告:切勿在湿木头上使用,并始终佩戴护目镜。”
- 在论文中:它为智能体使用的工具添加了额外说明,提醒他们注意安全规则或正确使用工具的特定方式,确保他们不会误用工具。
4. 人类的“暂停”按钮(工具审批)
对于危险操作,系统会按下暂停按钮,等待人类主管说“开始”。
- 类比:这就像电子游戏,如果你试图炸毁一座桥,游戏会暂停并询问:“你确定要这样做吗?按‘是’继续。”
- 在论文中:如果智能体试图删除数据库或发送敏感邮件,系统会停止。在操作发生之前,人类必须明确点击“批准”。这防止了意外破坏。
5. 编辑(输出格式化器)
最后,在智能体将答案发回给你之前,输出格式化器会检查最终消息。
- 类比:这就像一位编辑,将草稿整理得格式正确,去除任何意外的拼写错误,并确保其看起来专业。
- 在论文中:它确保最终答案结构良好(如表格或清晰的列表),并过滤掉任何不应共享的信息。
为什么这很重要(结果)
作者在两个现实世界的商业场景中测试了该系统:
- 医疗保健:查找医生和检查保险。
- 业务运营:处理复杂的后台任务。
他们发现,当将这种“安全 harness"添加到不同的 AI 模型(包括开源模型)时,智能体的工作表现显著改善。
- 没有该系统,智能体会犯错、跳过步骤或感到困惑。
- 有了该系统,智能体完美地遵守了规则。在一次测试中,成功率从 75% 跃升至 100%。
核心启示
这篇论文的主要观点是,你不需要从头构建一个“完美”的 AI 来使其安全。相反,你可以构建一个治理系统,将其置于 AI 周围,在过程的每一步捕捉错误并执行规则。这使得在真实商业环境中使用强大的 AI 智能体成为可能,而无需担心它们会意外破坏某些东西或泄露秘密。它将一个“不可预测”的助理转变为一位可靠、遵守规则的雇员。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。