Contractual Skills: A GovernSpec Design Framework for Enterprise AI Agents
本文介绍了“契约式技能”,这是一种受 GovernSpec 启发的框架,它将企业级 AI 智能体的指令构建为可读的任务契约,以增强目标、边界和质量标准的可审查性,并通过实验证明该方法提升了治理能力和可维护性,而非作为一种独立的安全机制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一位非常聪明、反应迅速,但有时过于热心的助手来协助运营你的业务。你交给他们一叠名为“技能”的指令。
在旧有的做法中,这些指令就像一封冗长、啰嗦的信。你可能会写道:“嘿,在与客户交谈时,要友善,查阅价格表,并且不要承诺任何你无法兑现的事情。”助手阅读后点头,并尽力而为。但由于规则被埋藏在大段文字中,助手可能会忘记检查价格,或者更糟的是,不小心承诺了不被允许提供的折扣。
本文提出了一种编写这些指令的新方法,称为“契约式技能”。
核心理念:从信件到清单
与其使用冗长的信件,不如将“契约式技能”视为一份正式的工作合同或飞行检查清单。
作者刘婷建议,每项技能都应包含特定的、带标签的方框(字段),助手必须填写或遵循:
- 目标:我们确切要做什么?
- 输入:在开始之前我们需要什么信息?(如果没有客户 ID,就停止!)
- 权限:你被允许使用哪些工具?(你可以阅读邮件,但不能删除文件。)
- 人工关卡:何时必须停止并请求人类主管批准?(例如:“如果折扣超过 10%,请暂停并等待签名。”)
- 证据:你的事实依据来自哪里?(不要猜测;展示你的来源。)
- 输出:最终结果应该是什么样子?(特定的格式,而不仅仅是一段随机的文字。)
为什么要这样做?
论文认为,当规则隐藏在“散文”(长文本)中时,很容易被忽略。而当它们位于带标签的方框中时,就变得无法忽视。
- 类比:想象一名飞行员驾驶飞机。如果安全规则写在一本小说里,飞行员可能会漏掉某一步。如果规则写在带有复选框的检查清单上,飞行员就必须勾选它们。契约式技能将 AI 的指令变成了这样的检查清单。
他们测试了什么?
研究人员进行了两项主要实验,以验证这种“清单”方法是否真的比“冗长信件”方法更有效。
1. 写作测试(文本生成)
他们要求不同的 AI 模型执行诸如撰写销售邮件、审查合同或检查代码等任务。他们比较了四个版本:
- 无技能:仅使用基本提示。
- 最小技能:简短、简单的指令。
- 普通扩展技能:冗长、详细的指令(就像旧的“啰嗦信件”)。
- 契约式技能:相同详细信息,但组织成严格的“清单”格式。
结果:与无技能或最小技能相比,“契约式技能”始终产生了更好、结构更清晰且更安全的结果。与拥有相同信息量的“普通扩展”版本相比,契约式版本在遵守规则和格式方面略胜一筹,尽管差异并不巨大。主要的胜利在于输出结果更易于检查和验证。
2. “别碰那个”测试(工具调用)
他们让 AI 访问模拟工具,包括一些本应被阻止的“危险”工具(如删除文件或发送资金)。他们观察 AI 是否试图使用这些工具。
结果:
- 好消息:使用任何类型的技能(即使是简单的技能)都降低了 AI 尝试危险行为的可能性。
- 局限性:“契约式技能”并没有在每种情况下神奇地阻止 AI尝试违反规则。某些模型仍然试图使用危险工具。
- 教训:技能充当警示标志或规则手册,告知 AI 应该发生什么,但它无法在物理上阻止 AI 尝试。你仍然需要一名“保安”(运行时护栏)来物理阻止不良行为。技能只是让 AI 更清楚何时应该停止。
结论
本文并不声称契约式技能能让 AI 变得绝对安全,也不声称它们能取代人类监督。相反,它声称它们使 AI 的职位描述更加清晰。
- 之前:“这里有一封长长的指令信。祝你好运!”
- 之后:“这里有一份合同,包含‘做什么’、‘避免什么’和‘何时寻求帮助’的清晰方框。”
这使得人类更容易审查 AI 的工作,更容易测试 AI 是否遵守规则,并帮助 AI 理解其工作的界限。它将模糊的“提示”转变为可管理的组织资产。
简而言之:契约式技能并没有让 AI 成为超级英雄;它们只是给了它一张更好的地图和一套更清晰的规则,这样它就不会迷路或意外撞车。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。