Autoformalization of Agent Instructions into Policy-as-Code
本文介绍了一种基于大语言模型(LLM)的自动形式化流水线,该流水线能将自然语言智能体指令与策略转化为经过形式化验证的 Cedar 策略语言代码,从而提供比概率性护栏和手工编码符号执行更具扩展性且更严谨的安全保障。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一位非常聪明、动作极快的机器人助手来处理你的医疗记录。这个机器人功能强大:它可以读取文件、编写新笔记,还可以调用其他工具获取信息。但正因为它如此强大,如果它感到困惑或被误导,可能会不小心删除患者的历史记录,或者为错误的人开具处方。
目前安全方法的问题在于,它们就像是在教一个孩子如何安全时,仅仅对他说:“请小心点!”或者寄希望于老师能注意到他做了什么错事。有时机器人会忽略警告,或者老师会漏掉。
这篇论文提出了一种新的方式来确保机器人的安全:策略即代码(Policy-as-Code)。与其仅仅用自然语言告诉机器人该做什么,作者们将这些规则转化为了一本严格的、数学化的“法典”,机器人无法与之争辩。
他们是如何实现的,这里使用了一个创意类比:
“验证三明治”(The Verification Sandwich)
作者构建了一个三层系统,将混乱的人类指令转化为严格的机器人法律。他们称之为**“验证三明治”**。
底层的面包(底层:接地层/Grounding Layer):
在机器人遵循规则之前,它需要知道“食材”是什么。这一层观察机器人的工具和现实世界的对象(如“患者”、“医生”或“处方”),并创建一个严格的词典。它确保当机器人说“患者”时,它指的确实是数据库中的真实人物,而不是一个虚构的名字。中间的肉(中层:模型层/Model Layer):
这是“智能”发生的地方。一个大型 AI 模型(机器人的大脑)阅读人类指令(例如,“在检查过敏史之前,绝不能开具处方”),并尝试将这些指令翻译成严格的法典语言(称为 Cedar)。这就像是一个翻译官试图将一首诗转化为一份法律合同。顶层的面包(顶层:安全层/Safety Layer):
这是最重要的部分。翻译好的法典并不会被直接接受,而是要接受两位评论家的**“酷刑测试”**:- 严厉的评论家(机器人律师): 这是一个检查语法错误的计算机程序。它会问:“这个句子语法正确吗?它是否自相矛盾?是否无法执行?”如果法典中有拼写错误,这位评论家会立即拒绝它。
- 温和的评论家(人类法官): 这是另一个 AI,它会阅读原始的人类指令和新的法典,以查看它们的“感觉”是否一致。它会问:“这条严格的规则是否真的表达了人类的原意,还是翻译官搞错了规则的精神?”
如果法典通过了这两位评论家的审核,它就会被批准。如果未通过,系统会循环回溯,修复错误并再次尝试。
结果:数字保镖
一旦规则获得批准,它们就会被加载到一个“策略引擎”中。把这个引擎想象成一个夜总会的保镖。
- 每当机器人助手尝试做某件事(比如“开具处方”)时,它都必须询问保镖。
- 保镖不在乎机器人“说了什么”或它“认为”什么是好事。保镖只看那本严格的法典。
- 如果某个行为违反了规则,保镖会立即说“不”。机器人无法通过言语来辩解,即使它被黑客误导也无法改变结果。
他们测试了什么
作者在名为 MedAgentBench 的医疗基准测试上测试了这个系统。他们将这种自动化的“保镖”系统与之前需要人工手动编写安全规则的方法进行了对比。
- 旧方法: 人类为 23 个特定场景编写了规则。机器人在这些场景下是安全的,但在其他 65 个场景下可能会出错。
- 新方法: 他们的系统可以自动为所有 88 个场景生成规则。
- 结果: 当他们试图诱导机器人犯错(例如在未检查过敏史的情况下开具处方)时,他们的系统比旧的人工系统能更有效地拦截不良行为。事实上,当机器人尝试在未经许可的情况下写入数据时,针对这些特定的尝试,他们的系统实现了 100% 的拦截。
为什么这很重要
论文认为这种方法更安全,因为:
- 它不是一种猜测: 不同于其他依赖概率(例如,“我觉得这有 90% 的安全性”)的安全工具,这个系统依赖于数学。它要么允许该行为,要么不允许。
- 难以被欺骗: 由于规则位于机器人的“大脑”之外,黑客无法通过欺骗机器人来让它忽略规则。保镖与机器人是分离的。
- 它具有可扩展性: 人类无法为每一种可能发生的情况编写数以千计的规则。这个系统可以自动将数以千计的自然语言规则转化为代码。
简而言之,这篇论文表明,通过将“请小心点”转化为“这是确保安全的精确数学公式”,我们可以构建出在医疗等高风险环境中更难被欺骗、更加可靠的 AI 智能体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。