← 最新论文
🤖 AI

Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems

本文提出了一种针对自主人工智能系统的治理模型,该模型在保留智能体在规划方面的自主性的同时,将高风险操作的执行限制在那些经由权威来源独立证明、与意图进行密码学绑定、并经由确定性策略验证的操作之中。

原作者: Jakob Salfeld-Nebgen

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Jakob Salfeld-Nebgen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:别盯着司机看,要检查钥匙

想象你拥有一辆非常智能的自动驾驶汽车(一个 AI 智能体/Agent),它能够规划复杂的行程、与其他车辆交流,甚至能决定自己开车去超市。

目前,大多数安全系统都在试图监视驾驶员的大脑。它们会问:“驾驶员在想撞车吗?他是否使用了正确的词汇?”这篇论文认为这是一个错误的路径。相反,我们应该观察行为本身

该论文提出了一个新规则:不要试图控制驾驶员的想法;只需确保他们在点火之前,已经拿到了正确的钥匙和许可证。

问题所在:“黑盒”司机

现在,AI 智能体可以在没有人类检查每一步的情况下执行危险操作(例如部署软件代码或开具处方药)。

  • 旧方法: 我们试图观察 AI 的“大脑”来判断其行为是否正常。但如果 AI 非常聪明,即使它漏掉了一个事实(例如:“我没检查患者是否过敏”或“我没检查软件构建是否失败”),它看起来也可能表现得非常合规。
  • 缺陷: AI 可能正在与正确的工具进行对话,但它实际上并不知道世界是否安全。这就像一个认为路面很空旷的司机,但实际上并没有看交通灯。

解决方案:“礼宾部”模型

论文建议我们借鉴人类机构(如医院和银行)数世纪以来使用的系统。与其监控个人,不如要求在行动发生前提供独立的证明

将 AI 想象成一名信使(或快递员),而将一个名为治理中心(Governance Hub)的新系统想象成一位严格的礼宾人员

以下是流程的具体步骤:

1. 信使发起请求(意图声明)

AI(信使)向中心说:“我想将这段软件代码部署到正式网站上。”

  • 中心此时不会说“是”或“否”。
  • 相反,中心会给信使一张唯一的、一次性的票据(称为 意图 ID)。这张票据就像一把特定的锁,只适用于这个特定的请求。

2. 信使收集“密封信封”(证明/Attestation)

信使不能直接说:“我已经检查过代码了,没问题。”它必须去三个不同的、独立的专家(称为预言机/Oracles)那里获取密封且签名的信封

  • 预言机 1(代码审查员): 检查代码并签署信封,写道:“代码通过审查。”
  • 预言机 2(安全扫描器): 检查病毒并签署信封,写道:“未发现病毒。”
  • 预言机 3(测试运行器): 检查测试是否通过并签署信封,写道:“测试通过。”

关键规则: 信使不能自己编写这些信封。它只能收集这些信封。信封上盖有特殊的数字印章,以证明它们来自真实的专家,而非伪造。

3. “票据”必须与“信封”匹配(绑定/Binding)

信使将信封带回中心。中心会检查两件事:

  1. 印章: 签名是真的吗?专家确实签名了吗?
  2. 票据: 信封内部的唯一票据是否与中心最初发放的票据一致?
    • 为什么这很重要: 这能防止信使使用昨天成功测试的旧信封来通过今天的失败测试。票据确保了证明是新鲜的,并且属于这次特定的行动。

4. 中心做出决策(确定性策略)

中心查看规则(策略)。例如:“如果代码通过了,且没有病毒,且测试通过,则允许部署。”

  • 如果信封符合规则,中心会发出 “执行(GO)” 指令并签署最终的许可单。
  • 如果有任何缺失或过期,中心会发出 “停止(STOP)” 指令。

为什么这种方法更好(隐喻说明)

1. “公证员”类比
想象你想卖掉一套房子。你不会仅仅询问卖家:“房子安全吗?”你会去找一位公证员。公证员并不了解卖家,他们只负责核查文件。

  • 在这个 AI 模型中,中心就是公证员。
  • 预言机是独立的检查员(水管工、电工、结构工程师)。
  • AI 只是拿着文件的人。它无法伪造检查员的签名。

2. “银行金库”类比
要打开一个高安全性银行金库,你不仅需要一把钥匙。你需要三个人同时转动三把不同的钥匙。

  • AI 是站在金库前的人。
  • 预言机是三位银行官员。
  • 除非三位官员都针对该特定交易分别签字,否则 AI 无法打开金库。

这个模型能做什么(以及不能做什么)

它能做到:

  • 保证事实: 它确保在危险行动发生之前,独立的专家已经验证了相关事实(例如:“药物相互作用已检查”、“构建已通过”)。
  • 防止造假: AI 无法通过谎言来伪造结果,因为它不持有签名密钥。
  • 创建审计追踪: 每一项决策都被记录在永久且不可更改的日志中(类似于黑匣子记录仪),以便日后任何人都可以核查:“我们真的检查过药物相互作用吗?”

它不能做到:

  • 它不评判 AI 的“想法”: 如果 AI 因为某种奇怪且有害的原因开具处方药,但它在技术层面遵循了所有规则(检查了相互作用、检查了执照),该系统仍会允许其发生。它检查的是过程,而不是动机
  • 它不阻止 AI 进行规划: AI 仍然可以自由地思考、规划和交谈。它只是无法在没有文书证明的情况下对高风险事项进行行动

总结

这篇论文认为,我们不应该试图建立一个“思想警察”来监视 AI 智能体的想法。相反,我们应该建立一个**“守门人”**系统。

就像外科医生在没有签署知情同意书和验证患者身份之前不能进行手术一样,AI 在没有独立且签名的证明来确认条件安全之前,也不应该被允许部署代码或开具处方。AI 是信使;证明是钥匙;而中心是锁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →