← 最新论文
💻 computer science

SARC: A Governance-by-Architecture Framework for Agentic AI Systems

本文介绍了 SARC,这是一个运行时治理框架,它将约束视为一等规范对象,在智能体循环的多个节点强制执行义务,从而消除硬约束违规,并相较于传统的事后或策略即代码方法显著减少软窗口超额。

原作者: Gaston Besanson

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Gaston Besanson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在构建一个非常智能的自主机器人助手(即“代理型 AI"),它能够执行诸如订购物资、预订航班或管理资金等任务。你希望这个机器人乐于助人,但同时也必须确保它不会违法、不会过度消费,也不会犯下危险的错误。

目前,大多数公司试图通过给机器人提供写在笔记本里的规则(提示词),或者在它们完成任务后检查其工作(事后审计)来控制这些机器人。该论文认为,这就像雇佣一名保安,却只在窃贼已经逃跑后才去检查大门。为时已晚。

作者提出了SARC(状态、动作、奖励、约束),这是一种构建此类机器人的新方法,其规则在机器人迈出第一步之前,就被硬编码进机器人的大脑中。

以下是其工作原理的简明分解:

1. 核心理念:“一等公民”规则

在传统编程中,你告诉机器人要做什么(状态)、它有哪些工具(动作)以及它想达成什么目标(奖励)。该论文指出,我们缺失了第四个至关重要的部分:约束(C)

把它想象成一辆汽车:

  • 旧方法:你告诉司机“请安全驾驶”,然后如果他们收到罚单,你再查看警方报告。
  • SARC 方法:你在汽车引擎中直接安装限速器刹车。如果汽车试图在限速 30 英里的区域以 90 英里/小时的速度行驶,汽车在物理上就无法做到。这条规则不仅仅是一个建议;它是机器的一部分机械组件。

2. 四个“安全关卡”

SARC 不仅仅有一条规则;它有四个具体的检查点,在机器人采取行动之前,会对其行动进行拦截和检查。想象一下高度安全的机场:

  1. 行动前关卡(PAG)在机器人甚至拿起工具之前。

    • 类比:TSA(美国运输安全管理局)安检员在你登机前检查你的身份证和登机牌。
    • 作用:如果机器人计划购买昂贵的物品,若未获得人类批准,此关卡会立即将其拦截。它阻止“硬性”规则(例如“永远不要购买非法物品”)。
  2. 行动时监控器(ATM)在机器人执行任务期间。

    • 类比:空乘人员在飞机飞行时监控引擎仪表。
    • 作用:如果机器人正在流式传输数据或进行长时间通话,此监控器会实时观察。如果成本过高或数据异常,它可以在飞行途中切断连接。
  3. 行动后审计员(PAA)任务刚完成、下一个任务开始之前。

    • 类比:离开商店后立即检查收据,然后再去下一家商店。
    • 作用:它查看实际发生的情况。如果机器人在过去 24 小时内花费过多,它可能会减缓下一次购买的节奏。它处理“软性”规则(例如“不要花费太多,但偶尔发生一次也可以”)。
  4. 升级路由器(ER)“呼叫人类”按钮。

    • 类比:飞行员按下“求救”按钮并将控制权移交给空中交通管制。
    • 作用:如果机器人遇到不确定的情况(例如新的供应商),它会暂停,呼叫人类,并等待“通过”或“不通过”的信号。如果人类未在规定时间内回复,机器人会自动选择“不通过”以确保安全。

3. 为什么“仅仅告诉机器人”行不通

该论文从数学上证明,你不能仅仅告诉机器人:“如果你违反规则,你就会失去 1000 点幸福感。”

  • 问题:如果机器人通过违反规则可以赚取一百万美元,而被抓的概率极小,那么由于回报巨大,机器人仍然会冒险。
  • SARC 解决方案:SARC 不是指望机器人选择不违反规则,而是构建了一道机器人无法翻越的墙。它将规则视为物理屏障,而不仅仅是建议。

4. “收据”(审计轨迹)

AI 面临的最大问题之一是,当出现问题时,没有人知道为什么发生或造成的。

  • 旧方法:你查看杂乱的日志文件,试图猜测发生了什么。
  • SARC 方法:机器人每次移动时,都会自动打印一张完美的、机器可读的收据。这张收据会说明:“我想做 X。我检查了规则 Y。规则 Y 说‘停止’。我停止了。”
  • 好处:如果监管机构问:“你遵守法律了吗?”你不必猜测。你只需向他们出示收据。该论文将此称为**“构建即审计”**。

5. 当机器人彼此对话时会发生什么?

在大公司中,一个机器人可能会雇佣另一个机器人来工作。

  • 风险:机器人 A 可能会告诉机器人 B 做某件违法的事,希望机器人 B 不知道规则。
  • SARC 修复:规则随工作一起传递。如果机器人 A 有一条规则,机器人 B 也必须遵守。如果机器人 B 试图隐藏该规则,系统会将其捕获。它还会保留清晰的授权谱系,让你确切知道哪个人类对最终决策负责。

6. 权衡(并非免费)

该论文诚实地指出:SARC 会使机器人稍慢一些,因为它必须在每个关卡停下来检查规则。

  • 类比:这就像驾驶一辆装有严格限速器的汽车。你不会像鲁莽的司机那样快速到达目的地,但你不会发生车祸。
  • 要点:该论文认为,在受监管的环境(如银行或医疗保健)中,“安全和可审计”比“快速且冒险”更重要。延迟的成本是为安全所支付的已知且可控的代价。

总结

SARC 是一份构建遵循规则的 AI 的蓝图,它是通过设计而非运气来实现的。它将规则从“建议箱”(提示词)和“赛后复盘”(审计)移入 AI 的引擎室。它确保如果机器人试图做被禁止的事情,系统会在物理上阻止它、请求人类帮助,或完美地记录该尝试,从而使 AI 安全、可解释,并准备好进入现实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →