The Two Boundaries: Why Behavioral AI Governance Fails Structurally
本文认为,行为人工智能治理在结构上之所以失效,是因为根据莱斯定理,验证任意程序效应是否符合策略是不可判定的,并提出了“共界治理”——一种将计算与效应进行架构分离、并将治理嵌入执行流程的方案——作为消除因能力边界与策略边界错位所导致的不可避免的风险与低效的唯一解决方案。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《双重边界:为何行为式 AI 治理在结构上必然失效》的通俗解读,辅以日常类比。
核心问题:“双重边界”的不匹配
想象你拥有一个功能极其强大的机器人,它几乎无所不能:发送电子邮件、转移资金或修改数据库记录。为了保障安全,你设立了一道围栏(治理机制),规定它被允许做什么。
论文指出,在当今构建的几乎每一个 AI 系统中,都存在两道互不匹配的围栏:
- 能力围栏(机器人能够做什么): 这由机器人的工具和代码决定。如果机器人拥有发送邮件的工具,它就能够发送邮件。
- 规则围栏(机器人被允许做什么): 这由你编写的安全规则和过滤器决定。
问题所在: 这两道围栏几乎从未在大小或形状上保持一致。
- “风险区”(未被治理的能力): 有时机器人拥有某项工具可以使用,但你的规则并未涵盖该特定工具。这就像机器人拥有一扇安保人员不知情的秘密后门。机器人会从中溜走,导致坏事发生。
- “剧场区”(治理剧场): 有时你的规则对机器人无法做的事情规定得极其严格。这就像安排一名安保人员去检查机器人是否会“飞行”,而机器人根本没有翅膀。你在浪费精力去监管那些不可能发生的事,而真正的危险(那些后门)却依然敞开。
论文认为,试图通过增加更多的守卫或更多的规则来解决这一问题,只会让“剧场”变得更大,让“风险”略微减小,却永远无法填补那道鸿沟。
为何不能仅仅“监视”机器人(数学难题)
你可能会想:“为什么我们不构建一个超级智能的监控器来监视机器人,一旦它做坏事就将其制止呢?”
论文引用了一条著名的数学规则——莱斯定理(Rice's Theorem),来解释为何这对灵活智能的 AI 来说是不可能的。
- 类比: 想象你试图仅通过查看剧本就预测电影的结局。如果电影短小简单,你可以猜出结局。但如果电影是一个无限复杂、且会根据观众反应而变化的故事,没有任何算法能在电影播放前以 100% 的确定性预测出结局。
- 结果: 由于 AI 极其灵活(它可以编写自己的代码并以新方式组合工具),你无法在数学上预先证明某个特定动作是安全的。你只能猜测。而既然你只能猜测,就总存在机器人做出监控器未能察觉的坏事的可能性。
解决方案:“点餐员”与“厨师”
论文提出了一种结构性的修复方案。与其试图监视机器人并阻止它做坏事,不如改变机器人的构建方式。
旧模式(行为式治理):
机器人是一名厨师,可以直接接触炉灶、刀具和煤气。你站在旁边拿着记事板,一旦他们伸手去拿错误的食材,就大喊“停下!”
- 缺陷: 厨师可能在你喊出之前就拿起了煤气,或者他们可能找到了一种你未在记事板上写下的新烹饪方式。
新模式(结构性治理/共边界治理):
你将厨师与厨房分离开来。
- 厨师(计算): AI 仅被允许思考并写下食谱(即“指令”)。它无法触碰炉灶、刀具或煤气。它没有物理双手。
- 点餐员(治理边界): 一个独立的、严格的系统接收食谱。它检查:“这份食谱的食材对吗?安全吗?”
- 如果是,点餐员进入厨房烹饪这顿饭。
- 如果不是,点餐员将食谱扔掉。
为何有效:
- AI 无法做任何坏事,因为它 literally 没有接触世界的工具。
- 每一个动作都必须经过点餐员。
- 不存在“风险区”,因为 AI 没有秘密后门。
- 不存在“剧场区”,因为点餐员只检查那些实际上可以被烹饪的食谱。
为何“监控”不足以作为治理
论文还解释了为何仅仅“记录”或“日志化”AI 的行为不能算作治理。
- 类比: 想象银行里的一台监控摄像头。如果摄像头看到了劫匪,它会记录下犯罪。但摄像头并没有阻止抢劫。
- 数学逻辑: 如果摄像头能拦截 99% 的抢劫,听起来很棒。但如果银行每天有 1,000 笔交易,那么至少有一起抢劫从 1% 的漏洞中溜走的概率接近 100%。
- 核心观点: 你必须在行动发生之前将其阻止,而不仅仅是在事后记录。
结论
论文总结道,要真正治理 AI,你不能仅仅在现有系统之上叠加更多的过滤器或规则。你必须重建系统,使 AI 只能请求某些事情,而由一个独立的、严格的守门人决定这些事情是否发生。
- 如果边界匹配: AI 在结构上就是安全的(结构性治理)。
- 如果边界不匹配: 无论你添加多少规则,你总会面临一些风险和浪费的精力(行为式治理)。
作者已使用计算机代码(Coq)在数学上证明了这种“点餐员”方法是确保每个动作都受到治理的唯一途径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。