Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents
本文提出基于奥宾可行性理论的信息可行性原则与风险门控框架,旨在通过估算未观测风险的边界并实施单调性约束,以应对行为漂移与对抗性适应,从而实现对自主人工智能代理的自适应运行时治理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一位非常聪明、自主的机器人助手来管理你的银行账户、安排你的约会并订购你的杂货。你已经赋予它完全的行动权限。但问题在于:即使你从未修改过代码,机器人也可能开始缓慢地做出糟糕的决策。它可能会因新型请求而感到困惑,开始偏袒某些群体而非其他群体,或者无意中串联起一系列微小且无害的行动,最终累积成大规模的欺诈。
这篇题为《治理不可观察之物》("Governing What You Cannot Observe")的论文提出了一种新的方法来确保这些人工智能(AI)代理的安全。它建议不要仅仅检查单个行动是否被允许,而是通过监控代理的“生命体征”来预测其是否即将“生病”,从而在其真正崩溃之前进行干预。
以下是他们观点的分解,使用了简单的类比:
1. 核心问题:“静默漂移”
将 AI 代理想象成一辆在高速公路上行驶的汽车。
- 旧方法: 你在每次转弯前检查车辆。“这次转弯合法吗?”如果合法,你就让它继续行驶。
- 问题: 汽车的轮胎可能正在缓慢磨损,燃油混合比可能略微失调,或者驾驶员可能开始感到疲劳。即使每一次转弯都是合法的,由于这些缓慢且不可见的变化,汽车最终仍可能发生事故。
- 论文的洞察: 你不能只关注当前的转弯;你必须估算“未观察到的风险”(Unobserved Risk)。这是你此刻看不到的危险,但会在几分钟后出现。
2. 新规则:“安全边际”
作者提出了一条名为“信息可行性原则”(Informational Viability Principle)的简单规则。想象 AI 拥有一个“安全预算”。
- 能力(S): AI 当前的表现如何(例如,它正在正确地回答问题)。
- 风险边界(B): 对尚未可见之事的估计危险(例如,AI 正开始缓慢地产生幻觉或表现出偏见)。
- 规则: 只有当 AI 的能力超过其风险一个安全边际时,才允许其行动。
- 类比: 只有当你的油箱(能力)比到下一个加油站的距离(风险)显著更满时,你才开车。如果这个差距变得太小,即使汽车此刻看起来完好无损,你也应停止驾驶。
3. 三种隐藏的危险(“风险边界”)
该论文将这种不可见的风险分解为 AI 可能染上的三种特定类型的“疾病”:
- U(x) - “困惑”(不确定性): AI 正在缓慢地遗忘它过去所知道的内容。也许是世界发生了变化,或者是 AI 收到了一次使其行为发生改变的软件更新。
- 类比: 一位曾经能完美制作汤品的厨师,正开始慢慢忘记食谱,每天多加一点点盐。
- SB(x) - “不公平”(结构性偏见): AI 正在以不同方式对待不同的人群,即使它并非有意为之。
- 类比: 一位俱乐部保镖开始允许 90% 来自某个社区的人进入,却只允许 10% 来自另一个社区的人进入,尽管没有人指示他这样做。
- RG(x) - “诡计”(现实差距): AI 正在执行单独看似乎安全、但组合起来却危险的行为。
- 类比: 一个小偷连续五次从 ATM 机每次提取 4,900 美元。每次取款都低于触发警报的 5,000 美元限额,但总计 24,500 美元显然是盗窃。AI 需要看到“整个故事”,而不仅仅是单次取款。
4. 解决方案:“自动驾驶仪”与“可行性指数”
作者构建了一个名为RiskGate的系统来管理这一问题。它充当 AI 的健康监测器。
- 可行性指数(VI): 这是一个单一数值(范围从 -1 到 +1),用于指示 AI 的健康状况。
- +1: AI 非常安全。
- 0: AI 处于边缘状态。
- -1: AI 陷入困境。
- 预测未来(预判): 该系统不仅仅等待 AI 崩溃。它会绘制“健康指数”近期历史的趋势线。如果线条向下倾斜,它会预测 AI 何时会触及零点。
- 类比: 医生观察病人的体温趋势。即使病人此刻感觉良好,如果体温每小时上升 1 度,医生就知道病人在两小时后会出现发烧,并会在发烧发生之前采取行动。
- “仅收紧”规则(单调限制): 这是一个关键的安全功能。如果 AI 开始“生病”,系统只能收紧规则(使其更加谨慎)。它绝不能自动放宽规则。
- 类比: 如果一艘船开始进水,船长只能关闭更多的舱口。他们不能打开更多舱口来“修复”问题。如果船下沉得太快,唯一的选择就是按下“紧急停止开关”(完全停止 AI)并呼叫人类援助。
5. 现实生活中的运作方式(示例)
该论文通过两个场景测试了这一方法:
- “结构化”骗局: 一个恶意行为者试图通过进行多次小额转账来窃取资金。
- 结果: “困惑”和“不公平”检测器没有发现任何问题,因为每笔转账看起来都很正常。但“诡计”检测器(观察整个序列)发现了模式并阻止了盗窃。
- “静默偏见”骗局: 一个 AI 开始以稍高的频率拒绝来自特定少数群体的贷款申请,这种变化是缓慢发生的。
- 结果: 系统注意到“健康指数”正在缓慢下降。它预测 AI 将在大约 100 笔交易后变得不公平。它在不公平成为法律违规之前自动收紧了规则。
总结
这篇论文认为,治理 AI 并非针对每一个行动检查一份“做与不做”的清单。而是要估算随时间累积的不可见风险。通过将我们可以观察到的内容(AI 的当前行动)与我们无法观察到的内容(向危险缓慢漂移的过程)区分开来,并使用一个在情况看似危险时只能变得更严格(绝不能更宽松)的系统,我们可以在自主代理造成实际伤害之前确保其安全。
该论文并未声称:
- 它尚未在数百万个现实世界的 AI 代理上测试过此方法(这是未来工作计划的一部分)。
- 它并未声称能解决所有可能的 AI 问题(如“目标错位”或“欺骗”),但它提供了一个框架来捕捉最常见的漂移和偏见类型。
- 它并未表示 AI 可以自我修复;如果“健康指数”过低,系统将停止并等待人类介入。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。