Right-to-Act: A Pre-Execution Non-Compensatory Decision Protocol for AI Systems
本文介绍了“行动权”协议,这是一种确定性的、非补偿性的预执行框架,若任何安全条件未满足即中止 AI 行动,从而将重点从优化决策质量转向严格管控执行的准入资格。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明、快速的机器人助手。这个机器人可以执行诸如转账、将用户锁定在账户之外,或更改工厂机器设置等操作。目前,我们制定了许多规则来确保该机器人的安全性:
- 授权:“该机器人是否被允许操作这台机器?”
- 安全性:“此操作是否会伤害到任何人?”
- 风险评分:“在 1 到 100 的尺度上,此操作的风险有多大?”
该论文指出,即使机器人通过了所有这些测试,仍缺失了一个步骤。机器人可能获得了授权、是安全的且风险较低,但此刻执行该操作仍然是错误的,因为它缺失了拼图中至关重要的一块。
作者将这一缺失的步骤称为“行动前合法性缺口”。
核心问题:“分数”与“清单”
要理解这一缺口,不妨想象老师评估学生项目的两种不同方式:
1. 补偿性系统(我们目前的做法)
这就像一种基于积分的游戏。
- 学生因出色的设计获得 10 分。
- 因良好的研究获得 10 分。
- 因精彩的展示获得 10 分。
- 但是,他们忘记包含标题页(一项缺失的要求)。
- 结果:由于他们总共有 30 分,而及格线是 20 分,老师给了他们 A。缺失的标题页被其他优秀的部分“补偿”了。
2. 非补偿性系统(论文中提出的“行动权”)
这就像是一个带有严格清单的安全检查站。
- 你有票吗?是。
- 你有护照吗?是。
- 你有签证吗?否。
- 结果:无论你持有多金贵的票、多漂亮的护照,还是拥有多么友好的微笑,如果你缺少签证,你就不能进入。没有任何数量的“好分数”能弥补缺失的签证。
该论文认为,对于在现实世界中做出决策(如锁定账户或转移资金)的 AI 而言,我们需要的是清单方法,而不是计分系统。
“行动权”协议
作者提出了一项名为“行动权”的新规则。
把它想象成俱乐部的门卫,他不在乎你有多少钱(你的分数)或看起来多么体面(你的安全评分)。门卫只问:“你是否有打开这扇特定门所需的特定钥匙?”
- 如果 AI 说:“我想锁定这个用户的账户”,系统会检查:“我们是否有证据证明该用户确实违反了规则,还是仅仅是一个猜测?”
- 如果证据缺失,系统会说"不行"。
- 它不会说:“好吧,虽然猜测的置信度是 90%,但还是先执行吧。”
- 相反,它会说:“停止。我们没有钥匙。去获取更多信息或询问人类。”
为何这很重要(账户暂停示例)
该论文使用了一个现实世界的例子:AI 决定禁止用户访问网站。
- 旧方式:AI 发现该用户有 5 次可疑行为,看起来像已知的黑客,且 AI 有 95% 的把握认定其为黑客。“风险评分”很高。结果:用户立即被禁止访问。
- 问题:如果该用户只是在使用一台被黑客攻击的共享电脑呢?AI 对“可疑活动”的判断是“对”的,但对“是谁做的”判断却是“错”的。AI 遗漏了一个必要条件:“验证用户身份”。
- 新方式(行动权):系统检查清单。
- 可疑活动?是。
- 高置信度?是。
- 身份已验证? 否。
- 结果:系统停止。它不会禁止该用户。相反,它会说:“我暂时无法执行此操作。我需要向用户询问更多信息。”
主要结论
该论文从数学上证明,仅仅提高“风险评分”或改善“安全性”无法解决这一问题。如果你使用计分系统,高分总是能够掩盖缺失的要求。
合法性不是一种分数;它是一条边界。
该论文建议,在 AI 被允许对任何现实世界操作“扣动扳机”之前,它必须通过一份严格且不可协商的清单。如果连一个必要条件都缺失,无论 AI 多么“聪明”或“自信”,该操作都将被阻止。这将“无所作为”(等待、寻求帮助或升级给人工处理)转化为一个有效且必要的结果,而不是系统故障。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。