AI Accountability Infrastructure: Cryptographically Verifiable Decision Provenance for High-Stakes AI Systems
本文提出了人工智能问责基础设施(AAI),这是一个利用哈希链式、数字签名的记录以及阈值密码学构建的密码学框架,旨在为高风险领域的特定人工智能决策溯源提供保护隐私的第三方验证,同时在不报告创新实验结果的情况下,提供了形式化模型、威胁分析及监管对齐。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一个繁华的城市中,巨大的、隐形的机器人正在为每个人做着改变命运的决定。有时,一个机器人拒绝了你的贷款申请,或者标记一段视频进行删除,或者建议一种医疗方案。在过去,如果你想知道为什么人类做出了错误的抉择,你可以询问他们,或者查看他们的日记。但这些人工智能(AI)机器人并不写日记,而且它们往往无法用一种让我们理解的方式来解释它们的想法。这产生了一个巨大的问题:如果机器人犯了错,我们该如何证明发生了什么?
为了解决这个问题,科学家们一直试图为 AI 构建“黑匣子”,类似于飞机上的飞行记录仪,能够在坠毁后向调查人员说明哪里出了问题。他们还使用“可解释人工智能”(Explainable AI),这就像一位老师在事后试图解释一道数学题,但这往往无法捕捉到决策做出的确切瞬间。面临的巨大挑战是在两者之间取得平衡:我们需要看到证据以追究 AI 的责任,但我们不能直接向所有人展示原始数据,因为这可能会泄露隐私秘密或 AI 的运作方式(黑客可能会利用这一点)。这篇论文进入了这个混乱的中间地带,提出了一个问题:我们能否构建一个系统,以一种不可篡改、私密且只有在得到一群受信任的人同意时才能解锁的方式来记录 AI 的决策?
这篇论文的核心思想:AI “防篡改日记”
这篇论文的作者 Mezbah Uddin Rafi 提出了一种名为 AI 问责基础设施(AAI) 的新系统。把它想象成一本神奇的、不可破坏的日记,每一台高风险 AI 系统都被迫记录这本日志。但这不仅仅是任何一本普通的日记;这本日志是用一种特殊的代码编写的,使得在不引起所有人注意的情况下,不可能擦除或更改其中的任何一页。
以下是该系统的工作原理,使用了几个生动的比喻:
1. “黑匣子”收据
每当 AI 做出一个决策(比如批准贷款)时,系统不仅保存答案。它还会保存一份被称为 AI 问责记录(AAR) 的“收据”。这份收据列出了 AI 看到的内容(输入)、它使用了哪些工具(如计算器或数据库)以及它遵循了哪些规则。至关重要的是,它并不试图记录 AI 内部的“想法”或隐藏的推理过程,因为那些过程太混乱且多变。它只记录可观察的事实,就像监控摄像头记录谁走进了门,而不是记录他们在想什么。
2. 不可断裂的链条
为了确保没有人可以事后偷偷修改日记,系统使用一条数字“链”将每一个新的收据与前一个收据连接起来。想象一条链条,其中每一个环节都是由一种特殊的金属制成的,如果你试图熔化它,颜色就会改变。如果有人试图去修改上周的一份收据,链条就会断裂,整个链条会变红,大声尖叫:“嘿!有人篡改了这个!”这就是所谓的 哈希链接(hash-chaining),它确保一旦决策被写下,就会保持原样。
3. 需要三个人共同持有的“魔法钥匙”
这是最聪明的部分。通常,拥有 AI 的公司持有日记的钥匙。如果他们想隐瞒错误,他们可以直接锁上日记并扔掉钥匙。AAI 系统通过使用 阈值密码学(threshold cryptography) 解决了这个问题。想象一下,日记的钥匙被切成了五块。要打开日记并阅读其中的秘密,你需要至少三个人把他们的碎片凑在一起。这些人可能是 AI 公司、独立的审计员和政府监管机构。没有任何一个人——甚至连 AI 公司的首席执行官——能独自打开日记。这确保了证据不会被单个坏人隐藏或伪造。
4. “分级”手电筒
有时你不需要看整本日志,你只需要检查一个特定的事实。该系统使用了一种“渐进式披露”模型。它就像有一个手电筒,可以只照亮一句话、一个段落或整个页面,具体取决于谁在询问以及为什么要询问。如果法官需要查看证据,持有“魔法钥匙”的人就可以解锁他们需要的那部分,而日记的其他部分则保持黑暗和私密。这在保护用户隐私的同时,也实现了公正。
这篇论文实际发现了什么(以及没发现什么)
作者非常诚实地说明了他们已经做了什么,以及哪些部分仍处于进行中。他们并没有建立一个运行银行或医院的庞大现实世界 AI 系统。相反,他们构建了一个 原型——一个在单台计算机上运行的系统模拟版本。
在他们的模拟实验中,他们创建了 5,000 个虚假的 AI 决策。他们测试了他们的系统,并发现:
- 运行速度很快: 向链条中添加一个新的“收据”耗时不到一毫秒(平均约为 0.24 毫秒)。
- 能识破谎言: 当他们尝试篡改数据时,系统立即将其标记为损坏。
- 能保守秘密: 他们展示了你可以在不泄露记录其余部分的情况下,证明某个特定事实存在于记录中。
然而,论文明确指出,这还不是一个准备好投入现实世界的成品。由于模拟是在一台计算机上运行的,因此它没有测试当“密钥持有者”位于不同国家并通过互联网进行通信时,系统可能会变得多慢。作者还承认,虽然他们的系统可以证明记录没有被更改,但它无法证明 AI 看到的原始数据是真实的(例如,如果黑客向 AI 输入了虚假数据,记录会忠实地显示虚假数据,这仍然是一个问题)。
为什么这很重要
这篇论文就像是新一种安全网的蓝图。它并不解决 AI 的所有问题,也不声称自己是让 AI 变得完美的魔杖。相反,它提供了一种方法,确保当 AI 犯下重大错误时,我们拥有一份可靠、不可篡改的记录,并且没有任何单个人可以隐藏这份记录。它弥合了“我们信任 AI”与“我们可以证明 AI 做了什么”之间的鸿沟,为法院、监管机构和普通人提供了一种在不牺牲隐私或安全性的情况下,追究这些强大系统责任的方法。
作者总结道,虽然他们的数学逻辑在测试中成立,但现实世界的测试仍在前方。他们邀请其他研究人员采用他们的蓝图,构建真正的分布式系统,并观察它是否能够应对真实互联网的混乱。这是一个坚实的基石,但房子尚未建成。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。