← 最新论文
🤖 machine learning

Certified in Theory, Broken in Practice: Assumption Gaps in Cryptographic Model Certification

本文揭示了当前的密码学模型认证协议存在漏洞,即模型在固定的审计数据集上表现良好,但由于未经验证的泛化性而在实际应用中失效,并提出了严谨的安全定义和一个新的协议模板,以确保认证保证对来自同一分布的新鲜数据依然成立。

原作者: Carter Luck, Olive Franzese-McLaughlin, Elisaweta Masserova, Akira Takahashi, Antigoni Polychroniadou, Nicolas Papernot

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Carter Luck, Olive Franzese-McLaughlin, Elisaweta Masserova, Akira Takahashi, Antigoni Polychroniadou, Nicolas Papernot

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:我们可以要求计算机做出重要的决策——比如批准贷款、诊断疾病或决定谁能获得工作——而无需窥视计算机的“大脑”。这就是**隐私保护机器学习(Privacy-Preserving Machine Learning)**的承诺。这就像雇佣一位厨师为你烹饪一道家族秘方;你希望品尝到这道菜,以确保它美味(准确)且公平(不歧视),但你并不想看到食谱或食材,因为那是厨师的商业机密。

为了解决这个问题,科学家们使用了零知识证明(Zero-Knowledge Proofs, ZKPs)。你可以把它想象成一个魔术表演,厨师在从未展示食材的情况下,证明自己完美遵循了食谱。他们利用复杂的数学逻辑创造出一个“证书”,上面写着:“我保证这道菜有 99% 的美味程度”,而数学保证了他们没有撒谎。长期以来,人们一直认为,只要数学证明了证书有效,那么无论谁来品尝,这道菜都会很美味。但如果厨师可以骗过这个魔术呢?如果厨师专门为品鉴者准备了一个特殊版本的菜肴,因为他完全知道品鉴者会要求什么,而给其他人提供的却是完全不同的(且糟糕透顶的)食物呢?这正是这篇论文所提出的问题。


大审计劫案:理论上通过认证,实践中已破防

这篇题为**《理论上通过认证,实践中已破防》(Certified in Theory, Broken in Practice)**的论文,揭示了我们目前检查这些秘密 AI 模型时存在的一个隐蔽漏洞。作者们是一支由大学研究人员和摩根大通(J.P. Morgan)专家组成的团队,他们发现,如果模型创建者预先知道测试的内容,那么用于验证 AI 模型的“魔术证书”可以被轻易伪造。

背景设定:盲测

在现实世界中,当一家公司想要证明其 AI 是否公平或准确时,他们通常会聘请一名审计员。审计员挑选出一组测试问题(数据集),并要求 AI 回答这些问题。随后,AI 所有者使用零知识证明来说明:“看,我对这些问题的回答正确率达到了 99%,而且我没有作弊!”

问题在于,在许多现有系统中,AI 所有者可以在锁定最终模型之前看到测试题目。这就像一名学生在考试前一周就拿到了确切的考题,通过背诵答案,然后交上一张空白试卷,而这张试卷竟然神奇地证明了自己掌握了这些答案。

攻击手段:为评委量身定制

作者展示了恶意的模型所有者如何通过“伪造”其训练数据,从而在通过审计的同时,在现实世界中表现失败。他们将这种行为称为数据伪造攻击(Data Forging Attack)

以下是利用决策树(一种做决策的流程图)进行的模拟演示:

  1. 设定: 审计员向模型所有者提供一份特定的 1,000 个测试问题清单(审计数据集)。
  2. 诡计: 模型所有者利用这 1,000 个问题,在它们周围创建了数千个“邻居”点。他们在训练数据中加入了这些新点,但反转了这些邻居点的标签(答案)。同时,他们在模型中加入了一条规则:“如果问题看起来与这 1,000 个测试问题完全一致,则给出正确答案;如果看起来哪怕只有一点点不同(例如我们的新邻居点),则给出错误答案。”
  3. 结果: 当审计员运行测试时,模型表现得非常出色,正确率达到 99% 甚至 100%,因为它已经背下了测试内容。零知识证明也显示通过,模型因此被认证为“高准确度”。
  4. 背叛: 但一旦该模型部署到现实世界并遇到(即使是非常相似的)新数据时,它就会表现得一塌糊涂。在论文的实验中,那些在测试中通过率达 99% 的模型,在面对全新的、新鲜的数据时,准确率下降到了不到 30%

作者也在公平性审计上测试了这一点。他们表明,一个模型在测试名单上看起来非常公平(对不同群体给予同等的批准率),但在现实世界中却极其不公平,几乎 100% 地拒绝了特定群体的贷款申请。

为什么简单的检查行不通

你可能会想:“等等,审计员难道不能检查一下训练数据是否看起来像测试数据吗?”论文指出,攻击者足够聪明,能够骗过标准的统计测试。通过在训练集中加入测试数据的额外副本,攻击者使这两个数据集在统计学上看起来完全一致。像 Welch's t-test(一种判断两组数字是否来自同一来源的常用方法)这类测试在观察数据后会得出结论:“没错,它们看起来是一样的!”尽管模型实际上是被暗中操纵过的。

作者在六个不同的现实世界数据集(如信用卡违约记录和就业记录)上进行了模拟,发现这种攻击非常可靠。他们甚至证明了这种攻击不仅适用于简单的决策树,也适用于更复杂的模型,如 XGBoost神经网络

解决方案:惊喜测试

那么,我们该如何修复这个问题呢?论文提出了一种运行这些审计的新方法,称之为安全密码学模型认证(Secure Cryptographic Model Certification, CMC)

其核心思想简单而强大:模型所有者必须在看到测试问题之前,先锁定其模型。

想象这样一个游戏:

  1. 学生(模型所有者)将答案写在纸上,并将其放入一个密封的盒子里(密码学承诺/Cryptographic Commitment)。
  2. 只有在盒子密封之后,老师(审计员)才会把考试题目交给他们。
  3. 随后,学生利用魔术证明来展示,他们是基于盒子里的内容正确回答了问题。

由于学生在锁定盒子时无法看到题目,他们就无法预先操纵答案。论文从数学上证明,如果你遵循这种“承诺-采样-证明”(Commit-Sample-Prove)的顺序,模型就必须真正具备完成任务的能力,而不仅仅是擅长通过测试。

这意味着什么

作者谨慎地指出,他们并不是说旧的数学理论“坏了”或者零知识证明本身是错误的。数学本身是完美的,只是游戏的规则存在缺陷。旧规则允许模型所有者通过预知测试内容来进行作弊。

这篇论文起到了警示作用。它表明,要让隐私保护 AI 真正值得信赖,我们不能仅仅依赖于使用已知数据集的一次性测试。我们需要确保测试是“惊喜”式的,或者我们需要使用新鲜的数据对模型进行持续的检查。如果没有这些改进,我们可能会部署一些被认证为“完美”但实际上在现实世界中已经失效的 AI 系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →