← 最新论文
🤖 machine learning

MLQENABLER: Enabling Secure Machine Learning Queries over Encrypted Database in Cloud Computing

该论文提出了 MLQENABLER,一种基于索引的方案,该方案能够在云存储中加密数据库之上实现安全的机器学习查询,从而在数据安全性与可接受的机器学习性能之间取得平衡。

原作者: Xu Zhou, Haoyang Chen, Xinyu Lei

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Xu Zhou, Haoyang Chen, Xinyu Lei

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个巨大的、超级秘密的照片相册,想要将其存储在云端。你希望云服务公司为你做两件事:保护你的照片不被窥视,同时利用这些照片来训练一个能够识别面部或物体的超智能 AI。

这里有一个棘手的问题:如果你把照片锁在一个标准的保险箱里(加密),云服务公司看到的只是乱码般的随机静态噪声。他们无法用静态噪声来教 AI 学习。但如果为了让 AI 学习而将照片处于解锁状态,云服务公司(或黑客)就会窃取你的秘密。这是一个经典的“要么锁起来,要么用掉它”的困境。

由此,MLQENABLER 诞生了——这是由密歇根理工大学的研究员徐周(Xu Zhou)、陈浩阳(Haoyang Chen)和雷新宇(Xinyu Lei)提出的一种新方案。把 MLQENABLER 想象成一个神奇的“翻译器”,它解决了这个难题,却又没有破坏那把锁。

神奇的翻译器:EncGAN

MLQENBALE 并没有仅仅是锁定你的照片,它为每张图像创建了一个特殊的“影子副本”。它使用了一个被称为 EncGAN(加密生成对抗网络)的巧妙工具。

想象一下,一位大师级的伪造者(生成器)和一位目光敏锐的艺术评论家(判别器)。伪造者试图创造出一张看起来极其像随机噪声模式的假照片,甚至让评论家也无法分辨。与此同时,一个重构器充当了类似解码环的角色,试图将这些假噪声还原回原始照片。

通过这场高水平的博弈,伪造者学会了创造“安全索引项”。这些项目在云服务器看来就像是随机的静态噪声(从而保护了你的隐私),但它们仍然保留了原始照片的隐藏“形状”,使得 AI 能够从中学习。

他们尝试过的方法(以及为什么他们说“不行”)

研究人员研究了解决此问题的其他方法,但发现它们都不尽如人意:

  • 全同态加密 (FHE): 这就像是在不打开锁着的保险箱的情况下进行数学运算。论文指出这太慢了;在普通计算机上,仅仅训练一个简单的 4 层 AI 模型可能就需要数小时
  • 差分隐私 (DP): 这向数据中添加随机的“静态噪声”以隐藏细节。论文认为这是一种笨拙的方法。如果添加的噪声太多,AI 会感到困惑并犯错;如果添加得太少,你的秘密就不安全了。这是一个糟糕的权衡。
  • 联邦学习 (FL): 它将数据保留在你的设备上,只向云端发送更新。论文指出了其中的一个缺陷:虽然你的数据保持了隐藏,但最终的 AI 模型本身会被泄露。如果该模型是你的知识产权,云端可能会窃取并出售它。

它是如何在现实世界中运作的

在 MLQENABLER 系统中,你(客户端)使用标准锁(如 AES)对照片进行加密,以便云端无法读取。然后,你使用你的密钥,通过 EncGAN 生成那些“安全索引项”(即影子副本)。你将锁定的照片和影子副本一起发送给云端。

云端利用这些影子副本训练其 AI。因为影子副本看起来像是随机噪声,云端无法得知你的照片实际展示了什么。但因为影子副本是由这个特殊的翻译器制作的,AI 仍然能学习到正确的模式。

当你想要向 AI 提问(例如“这是一只猫吗?”)时,你会发送一个特殊的“令牌”(问题的影子版本)给云端。云端通过其训练好的 AI 运行这个问题,并将答案发回。云端既看不见你的真实照片,也看不见你的真实问题。

结果:安全,但伴随微小的代价

研究人员在包括 CIFAR-10CIFAR-100Tiny-ImageNetGTSRBCelebA 在内的六个不同图像数据集上进行了测试。他们使用了两种不同的 AI 模型:ResNet-18SwinV2-T

以下是实验结果:

  • 隐私性: “影子副本”看起来非常像随机噪声,以至于云端无法将它们与真实的随机数据区分开来。当他们尝试使用基于这些影子训练出的 AI 来猜测原始图像时,AI 表现得很糟糕,其准确率甚至不如随机猜测(例如,在 CIFAR-10 上,准确率从 95.75% 降至 10.18%,这基本上就是瞎猜)。
  • 性能: 在影子副本上训练的 AI 仍然非常出色,但并非完美。与在真实照片上训练相比,准确率略有下降。
    • 对于 ResNet-18,下降幅度在 0.07%3.05% 之间,平均下降 1.13%
    • 对于 SwinV2-T,下降幅度在 0.21%6.13% 之间,平均下降 2.86%
    • 最大的下降发生在 CIFAR-100 数据集配合 SwinV2-T 模型的情况下,准确率下降了 6.13%

论文得出结论,MLQENABLER 成功实现了对加密数据库的安全机器学习查询。它表明,虽然你会损失一点点准确性(即“轻微的机器学习性能下降”),但你换取了使用云端计算能力而不交出秘密的能力。作者认为这种权衡是非常值得的,尤其是考虑到云存储很便宜,而隐私是无价的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →