← 最新论文
💬 NLP

GoldenRetriever: Non-Interactive Homomorphic Encrypted Retrieval for Privacy-Preserving RAG

本文提出了 GoldenRetriever,一种用于隐私保护检索增强生成(RAG)的非交互式同态加密框架,该框架通过高效的基于阈值的选择以及一种精度稳定的掩码极化方法,取代了昂贵的加密前 kk 个排名,从而实现了具有低延迟、可扩展且安全的文档检索。

原作者: Yang Gao, Gang Quan, Scott Piersall, Qian Lou, Dongdong Wang, Liqiang Wang

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Gao, Gang Quan, Scott Piersall, Qian Lou, Dongdong Wang, Liqiang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名试图利用海量秘密文件来破解谜团的侦探。在数字世界中,这与现代人工智能助手的工作方式非常相似:它们不仅仅依赖于在学校学到的知识;它们会去“检索”特定信息,从一个巨大的数据库中获取答案,以准确回答你的问题。这个过程被称为检索增强生成(Retrieval-Augmented Generation,简称 RAG)。然而,这里有一个问题。通常,为了找到正确的文件,侦探必须向图书管理员展示其纯文本形式的问题,而图书管理员能清楚地看到他在寻找什么。如果问题涉及秘密医疗记录或私人银行账户,这就会让人感到风险。

为了解决这个问题,科学家们一直尝试使用一种名为“同态加密”(Homomorphic Encryption)的“魔法锁”。你可以把它想象成一个特殊的玻璃盒,你可以在不打开盒子、不看到内部内容的情况下对其中的内容进行数学运算。你可以要求图书管理员寻找与你的秘密问题相匹配的文件,而他们可以在所有事物都处于锁定状态下的情况下完成这些数学运算。但问题在于:旧的方法就像是在试图通过阅读每一本书并将其与你的问题进行比较来对一百万本书进行分类,而且所有的这一切都要在玻璃盒内完成。这太慢、太复杂了,以至于在现实生活中几乎无法使用。

这正是新论文提出的一个巧妙捷径——“GoldenRetriever”。与其尝试对每一个文档进行排名以找到绝对的前十名(这是沉重且缓慢的体力活),研究人员建议采用一个更简单的规则:“只要拿走任何足够好的文档即可。”他们设定了一个特定的分数,比如一个“好感度阈值”,如果一个文档的相似度分数高于这条线,它就会被选中;如果低于这条线,则会被忽略。这把工作从繁重的对比马拉松变成了快速的线性扫描。论文证明,这种方法的效果与缓慢复杂的旧方法一样好,但速度却有了戏剧性的提升,这使得受保护的加密 AI 搜索在未来变得更加现实可行。

问题所在:缓慢且沉重的玻璃盒

想象你有一个巨大的图书馆,每本书都被锁在一个厚重的、不透明的玻璃盒里。你想找到与你写的秘密笔记相似的书。在过去,为了安全起见,图书管理员必须拿起每一本书,将其与你的笔记进行比较,并将它们从“最相似”到“最不相似”进行排序,而这一切都是在书仍然处于玻璃盒内的情况下进行的。

这就是论文中所说的“同态 top-k 排序”。这就像是戴着厚厚的隔热手套来给一副扑克牌排序,手套让你的手指变得笨拙。论文解释说,这个过程极其缓慢。在他们的测试中,即使只有适度的文档数量,处理一个查询的时间也超过了 10,000 秒(超过两个半小时)。对于想要快速获得答案的人来说,这实在太慢了。此外,旧的方法通常需要用户和图书管理员之间进行多次往返沟通,这就像是一场“热与冷”的游戏,会泄露关于你在寻找什么的线索。

解决方案:“足够好”的过滤器

这篇论文的作者们开发了一个名为 GoldenRetriever 的系统,他们决定不再尝试对每一本书进行排名。相反,他们提出了一个基于阈值的选择方案

把它想象成夜店门口的保安。保安不需要排队检查每一个人以决定谁是最“酷”的,他只需要一个简单的规则:“如果你的酷炫得分高于 0.6,你就可以进来。”GoldenRetriever 也是如此。它计算每个文档与你问题的相似度,如果得分高于预设的数值(即阈值),它就会将该文档标记为“已选中”;如果得分低于该值,则将其标记为“已忽略”。

这个简单的改变改变了游戏规则。因为系统不需要将每个文档与其他每个文档进行比较来寻找“最好的”那些,所以它不需要进行沉重的二次方数学运算。相反,它只需查看每个文档一次。论文表明,这把计算复杂度从一个随着图书馆规模增长而呈指数级变难的二次方混乱过程,转变为一个稳定且可预测的线性路径。

魔法技巧:极化掩码

由于这种方法存在一个棘手的问题。因为所有的数学运算都在“玻璃盒”(同态加密)内进行,结果并不是完美的数字,而是模糊的近似值。一个本应是完美“1”(选中)的文档可能会变成“0.98”,而一个本应是“0”(忽略)的文档可能会变成“0.02”。

如果系统试图使用这些模糊的数字来抓取书籍的实际文本,得到的将会是乱码。为了解决这个问题,研究人员发明了一种“精度稳定的掩码极化”(precision-stable mask polarization)方法。

想象你有一个略微摇晃的秤。如果你在一侧放一块重石,它会轻微倾斜但不会完全倒下。极化方法就像是一个超强的磁铁,如果天平哪怕只有一点点重,它就会猛地吸向“重”的一侧;如果天平哪怕只有一点点轻,它就会猛地吸向“空”的一侧。在数学上,他们使用了一个特殊的 7 次多项式函数,强行将这些模糊的数字转化为完美的 1 和 0。这确保了当最终的文本被解锁时,文字是完全正确的,没有任何错别字或缺失的字母。

他们的发现:无需牺牲速度

团队在包括 MS MARCO 和 Natural Questions 在内的标准检索基准数据集上测试了他们的新系统。他们将他们的“阈值”方法与旧的“排名”方法以及标准的“明文”(未加密)版本进行了对比。

结果非常明确:

  • 准确性: GoldenRetriever 与未加密的版本一样出色。它找到了正确的文档并完美地重建了文本。
  • 速度: 这是见证奇迹的地方。与旧的加密排名方法相比,他们的新方法速度大幅提升。在一项测试中,旧方法耗时 16,579.9 秒(约 4.6 小时),而新方法仅需 1,051.8 秒(约 17.5 分钟)。
  • 可扩展性: 当他们将文档数量从 100 增加到 1,000 时,系统保持稳定。所需时间呈可预测的增长,证明了该系统可以处理更大的图书馆而不会崩溃。

论文还指出,“阈值”设置是一个可以调节的旋钮。如果你将阈值设低,你会得到更多文档(高召回率),但如果你把阈值设得太高,你可能会错过一些相关信息。然而,即便存在这种权衡,该系统仍证明了你可以拥有一个既安全、私密,又不需要用户和服务器频繁交谈,且不会耗费数小时完成的搜索系统。

核心结论

GoldenRetriever 论文表明,我们不需要通过解决“在黑暗中完美排名一切”这一不可能的任务来实现私有 AI。相反,通过简单地询问“这是否足够好?”并使用一种巧妙的数学技巧来清理模糊的结果,我们可以构建出既安全、非交互式,又足够快速、可实际应用的搜索系统。它将一个缓慢、笨重的过程转变为一个精简、高效的流水线,让我们离那种既能尊重隐私又不减慢速度的 AI 助手又近了一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →