← 最新论文
🤖 machine learning

Leak It: A Probabilistic Approach to Training-Data Extraction from Black-Box Language Models

本文认为,像 ROC-AUC 这样的聚合成员推理指标掩盖了黑盒语言模型中由于容量依赖而导致的严重的逐字训练数据提取风险,证明了无论是否存在盲基准或去重机制,包含标识符或代码的具体文档都经常被泄露,并提出了通过“leakit”工具进行单文档概率审计的框架,以准确衡量这种隐私危害。

原作者: Victor Maricato

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Victor Maricato

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图弄清楚一个特定的、秘密的配方是否被用来烘焙了一个巨大的、神秘的蛋糕。你看不见厨房,也不能询问烘焙师配料表。你唯一能做的,就是根据你之前发现的一小块碎屑,要求烘焙师再做几片蛋糕。如果每当你提出要求时,烘焙师都吐出完全相同的秘密配料表,你可能会猜到那个秘密配方确实存在于他们的记忆中。这就是“语言模型”的世界——这些超级智能的计算机程序通过阅读互联网上的海量文本进行学习。它们就像那些烘焙师一样,只不过它们预测的是句子中的下一个词。

科学家们正在提出的一个大问题是:这些数字烘焙师是否记得它们“吃”过的特定书籍?这被称为“成员推理”(Membership Inference)。如果一个模型记住了某个特定的文档,它可能会在无意中吐出该文档中隐藏的私人细节,比如一个人的电子邮件地址或电话号码。长期以来,研究人员一直试图通过观察其测试的“平均”表现来衡量这一点。他们会说:“嘿,我们的测试准确率是90%!”但就像天气预报说“大部分时间晴朗”却漏掉了突如其来的危险风暴一样,这些平均得分可能会掩盖模型正在为少数倒霉的人泄露危险秘密的事实。

这篇题为《LEAK IT》的论文对我们如何捕捉这些数字泄漏进行了全新的审视。作者(由 Victor Maricato 领导)认为,旧的测量隐私的方法具有误导性。他们发现,许多声称能检测某个文档是否在训练数据中的“智能”测试,实际上只是根据文本本身的风格在进行猜测,而不是基于模型的记忆。这就像是仅仅通过观察糖霜的颜色来猜测蛋糕是否使用了秘密配方,而糖霜的颜色其实只是一个巧合。

然而,这篇论文揭示了一个更危险的真相:虽然“平均”测试看起来无害,但模型确实在泄露,只是仅针对非常特定的、一小部分文档。研究人员发现,如果要求模型从一段包含真实电子邮件地址的代码或文档中延续句子,它有时会原封不动地吐出那项精确的、私密的个人信息。这就像是当被问及关于一种特定稀有香料的句子时,烘焙师突然大声喊出那种香料的精确品牌和批次号,即便对于像面粉这样的常见原料,他们是不会这么做的。

研究表明,这种“逐字提取”(verbatim extraction)会随着模型的规模变大而变得更加严重。对于一个拥有 69 亿参数的模型,大约 16.6% 包含真实标识符(如电子邮件或电话号码)的文档会以这种方式被泄露。令人惊讶的是,作者发现仅仅删除训练数据中的重复文本(一种常见的安全步骤)并不能真正阻止这种情况发生。他们还表明,这种风险分布并不均匀;对于计算机代码而言,风险要比对于普通故事或文章高得多。

主要的启示是,我们需要停止关注“平均”隐私得分,转而开始检查这些特定的、高风险的泄漏。作者发布了一个名为“leakit”的新工具,以帮助审计人员找到这些模型可能意外泄露私人秘密的具体时刻。他们建议,与其仅仅说“这个模型大部分时间是安全的”,我们不如承认对于某些文档,该模型是一个非常有效的记忆泄漏源,并且我们需要更强大的保护措施,比如一种叫做“差分隐私”(differential privacy)的特殊隐私屏蔽。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →