← 最新论文
🤖 machine learning

TabPATE: Differentially Private Tabular In-Context Learning Without Public Data

本文介绍了 TabPATE,这是一个用于表格上下文学习(tabular in-context learning)的差分隐私框架,它利用教师-学生模型以及从特征范围或私有化边际分布中生成的合成查询,旨在无需公共分布内数据的情况下,防御成员推理攻击。

原作者: Dariush Wahdany, Matthew Jagielski, Jesse C. Cresswell, Adam Dziedzic, Franziska Boenisch

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Dariush Wahdany, Matthew Jagielski, Jesse C. Cresswell, Adam Dziedzic, Franziska Boenisch

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明、经过预训练的“先知”(一种表格基础模型),它只需阅读你提供的几个示例,就能预测诸如贷款审批或医疗诊断之类的事情。这被称为上下文学习(In-Context Learning, ICL)。你不需要重新训练这个先知;你只需要向它的耳边低语几个例子,它就能领悟其中的规律。

问题在于?你低语的那些例子可能包含隐私秘密(比如某人的信用卡号或病史)。

问题所在:“泄露的低语”

论文首先证明,如果你使用私密数据作为这些示例,先知会无意中“泄露”这些秘密。

可以这样想:你问先知,“这个人的信用评分好吗?”

  • 如果先知之前见过这个特定人的数据(作为“低语的示例”),它可能会以略微不同的置信度或速度来回答。
  • 一个狡猾的攻击者(一种“成员推理攻击”)可以通过监听这些细微差别来猜测:“啊哈!那个特定的人的数据确实在给你的示例中!”

作者测试了这一点,并发现即使是处于被动监听状态的攻击者,其猜测正确率也能达到 10%(这比随机猜测要高得多);而一个更具侵略性的攻击者,其猜测正确率甚至能达到 75%。这是一个隐私灾难。

旧的解决方案:“公共图书馆”难题

为了解决这个问题,研究人员之前使用了一种名为 PATE(教师集成私有聚合)的方法。

  • 它是如何工作的: 他们将私密数据分配给多个“教师”先知。这些教师会对一个问题进行投票。为了保护隐私,他们在宣布结果之前会加入一点点“静态噪声”。
  • 症结所在: 为了让教师们提出正确的问题,你需要一个包含类似非私密数据的**“公共图书馆”**来生成这些问题。
  • 现实情况: 在医疗或金融等敏感领域,你通常没有类似的公共图书馆。你不能直接向一家公立医院索要看起来完全像你私密数据的“虚假”患者记录。

新的解决方案:TabPATE(“想象引擎”)

作者引入了 TabPATE,一种新的保护隐私的方法,它不需要公共图书馆

以下是类比:
与其需要一个公共数据集来练习提问,TabPATE 利用游戏规则来想象出这些问题。

  1. 规则是已知的: 表格数据(如电子表格)有着严格的规则。我们知道“身高”列必须在 0 到 10 英尺之间。我们知道“年龄”是一个数字。我们知道“性别”是一个特定的类别。
  2. 生成合成查询: TabPATE 利用这些已知的规则(“边界”)来想象(生成)虚假的、合成的查询。
    • 选项 A(纯粹的想象): 它只是在允许的范围内随机选择数字(例如:“年龄:45,身高:5.8”)。这消耗的隐私成本为
    • 选项 B(引导式想象): 如果数据比较复杂(例如某种罕见疾病),它会花费一小部分隐私预算来学习数据的总体“形状”(例如:“大多数人处于 30 到 50 岁之间”),然后生成符合该形状的问题。
  3. 投票过程: 它让持有私密秘密的“教师”先知对这些想象出来的问题进行回答。
  4. 安全的答案: 教师们进行投票,系统会在投票中加入噪声,以确保无法通过逆向工程推导出任何单个人的秘密。
  5. 结果: 系统发布一份新的“想象的问题 + 安全的答案”列表。这份列表成为了先知的全新“上下文”。

为什么这意义重大

  • 无需公共数据: 你不需要寻找一个看起来像你私密数据集的公共数据集。系统可以利用已知的规则(从零开始)构建自己的“练习题”。
  • 隐私得到保护: 作者通过测试发现,使用 TabPATE 后,狡猾攻击者的成功率降到了接近随机猜测的水平(基本上是 50/50)。隐私秘密被有效地隐藏了起来。
  • 性能依然出色: 即便有了这么多隐私保护措施,先知仍然可以做出准确的预测。在测试中,TabPATE 的表现几乎与非私密版本一样出色,并且优于其他不使用公共数据的隐私方法。

总结

TabPATE 是一个保护读取私密电子表格的 AI 隐私盾牌。它不需要公共数据集来练习,而是利用已知的数据限制(如“年龄必须为正数”)来生成自己的练习题。然后,它让一组私密的“教师”对这些问题进行投票,加入噪声以掩盖个体秘密,最后发布一份安全的标注数据集。这使得 AI 能够从私密数据中学习,而永远不会泄露这些数据属于谁,同时也无需任何外部公共数据来提供帮助。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →