← 最新论文
🤖 AI

Addressing Labelled Data Scarcity: Taxonomy-Agnostic Annotation of PII Values in HTTP Traffic using LLMs

本文提出并评估了一种多阶段大语言模型流程,该流程能够实现对 HTTP 流量中个人身份信息灵活且与分类体系无关的标注,通过合成流量生成解决数据稀缺问题,并证明其在多种隐私定义下均具备准确的检测能力。

原作者: Thomas Cory, Axel Küpper

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas Cory, Axel Küpper

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位繁忙城市的隐私检查员。你的工作是检查每一封离开城市的信件、包裹和数字消息,确保没有人意外地泄露秘密个人信息(如家庭住址、电话号码或医疗记录)。这些秘密信息被称为PII(个人身份信息)。

多年来,检查员们一直使用两种主要工具:

  1. 规则手册:一份僵硬的关键词列表(如“电子邮件”或“社会安全号码”)。这种方法对简单的信件很有效,但当人们以奇怪的方式书写或使用代码时,它就会失效。
  2. 训练有素的狗:一个在数千个示例上训练过的机器学习模型。它很聪明,但只懂得被教导的具体规则。如果规则发生变化(例如,新法律对“健康数据”的定义不同),这只“狗”就需要从头重新训练,这需要很长时间,并且需要大量真实的秘密信件作为学习材料。

问题所在:真实的秘密信件很难获取(因为隐私法),而且界定何为“秘密”的规则总是在变化。这使得检查员面临优质训练数据短缺的问题,且手中的工具无法适应变化。

新解决方案:“超级翻译官”

本文介绍了一种利用大型语言模型(LLM)的新方法。不要将 LLM 视为一只训练有素的狗,而要将其视为一位超级聪明、灵活的翻译官,他几乎读过图书馆里的所有书籍。你不需要针对特定规则来训练这位翻译官;你只需在运行时(runtime)将规则手册交给他,他就能立即理解。

以下是作者构建其系统的方法,使用了简单的类比:

1. 装配线(处理流程)

作者没有要求翻译官一次性完成所有工作,而是建立了一个三步装配线:

  • 步骤 1:清洁工(预处理):在翻译官查看消息之前,一台机器会对其进行清理。它会解开代码(例如将 %20 还原为空格),以便翻译官能看到清晰、可读的句子。
  • 步骤 2:侦探与书记员(两阶段标注)
    • 侦探:首先,LLM 查看消息并指出:“我在这里看到了一个电话号码和一个名字,但没有医疗记录。”它会生成一份简短的清单,列出需要查找的内容。
    • 书记员:然后,进行第二次扫描,仅专注于找到这些特定项目的确切文本。通过缩小范围,书记员不会被其他数字或单词搞糊涂。
  • 步骤 3:编辑(审查):进行最终检查。如果书记员漏掉了一个数字或抓错了单词,编辑会进行修正。

2. “假信”工厂(合成数据)

由于检查员无法使用真实个人的秘密信件来训练工具,作者建立了一个制造假信的工厂

  • 这家工厂利用规则手册(分类法),要求 LLM 编写看起来逼真的信件,其中包含特定的秘密(例如“约翰·多伊的电话号码”)。
  • 至关重要的是,工厂还会为它制造的每一封信写下答案(即真实情况)。
  • 这为何重要:这解决了“短缺”问题。你可以瞬间生成数千封带有完美答案的练习信件,而无需触碰任何真实个人的私人数据。

3. 试驾(评估)

作者使用三种不同的“规则手册”(分类法)测试了该系统:

  1. AI4Privacy:一份常见秘密的广泛列表(姓名、电子邮件、ID)。
  2. mHealth:一份针对健康应用的特定列表(生命体征、健身数据)。
  3. PlayStore:应用商店使用的高级列表(例如“财务数据”或“位置”)。

结果

  • 成功:该系统在前两份规则手册上表现极佳。它能够阅读消息,查看当天提供的特定规则手册,并准确地找到秘密信息。
  • 挑战:它在处理"PlayStore"规则手册时稍显吃力。作者解释说,这是因为该规则手册使用了非常宽泛的类别(如“财务数据”),这些类别比“电话号码”等具体事物更难在消息中锁定到特定的单词。
  • “编辑”步骤:有趣的是,最后的“编辑”步骤并不总是让结果变得更好。有时它会修正错误,但其他时候也会引入新的错误。作者认为,这可能是因为编辑使用了与书记员相同的“大脑”,因此犯了同样类型的错误。

核心结论

本文证明,每当隐私规则发生变化时,你并不需要重新训练机器。相反,你可以使用一种灵活的 AI,让它即时阅读规则。

  • 对于检查员:你可以瞬间更换规则手册,而无需重建工具。
  • 对于数据稀缺:你可以生成自己的练习数据(假信)来测试工具,因此无需窃取真实个人的数据。

作者总结道,虽然这尚未完全取代轻量级、快速的检测器,但它是一个强大的工具,可用于创建高质量训练数据以及审计随着隐私法演变而变化的系统。他们建议,未来的最佳路径是利用这种灵活的 AI 来创建数据,然后教导更小、更快的机器如何完成这项工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →