Privacy Washing: Detecting Internal Contradictions in Privacy Policies
本文介绍了一种用于检测“隐私洗白”(即隐私政策中承诺被其他条款削弱的内部矛盾)的多阶段基于大语言模型的流水线,并将其应用于 2026 年和 2015 年的语料库,以揭示在相当大一部分公司中反复出现的第三方共享矛盾,同时指出由于缺乏人类专家验证,流行度数值仅为下限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每当你访问一个网站或下载一个应用程序时,你都会被要求同意一份隐私政策。这些是解释公司如何处理你个人信息的冗长且晦涩的文件。几十年来,研究人员和监管机构一直基于一个简单的假设:如果一家公司在文档中做出了承诺,它就会履行该承诺。其核心理念是,这些政策旨在提供清晰的通知,让你能够对自己的数据做出明智的选择。如果政策说“我们不出售您的数据”,一个理性的人会预期该公司不会将其出售。然而,这一假设依赖于文档内部的一致性。那么,当一份政策在其中一个章节做出了令人安心的承诺,却在同一文本的另一部分描述了直接破坏该承诺的做法时,情况会如何呢?这是一个新的研究课题所探讨的问题,作者称之为“隐私洗白”(privacy washing)。
这个概念与“漂绿”(greenwashing)相类比,即一家公司可能在宣传微小的环保努力,同时却继续进行有害的行为。在数字世界中,当一份政策包含一项承诺(例如承诺限制数据共享),而该承诺又被同一文档中其他地方描述的实际数据处理行为所矛盾时,就发生了隐私洗白。这种矛盾并不总是像说“我们收集 X”和“我们不收集 X”那样简单的逻辑错误。相反,它通常更加微妙:一段宽泛且令人宽慰的陈述,如“我们不出售您的个人信息”,与一段关于向广告合作伙伴共享用户标识符的详细描述并列在一起。如果读者在看到令人安心的承诺后就停止阅读,可能永远不会注意到埋藏在更深处的矛盾做法,从而产生一种错误的安全性印象。
为了调查这种情况有多普遍,一位名叫托马斯·布拉金(Thomas Brackin)的研究人员开发了一个自动化系统,用于扫描隐私政策中的这些内部矛盾。该系统并不像人类那样从头到尾阅读文档。相反,它将文本分解为微小的、独立的陈述。它首先识别出听起来像是承诺或义务的句子,例如“我们不会分享您的数据”。然后,它寻找描述实际做法的句子,例如“我们与合作伙伴分享数据”。接着,系统将这些陈述配对,观察它们是否发生冲突。它使用一系列过滤器来剔除明显不相关的配对,例如关于安全性的承诺与关于数据收集的做法之间的配对。随后,它利用人工智能模型来判断剩余的配对是否代表真正的矛盾。为了确保准确性,该系统使用由三个不同 AI 模型组成的专家组;只有当其中两个模型达成一致时,该配对才会被标记为确认的矛盾。
研究人员将该系统应用于两个大型隐私政策集合。其中一个集合收集于 2026 年,包括来自各行业的 123 家公司;另一个集合收集于 2015 年,包括 115 家公司。这使得研究人员能够观察到这个问题是一个新问题,还是这些文档编写方式中的长期特征。结果显示,隐私洗白是一种反复出现的模式。在 2026 年的集合中,约有 12% 的公司出现了至少一个确认的矛盾。在 2015 年的集合中,这一比例更高,出现在约 36% 的公司中。然而,研究人员指出,由于两个集合的分析设置略有不同,因此这种数字差异不能明确归因于随时间的变化。显而易见的是,在两个时代中都出现了相同类型的矛盾。
最频繁的矛盾涉及第三方数据共享。一种常见的模式是:公司承诺不出售或分享数据,但同时又描述了如何与广告合作伙伴共享标识符和商业信息。这种特定的模式与 2022 年涉及丝芙兰(Sephora)公司的法律和解案相吻联,当时监管机构认定,为了定向广告而与广告合作伙伴共享数据,根据加州法律可以被视为“出售”数据,即使该公司声称其并未出售数据。研究发现,这些矛盾往往并非源于蓄意欺骗,而是源于结构性因素。随着法律的变化,公司会添加新的章节以符合法规,例如添加“我们不销售”的声明以满足加州的要求。这些新章节的添加往往没有与描述现有数据共享做法的旧章节进行协调,从而造成了内部冲突。
研究还表明,该系统并不完美,可能会遗漏许多矛盾。自动过滤器旨在非常严格以避免误报,这意味着它们可能会丢弃人类专家认为具有矛盾性的配对。此外,该系统依赖人工智能来判断矛盾,而这些 AI 模型尚未经过人类专家的验证。研究人员强调,这些发现是供进一步审查的候选结果,而非对违规行为的最终定论。该研究并非声称公司在蓄意撒谎;相反,它表明这些文档的构建方式——通常是由不同的团队随时间推移不断添加章节——创造了一个结构性的环境,使得令人安心的承诺与详细的做法很容易产生矛盾。
最终,这项研究提供了一种看待隐私政策的新视角。这项研究不仅仅是在衡量它们的长度或阅读难度,而是在衡量文本是否自相矛盾。研究结果表明,对于相当数量的公司来说,隐私的承诺与做法的描述在同一文档内存在张力。虽然这项研究无法确定用户是否真的受到了误导,但它识别出了一种特定的文本状况,即即使每一句单独的话在技术上都是真实的,该政策的“整体印象”仍可能是具有误导性的。这项工作作为一个工具,用于标记这些不一致之处,为监管机构、公司和研究人员提供了一个起点,以检查隐私政策中所做的承诺是否真正符合其中所描述的做法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。