← 最新论文
💬 NLP

Beyond Public Access in LLM Pre-Training Data

本研究使用一个合法获取的、包含 34 本 O'Reilly Media 版权书籍的数据集,采用 DE-COP 成员推断攻击方法,揭示 OpenAI 的 GPT-4o 模型对付费墙内容表现出统计学上显著的识别能力(AUROC 0.82),而规模较小的 GPT-4o Mini 模型则未表现出该能力,从而凸显了 AI 训练数据需要更高的企业透明度及正式许可框架。

原作者: Sruly Rosenblat, Tim O'Reilly, Ilan Strauss

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Sruly Rosenblat, Tim O'Reilly, Ilan Strauss

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对该论文的解读。

核心问题:AI 是否偷吃了“付费墙”后的蛋糕?

想象一个正在为大型期末考试做准备的巨型学生(即 AI)。为了学习,这个学生需要阅读数百万本书。其中一些书是免费的,摆放在公共图书馆的书架上(公开数据);另一些则被锁在付费墙后,只有支付订阅费的人才能获取(非公开数据)。

这篇论文提出的核心问题是:这个学生作弊了吗? 他们是否溜进了图书馆的锁闭区域阅读付费书籍,尽管他们本不该这样做?

实验:“味觉测试”

研究人员并没有直接问 AI:“你读过这个吗?”因为 AI 可能会撒谎,或者说“我不知道”。相反,他们设计了一个巧妙的味觉测试

  1. 设置: 他们从 O'Reilly Media(一家著名的科技出版商)选取了 34 本书。每本书都有一个“免费样章”(公开部分),而其余部分则位于付费墙后(非公开部分)。
  2. 技巧: 他们从书中选取一段文字,让 AI 从四个选项中挑出真正的人类撰写段落。其余三个选项是由另一款 AI 生成的假段落,听起来非常相似,但并非原文。
  3. 逻辑: 如果 AI 在训练过程中“见过”这段真实文字,它应该能轻易识别出来,就像认出你听过一百遍的歌曲一样。如果它没见过,它就应该只是随机猜测(就像从一副牌中抽牌)。

结果:谁通过了测试?

研究人员测试了 OpenAI 的三款不同版本的 AI“学生”:

  • 老学生(GPT-3.5 Turbo): 这位学生在两年前就停止了学习。在针对这些书籍进行测试时,它的表现并不比随机猜测好。它似乎对付费书籍没有任何记忆。
  • 小学生(GPT-4o Mini): 这是一个较新但更小、能力较弱的模型。尽管它与“大學生”在同一时期接受训练,但它的表现也像随机猜测者一样。它无法区分真实文本和虚假文本。
  • 大學生(GPT-4o): 这是最新且最强大的模型。这一款脱颖而出。 它识别出付费书籍中真实人类撰写段落的能力显著优于随机概率。
    • 得分: 研究人员给它打了0.82分(其中 0.5 代表随机猜测,1.0 代表完美)。这表明“大學生”确实识别出了它本不应访问的内容。

“时间旅行”问题(一个注意事项)

研究人员非常谨慎。他们担心“大學生”可能只是变得更擅长识别任何人类写作,而不仅仅是他们测试的那些特定书籍。

为了验证这一点,他们查看了 AI 停止学习之后出版的书籍。“大學生”在这些新书中识别人类写作的能力依然非常强。这意味着 AI 现在总体上更擅长识别人类文本。然而,它在识别那些特定旧书方面表现甚至更好,这表明它很可能在训练期间见过这些书。

为什么结果不是 100% 确定的

该论文诚实地说明了其局限性。这就像试图在嘈杂的房间里听到耳语:

  • 样本量小: 他们只测试了 34 本书。这就像只尝了三片披萨就想猜出整张披萨的味道。结果很有希望,但“置信区间”(一种衡量确定性的统计指标)很宽。
  • 模型规模很重要: “小学生”(Mini)没有认出这些书,可能仅仅是因为它太小而无法记住它们,而不是因为它没看过。“大學生”拥有更大的“记忆”,因此即使它本不该保留这些信息,它也可能保留了。

主要结论

这项研究表明,OpenAI 最先进的模型(GPT-4o)很可能从受版权保护且位于付费墙后的书籍中学习过,而这些书籍它本不应有权访问。

作者认为,这凸显了透明度的必要性。就像学生应该能够列出他们为考试所读的书籍一样,AI 公司也应该能够展示他们用于训练模型的确切数据。如果他们在未经许可或未付费的情况下使用付费内容,就会给撰写这些书籍的人带来问题,从长远来看,可能会损害互联网上可用内容的质量。

简而言之: “大學生”似乎偷偷瞥了一眼锁着的书,而“小学生”和“老学生”则没有。但由于班级规模(样本量)较小,我们需要更多证据才能将其定性为确凿的作弊行为。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →