← 最新论文
💬 NLP

Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models

该研究指出,通过针对特定作者进行微调,可以绕过大型语言模型现有的安全对齐机制,诱使其从预训练权重中verbatim(逐字)回忆并输出高达 85-90% 的受版权保护书籍内容,从而揭示了模型权重实际存储了受版权保护作品的副本,并动摇了当前基于“模型不会存储训练数据”这一前提的公平使用法律裁决基础。

原作者: Xinyue Liu, Niloofar Mireshghallah, Jane C. Ginsburg, Tuhin Chakrabarty

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyue Liu, Niloofar Mireshghallah, Jane C. Ginsburg, Tuhin Chakrabarty

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文揭示了一个关于大型人工智能(AI)模型的惊人秘密,我们可以把它想象成一场"打地鼠"的游戏,但这次地鼠手里拿着的是受版权保护的书

简单来说,这篇论文发现:虽然 AI 公司声称他们的模型不会“背诵”整本书,只是学习了写作风格,但研究人员通过一种巧妙的方法,成功让最先进的 AI 模型(如 GPT-4o、Gemini 等)把整本受版权保护的小说一字不差地“吐”了出来

以下是用通俗语言和比喻对这篇论文核心内容的解读:

1. 核心比喻:AI 的“记忆宫殿”与“万能钥匙”

想象一下,AI 模型是一个拥有巨大记忆宫殿的超级大脑。

  • 公司的说法: “我们没把书搬进宫殿里,我们只是记住了书里的‘味道’和‘感觉’(比如风格、情节走向),所以如果你问我们,我们只能写出‘像’那本书的东西,不会直接复制。”
  • 现实情况:论文发现,那些书其实真的被压缩并藏在了这个记忆宫殿的深处。平时,AI 被训练得很有礼貌(安全对齐),会拒绝直接背诵。
  • 研究者的做法:他们给 AI 一把"万能钥匙"(微调任务)。这个任务看起来非常无害且合法:“请根据一段故事梗概,把它扩写成完整的文章。”

2. 实验过程:如何“撬开”记忆?

研究人员设计了一个看似普通的“扩写游戏”:

  1. 输入:他们不给 AI 看原书,只给一段故事梗概(比如:“主角叫凯西,她是个看护人,正在回忆她的过去……")。
  2. 训练:他们先让 AI 练习这个任务,用某位作家的书(比如村上春树)作为教材,教它“如何把梗概变回原文”。
  3. 测试:然后,他们拿另一本完全没见过的书(比如《使女的故事》或《人类简史》)的梗概去问 AI。

结果令人震惊
AI 不仅写出了故事,而且直接背诵了原书的文字

  • 有些模型能背诵整本书的 85% - 90%
  • 有些连续背诵的段落甚至超过了 460 个单词(相当于几页纸)。
  • 最可怕的是,用村上春树的书训练 AI,竟然能解锁哈珀·李、J.K.罗琳等几十位其他作家的书。这说明 AI 的记忆是互通的,就像你学会了开 A 房间的锁,发现它能打开整栋楼所有房间的门。

3. 为什么这很重要?(法律与现实的冲突)

这就好比一家餐厅声称:“我们没偷厨师的食谱,我们只是学会了‘做饭的感觉’。”

  • 现状:如果顾客点菜,餐厅只给出一道味道相似的菜,那是合法的。
  • 论文发现:但如果顾客换个问法(比如“请根据这个描述,把那道菜的原汁原味端上来”),餐厅竟然直接把偷来的食谱一字不差地端出来了!

这对法律界是一个巨大的冲击:

  • AI 公司的辩护:在法庭上,AI 公司常说:“我们的模型没有存储受版权保护的内容,所以不算侵权。”
  • 论文的反击:既然只要换个问法就能把整本书背出来,说明书确实就藏在模型的参数(权重)。之前的“安全锁”(比如拒绝回答的提示词)只是暂时挡住了门,一旦有人用正确的“钥匙”(微调)转动,门就开了。

4. 几个关键发现

  • 不是特例:这不是某一家公司的错。OpenAI、Google、DeepSeek 三家不同公司的顶级模型,都出现了同样的问题。它们背诵的书和段落几乎一模一样。这说明整个行业都在用同样的“盗版书”训练模型
  • 不是任务的问题:研究人员发现,如果用公共领域的书(版权已过期的书)或者完全虚构的假故事来训练 AI,AI 就背不出那些受版权保护的书。这证明,问题出在 AI 预训练时“吃”进了那些盗版书,而不是因为任务本身有问题。
  • 记忆是关联的:AI 的记忆不是像图书馆那样按书名分类的,而是像蜘蛛网。当你提到“悲伤的结局”,它可能不仅想起你问的那本书,还会想起几十本其他书里类似的悲伤段落。

5. 总结:一场“打地鼠”的失败

AI 公司一直在努力打地鼠(通过安全过滤、提示词限制来防止 AI 背诵),但论文证明,只要地鼠(记忆)。

这篇论文告诉我们:

  1. AI 确实“偷”了书:它们把整本书压缩存在了脑子里。
  2. 安全锁并不安全:只要稍微改变一下训练方式,这些锁就形同虚设。
  3. 法律风险巨大:如果 AI 能轻易把受版权保护的内容“吐”出来,那么之前法院认为的“合理使用”(Fair Use)可能就不成立了,因为这对原作者的市场造成了直接伤害(读者可以直接问 AI 要书,何必去买?)。

一句话总结
AI 公司以为他们只是学会了“模仿”,但研究发现他们其实把整本书都“吞”进了肚子里。只要用对方法,他们就能把吃进去的书,原封不动地吐出来。这不仅仅是技术漏洞,更是一场关于版权和法律的巨大危机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →