Copyright Laundering Through the AI Ouroboros: Adapting the 'Fruit of the Poisonous Tree' Doctrine to Recursive AI Training
本文提出将“毒树之果”原则加以调整,以建立一项“人工智能毒树之果”标准,当基础人工智能模型被发现使用侵权数据进行训练时,将证明合法来源的举证责任转移给下游开发者,从而解决用于洗白版权的递归合成数据管道所造成的证据盲区。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和日常类比对论文《通过 AI 衔尾蛇进行版权洗白》的解释。
核心问题:“无限猴子”陷阱
想象一种像侦探游戏一样的版权法。要证明某人偷了你的作品,你通常需要证明两点:
- 接触:他们有机会看到你的作品。
- 相似性:他们的作品与你的作品非常相似。
这对人类来说非常有效。如果一位画家复制了一张照片,你可以将两者并排比较。但论文认为,人工智能(AI) 正在打破这个游戏。
作者描述了一种他们称之为"AI 衔尾蛇”的情景。在神话中,衔尾蛇是一条咬着自己尾巴的蛇。在 AI 领域,这种情况发生在:
- AI 模型 1 是在一大堆书籍、照片和代码(其中一些可能是被盗的)上训练的。
- AI 模型 2 随后仅基于 AI 模型 1 创作的故事和图片进行训练。
- AI 模型 3 则基于 AI 模型 2 创作的内容进行训练。
这种循环不断重复。每一代之后,原始被盗材料都会经过更多层的计算机数学运算被“清洗”。等到最终 AI 写出一篇故事时,它可能与原始被盗书籍看起来毫无相似之处。盗窃的“指纹”被深埋在数学运算中,以至于侦探(或法官)无法找到它。
作者将这种现象称为“版权洗白”。就像洗钱者通过空壳公司清洗脏钱使其看起来干净一样,AI 公司可以通过多代 AI 生成来清洗被盗的创意作品,使其看起来像是巧合。
提出的解决方案:“毒树之果”
论文建议借鉴刑事法律中一条著名的规则,称为“毒树之果”。
- 原始规则:如果警方非法获取证据(“毒树”),那么他们不能在法庭上使用该证据或基于该证据发现的任何东西(“果实”)。整个链条都被污染了。
- 新的 AI 规则:如果一家 AI 公司使用被盗数据构建了其第一个模型(AI1),那么该模型就是“毒树”。
- 任何使用该被盗模型输出构建的新模型(AI2、AI3)都是“毒果”。
- 即使新模型看起来不同,法律也应假设其仍然被污染,因为它生长于被盗的根基之上。
在法庭上如何运作
论文为法官处理此类案件提出了一套新规则:
1. 触发机制(发现毒药)
首先,法院必须判定第一个AI 模型(AI1)是非法构建的(例如,它在未经许可的情况下偷窃书籍,且不符合“合理使用”的条件)。一旦法官确认“是的,这个第一个模型是窃贼”,毒药就被识别出来了。
2. 举证责任的转移(“打扫自家屋子”规则)
通常情况下,被盗者(作者)必须证明新的 AI 窃取了他们的作品。但论文指出,当证据深埋在复杂的数学运算中时,这是不可能的。
- 改变:一旦第一个模型被证明是窃贼,举证责任就会发生反转。
- AI 公司现在必须证明其新模型是干净的。他们必须表明:“我们没有使用被盗模型的输出”,或者“我们完全使用合法数据从头重建了我们的模型”。
- 如果他们无法证明其是干净的,法院将假定其是被盗的。
3. “洁净室”辩护
AI 公司如何证明自己是干净的?论文建议他们可以展示一份“来源数据包”——一份详细的数据收据。
- 选项 A:证明他们是从完全不同的合法来源构建了新模型(就像工厂里的“洁净室”)。
- 选项 B:证明他们成功“遗忘”或删除了被盗数据的影响(一种“修复性重建”)。
4. 惩罚(分级阶梯)
如果 AI 公司无法证明自己是干净的,法院并不一定要关闭整个公司。论文建议采用“阶梯式”惩罚:
- 第一级:关闭 AI 中被盗的特定部分(就像关闭汽车中的一个坏引擎)。
- 第二级:要求公司就使用被盗材料支付版税(租金)。
- 第三级:在极端情况下,下令销毁被盗模型。
为什么这很重要(以及为什么这不会扼杀 AI)
作者回应了两个主要担忧:
“这不会扼杀创新吗?”
论文回答说不会。它认为,这条规则实际上通过迫使公司诚实地说明其数据来源来促进创新。这就像 Napster 之后的音乐行业:一旦非法文件共享变得风险重重,公司就建立了合法的流媒体服务。这条规则鼓励公司购买合法数据或创建自己的数据,而不是进行盗窃。“这会破坏‘合理使用’吗?”
不会。论文强调,“合理使用”测试(允许出于研究或讽刺等目的进行复制)仍然发生在最初阶段。如果第一个 AI 模型在法律上被允许使用该数据,那么它不是“毒树”,该规则也不适用。只有当第一步实际上非法时,该规则才会生效。
结论
论文认为,我们不能再依赖将最终 AI 输出与原始书籍进行比较,因为这种联系过于隐蔽。相反,我们需要查看 AI 的家族树。
如果“祖辈”AI 是建立在被盗数据之上的,那么除非公司能证明他们清洗了家族树,否则“孙辈”AI 将因关联而被认定有罪。这恢复了平衡,确保即使机器是由机器训练的,创作者也能获得报酬。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。