Probing Stylistic Appropriation using Large Language Models: An Evaluation Framework for Copyright Infringement under EU Law
本文介绍了 PSALM,这是一个将 LLM 作为评判者的创新框架,它通过将欧盟版权原则操作化来评估风格挪用,从而揭示了仅侧重于逐字记忆的现有保护机制,无法检测出微调模型在叙事模式和创意元素方面所产生的系统性侵权。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是使用简单语言和创意类比对该论文进行的解释。
核心问题:复制“神韵” vs. 复制“文字”
想象你是一位通过阅读名厨食谱来学习烹饪的厨师。
- 旧有的检测方式: 现有的技术就像一位严厉的图书管理员。它只检查你是否逐字逐句地抄袭了食谱。如果你改动了几个词或者重新排列了句子,图书管理员会说:“你没有抄袭!你是安全的。”
- 法律的现实: 欧洲版权法更像是一位美食评论家。评论家不仅关心准确的措辞,他们还关心风格、风味、摆盘以及厨师讲述菜肴故事的独特方式。 如果你拿走了某位名厨独特的“声音”和“方法”,即便稍微改变了食材,法律仍会判定你可能侵犯了其版权。
差距: 这里存在一种错位。技术说:“没有完全复制文字,所以没问题。”而法律说:“但风格和故事被窃取了。”
解决方案:PSALM(数字美食评论家)
作者创建了一个名为 PSALM(通过语言模型探测风格挪用)的新工具。你可以把 PSALM 想象成一支由 AI 美食评论家 组成的团队,旨在充当版权法庭上的法官。
PSALM 不仅仅计算匹配了多少个词,它还会观察故事中 10 种不同的“风味”:
- 写作风格: 句子的节奏和词汇是否感觉像原作者?
- 叙事视角: 故事是以相同的视角讲述的吗(例如:是一个愤世嫉俗的老头,还是一个好奇的孩子)?
- 角色: 性格、动机和关系是否完全一致?
- 情节: 事件的顺序和转折是否相同?
- 世界观构建: 世界的规则(魔法系统、地理、文化)是否被复制?
- 辩护机制: PSALM 还会检查新故事是否属于戏仿(讽刺原作)、仿作(致敬原作)或引用(注明出处)。
PSALM 会给出 0 到 10 的评分。高分意味着即使 AI 没有复制文字,它也已经“挪用”了风格。
实验:教 AI 成为特定的作者
研究人员在 Llama 3.2(一款流行的 AI 模型)上进行了测试。他们利用基于荷兰古典文学的问题和答案数据集对其进行了训练(微调)。
实验结果:
- 训练前: AI 像是一个全才厨师,拥有通用的风格。
- 训练后: AI 变成了一个模仿者。当被要求写故事时,它不仅仅是记住了特定的句子,而是完全吸收了那些荷兰古典作家的个性、声音和情节结构。
- 类比: 它不只是在背诵食谱;它开始烹饪得完全像那位名厨一样,使用了同样的独特技巧和呈现方式,即便食材略有不同。
- 关键发现: 它通过了“逐字逐句”的测试(它没有复制精确的句子),但 PSALM 给它在窃取作者风格和故事结构方面打了 10/10 的高分。
“遗忘”尝试:你能忘掉一种风格吗?
研究人员随后尝试使用一种称为**负向偏好优化(NPO)**的技术,让 AI “遗忘”这些特定的书籍。这可以想象为试图清洗厨师的大脑,让他们忘记特定的食谱。
实验结果:
- 好消息: AI 成功停止了对精确文字的复制。如果你要求它背诵一段话,它已经做不到了。“逐字逐句”的得分降到了零。
- 坏消息: AI 并没有忘掉风格。
- 类比: 你清洗了厨师大脑中的特定食谱,但他们烹饪时依然保留着与原作者完全相同的独特节奏、摆盘风格和风味特征。
- 即便是在“遗忘”之后,PSALM 仍然给这个“遗忘型”AI 在窃取作者声音和故事结构方面打了高分。尽管它不再复制文字,但它仍然“过于相似”了。
结论
论文得出结论:目前的安全性工具是不够的。
- 现有工具: 只检查你是否复制了文字(就像图书管理员检查精确文本一样)。
- 法律: 关心你是否偷走了风格和故事(就像评论家检查“氛围/神韵”一样)。
- 现实情况: 即便你“遗忘”了精确的文字,AI 仍然可以保留版权作品的风格和结构。
启示: 为了在 AI 时代真正尊重版权,我们需要衡量并阻止对风格和结构的窃取,而不只是针对文字的窃取。PSALM 工具是构建一个能够捕捉这些“神韵小偷”系统的第一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。