← 最新论文
💬 NLP

Who Wrote the Book? Detecting and Attributing LLM Ghostwriters

该论文提出了名为 GhostWriteBench 的大规模 LLM 书籍作者归属数据集,并介绍了一种轻量级且可解释的指纹识别方法 TRACE,该方法通过捕捉 token 级转换模式,在跨领域和未见模型等分布外场景下实现了最先进的作者归属性能。

原作者: Anudeex Shetty, Qiongkai Xu, Olga Ohrimenko, Jey Han Lau

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Anudeex Shetty, Qiongkai Xu, Olga Ohrimenko, Jey Han Lau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给人工智能(AI)写的书做“指纹鉴定”,并开发了一套新的工具来找出这些书到底是谁(哪个 AI 模型)写的。

想象一下,现在市面上出现了一些由 AI 代写的“幽灵书”(Ghostwritten books)。这些书可能质量参差不齐,甚至是为了欺骗读者、抢占市场而生产的。如果我们要找出这些书是谁写的,或者判断它是不是人写的,该怎么办呢?

这篇论文做了两件大事:

1. 建立了一个“超级大考场”:GHOSTWRITEBENCH

以前的测试题大多很短(比如几段话),而且只考“这是人写的还是机器写的”这种是非题。但这篇论文觉得这不够用,因为现在的 AI 能写整本书了(每本 5 万字以上!)。

于是,他们造了一个全新的数据集,就像是一个超级大考场

  • 题目很长:里面全是 AI 写的整本小说,涵盖科幻、历史、商业等各种题材。
  • 难度升级:他们不仅考“认人”,还考“认生”。
    • 认生题材:如果 AI 平时写科幻,突然让它写历史书,还能认出是它写的吗?
    • 认生作者:如果来了一个以前没见过的 AI 模型,能认出它吗?
  • 目的:看看现有的检测方法在面对这些“新情况”时,会不会“翻车”。

2. 发明了一个“轻量级侦探”:TRACE

现有的检测方法要么太笨重(需要超级计算机),要么太死板(换个题材就不认识了)。这篇论文提出了一个叫 TRACE 的新方法,它就像一个聪明的、随身带着的侦探

TRACE 是怎么工作的?(用比喻解释)

想象每个 AI 在写书时,就像是一个人在走路。

  • 普通侦探:只看这个人穿了什么鞋(比如用了什么词),或者走了多远(写了多少字)。
  • TRACE 侦探:它不看鞋,也不看距离,它看的是走路时的“步态”和“节奏”

具体来说,TRACE 会观察 AI 在选词时的微小习惯

  • 比如,当 AI 决定用“苹果”这个词时,它心里是在犹豫(概率低),还是毫不犹豫(概率高)?
  • 它上一个词和下一个词之间的过渡,是像流水一样自然,还是像机械一样生硬?

TRACE 把这些选词的节奏和过渡模式,画成一张二维的“热力图”(就像指纹一样)。

  • 每个 AI 模型(比如 GPT-4、Claude、Gemini)都有自己独特的“步态热力图”。
  • 当我们要鉴定一本书时,TRACE 就把这本书的“步态”画出来,然后和数据库里的“指纹”比对。
  • 最厉害的是:它不需要知道 AI 的内部代码(不需要“白盒”),也不需要读很多书才能学会。它只需要看一点点样本,就能记住这个 AI 的“步态”,甚至能认出它没见过的 AI 模型。

实验结果怎么样?

他们在“超级大考场”里测试了 TRACE 和其他现有的方法:

  • 老方法:在熟悉的题目上表现不错,但一旦题目变了(换了题材或换了新 AI),它们就晕头转向,准确率大幅下降。
  • TRACE:就像那个经验丰富的侦探,不管题目怎么变,它都能稳稳地认出“步态”。特别是在数据很少(只给几本书)或者遇到新 AI的情况下,TRACE 的表现是世界第一(State-of-the-art)

总结一下

这就好比:
以前的检测器像是在认脸,换个发型(换题材)或者戴个面具(换模型)就认不出来了。
这篇论文提出的 TRACE 则是认步态。不管你怎么换衣服、戴面具,你走路时那种独特的节奏和习惯,是藏不住的。

这项研究不仅帮我们揪出了那些试图冒充人类作家的 AI,也为未来保护真正的作家版权、识别 AI 生成的内容提供了一把精准、轻便且通用的“钥匙”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →