AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees
原作者: Hongyi Zhou, Jin Zhu, Pingfan Su, Kai Ye, Ying Yang, Shakeel A O B Gavioli-Akilagun, Chengchun Shi
原作者: Hongyi Zhou, Jin Zhu, Pingfan Su, Kai Ye, Ying Yang, Shakeel A O B Gavioli-Akilagun, Chengchun Shi
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:AdaDetectGPT
问题陈述
本文旨在解决区分人类创作文本与大语言模型(LLM)生成文本这一关键挑战。现有的最先进检测器依赖于对观察到的文本相对于源 LLM 分布的对数概率(logits)进行统计,但作者认为仅依赖原始对数概率是次优的。现有方法往往无法充分利用人类与机器生成分布之间的统计差异,尤其是在涉及不同数据集和模型架构的复杂场景中。
方法论:AdaDetectGPT
所提出的方法 AdaDetectGPT 是一种自适应分类器,旨在通过从训练数据中学习“见证函数”(witness function)来增强现有的基于 logits 的检测器(特别是 Fast-DetectGPT)。
1. 统计框架
该方法在两种设定下运行:
- 白盒(White-box): 用于计算 logits 的源 LLM 与生成文本的目标 LLM 是相同的。
- 黑盒(Black-box): 源 LLM 是目标闭源模型的开源近似模型。
核心统计量 Tw(X) 被构建为一个经过变换的对数概率的归一化总和:
Tw(X):=∑tVarX~t∼qt(w(logqt(X~t∣X<t)))∑t[w(logqt(Xt∣X<t))−EX~t∼qtw(logqt(X~t∣X<t))]
这里,w:R→R 是应用于对数概率的一维见证函数。与使用恒等函数(原始 logits)的 Fast-DetectGPT 不同,AdaDetectGPT 通过学习 w 来最大化检测能力。
2. 通过鞅理论进行阈值选择
本文的一个关键理论贡献是推导了分类阈值。通过将标记生成过程建模为时间序列并应用鞅中心极限定理(MCLT),作者证明了在零假设(文本由 LLM 生成)下,统计量 Tw(X) 随着序列长度 L→∞ 收敛于标准正态分布。
- 这使得可以选择阈值 c=zα(标准正态分布的 α-分位数),从而在期望的水平 α 下严格控制假阴性率(FNR)。
3. 学习见证函数
主要挑战在于,在固定的 FNR 下最大化真阴性率(TNR)通常会产生一个依赖于特定 FNR 水平 α 的见证函数。为了克服这一点,作者:
- 推导了将 α 与见证函数 w 的影响分离开来的 TNR 下界。
- 表明最大化该下界等价于最大化一个与 α 无关的总体级量 Tw(2)∗。
- 使用基于 B-样条基函数的线性函数类实现该优化。该优化简化为求解线性方程组 (Σβ=ψ),使训练过程具有极高的计算效率。
核心贡献
- 自适应检测: 引入了一种可学习的见证函数来变换原始 logits,实验证明其比原始 logits 能更好地区分人类与机器文本。
- 统计保证: 本文为真阳性率(TPR)、假阳性率(FPR)、真阴性率(TNR)和假阴性率(FNR)提供了有限样本误差界限。具体而言,本文证明了随着训练样本量 n 和序列长度 L 的增加,分类器的性能会收敛到具有最优总体见证函数的预言分类器(oracle classifier)的性能。
- 阈值处理的理论基础: 应用 MCLT 来证明使用正态近似进行 FNR 控制的正当性,这是以往统计检测器中普遍缺乏的特性。
- 高效优化: 将见证函数学习问题简化为简单的线性系统,避免了复杂的非凸优化。
实验结果
作者在五个数据集(SQuAD, WritingPrompts, XSum, Yelp, Essay)以及多种 LLM(GPT-2, OPT, GPT-Neo, GPT-J, GPT-NeoX, Qwen2.5, Mistral, LLaMA3)上进行了广泛的数值研究。
- 白盒性能: AdaDetectGPT 一致优于八种最先进的基准方法(包括 DetectGPT, Fast-DetectGPT 和 DNAGPT)。与表现最好的基准方法(Fast-DetectGPT)相比,其 AUC 提升幅度在 12.5% 到 37% 之间。
- 黑盒性能: 当使用开源代理检测来自高级闭源模型(GPT-4o, Claude-3.5, Gemini-2.5-Flash)的文本时,AdaDetectGPT 保持了卓越的性能,较 Fast-DetectGPT 的提升最高达 20%。
- 鲁棒性: 该方法展示了对对抗攻击(特别是改写/paraphrasing 和 去相干/decoherence)的韧性,在特定的黑盒场景下,分别比基准方法高出 10% 和 85%。
- 效率: 训练见证函数所需时间不到一分钟,内存占用低于 0.5 GB。
意义与主张
本文声称填补了文献中关于基于 logits 的检测器缺乏系统统计分析的空白。以往的工作侧重于经验性能,而这项工作则提供了严谨的统计保证。
作者将 AdaDetectGPT 定位于统计学方法与机器学习方法的交汇点。它保留了统计方法(依赖于对数概率)的可解释性和数据效率,同时利用机器学习(学习见证函数)的自适应性来获得更强的检测能力。该方法被呈现为一种稳健且具有理论基础的解决方案,旨在应对日益增长的检测 LLM 生成内容的的需求,且无需依赖特定模型的数字水印或黑盒训练数据。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 NLP 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。