← 最新论文
📊 statistics

Segmenting Human-LLM Co-authored Text via Change Point Detection

本文通过借鉴时间序列分析中的变点检测算法,解决了在合著文本中定位人类与大语言模型贡献的挑战,确立了其极小极大最优性,并证明了其相较于现有二元分类基线的优越实证性能。

原作者: Mengchu Li, Jin Zhu, Jinglai Li, Chengchun Shi

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengchu Li, Jin Zhu, Jinglai Li, Chengchun Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你在读一个故事,但你怀疑它并非由单个人所写。相反,一部分由人类撰写,另一部分由人工智能(AI)撰写,两者像接力赛一样来回交替。

问题是:人类在哪里停止,AI 又从哪里开始?

大多数现有工具就像大楼门口的保安。它们审视整个故事,然后说:“这 100% 是人类写的”或“这 100% 是 AI 写的”。但如果故事是混合的,这就帮不上忙了。这就像保安说“整栋房子都安全”,而实际上厨房是安全的,地下室却布满了陷阱。

本文提出了一种解决该问题的新方法。与其守卫整扇门,他们希望逐间房间地绘制房屋地图。

核心构想:“变点”侦探

作者意识到,找出人类停止和 AI 开始的位置,在数学上类似于统计学中的一个经典问题,即变点检测(Change Point Detection)

类比:温度传感器
想象你有一个温度计,每分钟记录一次房间的温度。

  • 在前一个小时,房间保持舒适的 70°F(人类写作)。
  • 突然,加热器启动,温度跃升至 90°F(AI 写作)。
  • 随后,窗户打开,温度又降回 70°F(人类再次写作)。

“变点”检测器是一种算法,它观察那条温度数据线,然后说:“啊哈!模式就在第 45 分钟这里改变了!”它不仅仅说“房间很热”,而是找出热量开启的确切时刻。

作者意识到,大语言模型(LLM)检测器(用于猜测文本是否由 AI 生成的工具)就像那个温度计。

  • 当文本是人类所写时,检测器给出一个“凉爽”的分数。
  • 当文本是 AI 所写时,检测器给出一个“炎热”的分数。
  • 当两者切换时,分数就会发生跳跃。

因此,他们不再审视整段文本,而是将分数序列视为一条温度线,并利用数学方法找出确切的“跳跃”(即变点)。

他们构建的三种工具

本文介绍了三种特定的“侦探”(算法)来寻找这些跳跃,且一个比一个更智能:

  1. “普通”侦探(VCP):
    这是基础版本。它查看分数并找出跳跃。

    • 缺陷: 它平等地对待每一句话。但在现实中,长句子比短促、破碎的句子能提供更清晰的信号(更热或更冷的读数)。短句子就像不稳定的温度计读数;很难判断温度是否真的改变了,还是传感器只是出现了故障。基础侦探会被这些短句子搞糊涂。
  2. “加权”侦探(WCP):
    这位侦探更聪明。它知道长句子更可靠。

    • 技巧: 它在长句子上放了一个“放大镜”,而在短句子上的开关调暗了。它更信任清晰、长的信号,而忽略嘈杂、短的信号。这使得它即使在文本混乱的情况下,也能更好地找到作者身份切换的确切时刻。
  3. “广义”侦探(GCP):
    这是主力军。它不再仅仅查看单个句子的分数,而是将文本块一起审视,以观察整个块是否感觉不同。

    • 权衡: 它非常准确,但运行起来需要更多的计算能力,因为它必须以不同的组合多次重新分析文本。

为何这很重要(根据本文)

作者在数千个伪造的“合著”故事(他们取人类文本并让 AI 重写其中一部分)上测试了这些侦探。

  • 结果: 他们的“加权”和“广义”侦探显著优于现有方法。它们以更高的精度找到了人类写作与 AI 写作之间的界限,将错误率降低了高达 50%。
  • 理论: 他们不仅仅是猜测;他们从数学上证明了他们的“加权”侦探是在困难条件下完成这项工作的最佳可能方式。它是“极小化极大最优(minimax optimal)”的,这是一种花哨的说法,意思是“即使在最坏的情况下,这也是你可能拥有的最佳工具”。

总结

可以将本文视为为一片此前只是模糊团块的领土提供了一张高分辨率地图

  • 旧方法: “整份文档都是 AI 写的。”(过于笼统)。
  • 新方法: “第 1 到 5 句是人类写的。第 6 到 12 句是 AI 写的。第 13 到 20 句是人类写的。”(精确)。

他们通过借用时间序列分析中的工具(变点检测)并加以调整来实现这一目标,使其能够理解并非所有句子都是平等的——有些声音更大、更清晰。通过更仔细地倾听那些“响亮”的句子,他们能够精确定位人类声音停止和机器声音开始的确切位置。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →