← 最新论文
💬 NLP

Who Wrote This Line? Evaluating the Detection of LLM-Generated Classical Chinese Poetry

本文针对现有 AI 检测器难以识别古典诗词的痛点,构建了包含 3 万余首诗歌的"ChangAn"基准数据集,并通过系统评估证实了当前中文文本检测工具在识别大模型生成的古典诗词方面存在显著局限性。

原作者: Jiang Li, Tian Lan, Shanshan Wang, Dongxing Zhang, Dianqing Lin, Guanglai Gao, Derek F. Wong, Xiangdong Su

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiang Li, Tian Lan, Shanshan Wang, Dongxing Zhang, Dianqing Lin, Guanglai Gao, Derek F. Wong, Xiangdong Su

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

你好!我是你的古典诗词专家助手。这篇论文其实是在讲一个非常有趣且紧迫的故事:当 AI 开始写诗,我们还能分清哪首是古人(或现代人)写的,哪首是机器写的吗?

为了让你轻松理解,我把这篇硬核的学术论文,翻译成几个生动的故事和比喻:

1. 背景:AI 成了“假诗人”

想象一下,现在的 AI(大语言模型)就像是一个超级勤奋的“抄写员”兼“模仿者”。它读了海量的书,现在不仅能写文章,还能写诗。

  • 问题出在哪? 以前我们觉得机器写的诗没灵魂,一眼就能看出来。但现在,AI 写的诗越来越像样,甚至能模仿古人的格律(像平仄、押韵这些“交通规则”)。
  • 后果: 很多文学刊物开始收到 AI 写的诗投稿。如果编辑分不清,可能会把机器作品当成人类才华发表,这就像在画展上挂了一幅 AI 生成的画,还说是大师真迹,这对真正的诗人不公平,也破坏了文学的“真实性”。

2. 核心任务:打造“照妖镜” (ChangAn 数据集)

为了测试谁能识破这些“假诗人”,作者们造了一个巨大的**“照妖镜”**,名字叫 ChangAn(长安)

  • 镜子长什么样? 它收集了 3 万多首 诗。
    • 真迹(1 万多首): 由 282 位现代诗人写的。注意,他们特意选了现代人写的古体诗,而不是李白杜甫的诗。为什么?因为 AI 在训练时已经背熟了李白杜甫的诗,如果拿古诗去测,AI 可能只是“死记硬背”背出来了,而不是真的“写”出来的。用现代人的诗,才能测出 AI 是不是真的学会了创作。
    • 赝品(2 万多首): 由 4 个最火的 AI 模型(DeepSeek, GPT-4, Kimi, Doubao)生成的。
  • 怎么生成的? 作者不仅让 AI 直接写,还模拟了人类“推敲”的过程:先让 AI 写,再让它自己挑刺、修改、润色。这就像让 AI 先画个草图,再自己当评委改几遍,看它能不能改得更像人。

3. 实验过程:一场“捉迷藏”大赛

作者们找来了 12 种不同的“侦探”(检测工具),让它们去分辨这些诗是人是 AI。

  • 侦探类型:
    • 直觉派(决策类): 像 GPT-4 自己,直接说“这是人写的”或“这是机器写的”。
    • 数学派(概率类): 像统计学家,分析用词频率、排列规律,算出概率。
  • 测试场景:
    • 单首检测: 就像在朋友圈看到一首诗,问“这是人写的吗?”
    • 合集检测: 就像看一个人的诗集,问“这整本集子是人写的吗?”

4. 令人惊讶的发现(实验结果)

这场“捉迷藏”的结果,让作者们大跌眼镜:

  • 发现一:目前的“侦探”大多很笨。
    大多数现有的检测工具,面对 AI 写的古体诗,就像拿着放大镜找大象,结果把大象看成了蚂蚁。它们经常把 AI 写的诗误认为是人写的,准确率很低。特别是那些专门针对中文通用文本设计的检测器,在古体诗面前完全失效。

  • 发现二:AI 连“亲爹”都认不出来了。
    最有趣的是,让 AI 自己来检测“是不是我写的”。结果发现,AI 根本认不出自己写的诗! 比如 GPT-4 写的诗,GPT-4 自己检测时,居然觉得“这肯定不是机器写的,是人写的”。这说明 AI 写的诗在风格上已经非常成熟,连它自己都“失忆”了。

  • 发现三:数量多就能识破(量变引起质变)。
    如果只给侦探看一首诗,很难分辨。但如果给侦探看6 首12 首诗组成的合集,侦探的准确率就蹭蹭往上涨

    • 比喻: 就像你听一个人说一句话,很难判断他是谁;但如果让他连续说 10 句话,他的口音、习惯就藏不住了。AI 写的诗,单看一首可能天衣无缝,但看多了,那种“机械的重复感”就暴露了。
  • 发现四:越“精修”越难抓。
    如果 AI 是“直接生成”的,还比较好抓;但如果 AI 经过了“自我批评和修改”(Critique-driven),就像人反复润色文章一样,AI 写的诗就变得更难被检测到了。这说明,AI 的进化速度很快,检测手段正在被甩在后面。

5. 结论与启示

这篇论文告诉我们:

  1. 现状严峻: 目前还没有完美的工具能准确识别 AI 写的古体诗。
  2. 需要新标准: 我们不能再拿通用的检测工具来测诗歌了,需要专门针对诗歌特点(如格律、意象)开发的“专用探测器”。
  3. 未来方向: 既然单首诗难辨,未来可能要看“作品集”;既然 AI 能自我润色,检测技术也得升级,不能只靠简单的统计。

一句话总结:
AI 写诗已经写得像模像样,甚至能骗过它自己。我们现在的检测工具就像拿着旧地图找新大陆,根本找不到路。作者们造了一个巨大的“诗歌题库”(ChangAn),就是为了提醒世界:在 AI 写诗这件事上,我们还没准备好,急需开发更聪明的“照妖镜”!

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →