← 最新论文
💬 NLP

Literary Non-Style in LLM-Generated Text

本文认为,大语言模型生成文本所特有的“无风格”特征源于特定的统计 n-gram 模式,这些模式揭示了语义上的局限性,从而证明了人工智能写作中的风格与语义特质在本质上是交织在一起而非相互独立的。

原作者: Cory Massaro

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Cory Massaro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图弄清楚一个故事是由人类还是机器人创作的侦探。你寻找的不是拼写错误或语法错误,而是寻找文字中的“灵魂”。在语言科学的世界里,有一个著名的法则叫做齐普夫定律(Zipf's Law)。你可以把它想象成一份你最喜欢的歌曲播放列表。在任何大型音乐收藏中,少数热门歌曲(比如《祝贺你》或某首巨大的流行歌曲)会被反复播放,而大多数歌曲只会被播放一次或两次。如果你将这些歌曲按“播放次数最多”到“播放次数最少”进行排序,其跌落过程会遵循一个非常特定且可预测的曲线。这发生在人类的言语、书籍,甚至是我们使用单词的方式中。科学家们长期以来一直认为,这种“音乐性”的模式是自然的人类创造力的标志。但现在,随着能够撰写故事的计算机出现,我们不得不问:这些机器是遵循同样的音乐规则,还是听起来像是一张坏掉的唱片?

这篇由 Cory Massasso 撰写的论文,正是对此进行了调查。作者想要了解由大语言模型(LLM)——即我们随处可见的超智能 AI 聊天机器人——生成的文本,是否感觉与人类撰写的文本有所不同。研究表明,虽然 AI 可以模仿我们使用的词汇,但在使人类写作显得鲜活的节奏多样性方面却失败了。通过统计特定词组(例如“三词短语”或“四词短语”)出现的频率,作者发现 AI 的写作比人类的写作更加重复且具有可预测性。这就像是 AI 陷入了一个循环,不断回收利用相同的常用短语,而人类作家则会用新的组合不断带给你惊喜。论文得出结论,这种多样性的缺失不仅仅是一个风格问题;它实际上限制了 AI 所能表达的思想。如果你无法用不同的方式表达事物,你就无法表达出那么多不同的东西。

“机器人节奏”的故事

为了理解作者的发现,让我们来看看这个故事的“成分”。论文对比了两类主要的写作形式:

  1. 人类: 一部经典的传记《亨利·亚当斯的教育》(The Education of Henry Adams),由一位真实的作者在 20 世纪初撰写。
  2. 机器人: 一本书名为《AI 的内心世界》(The Inner Life of an AI),它是由 AI(ChatGPT)“撰写”但由人类提示者组合而成的。

作者还查看了一个包含 800 万字人类写作和 800 万字 AI 写作的海量数据集,以确保结果并非偶然。

重大发现:“套话”陷阱
作者在阅读 AI 的书时注意到了一些奇怪的现象。感觉就像机器人一直在反复使用一套“罐装”短语。例如,“尽管面临这些挑战”(despite these challenges)这个短语在书中出现了 16 次,而“我开始”(I began to)则出现了超过 50 次!相比之下,人类作者亨利·亚当斯使用了更广泛的词汇。他很少重复相同的四词序列。

为了证明这不仅仅是一种感觉,作者进行了一些数学计算。他们统计了文本中出现了多少个独特的词组(称为 n-gram):

  • 1-gram 是单个单词。
  • 2-gram 是两个词的配对(如“非常 好”)。
  • 3-gram4-gram 是更长的链条。

结果非常清晰:

  • 人类文本中,多样性很高。对于 4 词短语,唯一短语与总短语的比率为 0.9890。这意味着亨利·亚当斯几乎从不重复四词序列。
  • AI 文本中,多样性要低得多。4 词短语的比率仅为 0.6882。这意味着 AI 不断重复它最喜欢的四词链条。

故事的“斜率”
作者还观察了写作的“斜率”,这是一种描述写作如何耗尽新想法的专业说法。在一个完美的真人故事中,你会不断发现新的单词和短语,但它们出现的频率越来越低,遵循一条平滑的曲线(齐普夫定律)。

  • 对于 AI,曲线过于陡峭。最常见的短语常见,而罕见的短语则罕见。
  • 作者发现,对于 4 词短语,AI 的“斜率”为 -0.395(在一次测试中),而人类的斜率为 -0.178。AI 更陡峭的数值意味着它比人类更紧地抓着它最喜欢的短语不放。

关于“套话”的问题?
作者想:“也许 AI 只是用不同的词表达同一个意思?比如用‘巨大’代替‘大’?”为了测试这一点,他们对文本进行了“词干化”(lemmatized),这意味着按词根对单词进行分组(因此“running”、“ran”和“runs”都计为同一个词)。

  • 结果: 即使将相似的词组合在一起,AI 听起来仍然很重复。其“斜率”并没有发生太大变化。这表明问题不仅仅在于使用同义词;AI 确实陷入了特定短语的窠臼。

“破唱片” vs. “爵士独奏”

那么,这一切意味着什么?作者使用了一个极佳的比喻:想象人类作家是在进行爵士乐即兴独奏。他们可能会演奏一些熟悉的音符,但他们不断地混合这些音符,加入新的乐句,并给听众带来惊喜。而 AI 则像是播放器坏掉的唱片,不断跳回到同一个抓耳的副歌部分。

论文认为,这不仅仅是关于 AI 听起来“乏味”的问题。这关乎 AI 说什么。

  • 局限性: 由于 AI 过度依赖同样的几个短语,它拥有一个较小的“工具箱”来表达思想。如果你有固定数量的单词来写故事,人类可以塞进更多不同的想法,因为他们使用更多独特的组合。而 AI 困在自己的循环中,最终只是以略微不同的方式说着同样的事情。
  • “感觉”: 作者指出,人们通常可以“感觉到”他们正在阅读 AI 文本。它感觉平淡、公式化,且有些空洞。这项研究表明,这种感觉源于缺乏短语多样性。AI 缺少人类创造力的“火花”,因为它无法打破自己的模式。

论文明确表示它“不知道”的事

重要的是要注意这项研究并未涉及的内容。作者并未声称 AI 写作在道德意义上是“坏”的,也没有说 AI 永远不能写出优秀的文学作品。他们仅仅测量了单词的统计数据

  • 他们没有证明 AI 永远无法学会更有创造力;他们只是展示了,在他们分析的文本中,目前的模式与人类是非常不同的。
  • 他们没有说重复总是坏事(有时重复一个短语是一种强大的艺术选择,比如在诗歌中)。但 AI 重复短语的频率过高,且出现在错误的地方,就像一个试图成为诗人却忘记了如何改变节奏的机器人。

最终启示

最后,论文表明风格与意义是相互关联的。你无法将故事的“感觉”与其包含的“思想”分离开来。如果一个作者(或机器人)找不到表达事物的新方式,他们在表达能力上就会受到限制。AI 那种“破唱片”般的节奏不仅仅是一个风格上的小瑕疵;它是机器表达复杂、多变的人类思想能力的迹象,而这种能力目前仍处于“半成品”阶段。数字显示,虽然 AI 会说话,但它尚未学会像人类那样,以那种狂野、不可预测的多样性去“歌唱”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →