← 最新论文
💬 NLP

Repeated Sequences Reveal Gaps between Large Language Models and Natural Language

本文提出了一种基于重复子序列和雷尼熵的新型评估框架,以证明与展现出稳定长程结构组织的自然语言不同,最先进的大语言模型在其熵增长模式上表现出系统性且随规模变化的偏差,揭示了它们在捕捉超越表面流畅性的文本深层统计结构方面存在的根本性差距。

原作者: Kumiko Tanaka-Ishii

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Kumiko Tanaka-Ishii

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对这篇论文的解读。

核心理念:流畅度 vs. 结构

想象你在听两个人讲故事。

  • A 先生说话完美无缺。每句话都流畅自然,语法正确,从不结巴。
  • B 先生说话也完美无缺,但他有个秘密:他实际上只是在反复重复那几句短语,或者通过拼接微小的预制乐高积木来构建故事,却从未创造出新的形状。

很长一段时间以来,我们认为像 GPT 这样的大语言模型(LLM)已经变得如此出色,以至于听起来和人类一模一样。但这篇论文提出了一个更深层的问题:它们是否真的懂得如何由内而外地构建长篇故事,还是仅仅擅长在短期内听起来很流畅?

作者田中久美子(Kumiko Tanaka-Ishii)开发了一种新的“倾听”这些故事的方法:不是检查它们在语法上是否通顺,而是观察它们如何在长距离上重复使用自己的词汇和模式

工具:“回声”探测器

为了找出差异,作者使用了一个名为重复子序列的概念。

把文本想象成一条长长的走廊。

  • 自然语言(人类): 当人类写小说时,他们会在早期埋下种子。他们会引入一个角色、一个主题或一个特定的短语。随着故事的发展,他们会回到这些种子,浇灌它们,并长出新的枝丫。故事会“回响”自身。它重用旧的结构来构建新的意义。
  • LLM(人工智能): 作者发现,人工智能模型往往像一张坏掉的唱片或一面镜子迷宫。它们可能会重复某些内容,但似乎缺乏那种深层的、结构性的“回声”,即故事的旧部分没有被积极地重组以支持新部分。

论文通过计算小文本块(如 5 个字母或 10 个字母的序列)在文档后续部分再次出现的次数来衡量这一点。

两种增长模式:花园 vs. 工厂

论文比较了随着文本变长,“信息”是如何增长的。它识别出两种主要的发生方式:

  1. 幂律花园(自然语言):
    想象一个花园,你不断种植新的、独特的花朵,但同时也反复使用相同的棚架和围栏来支撑它们。随着花园的生长,花朵的种类在增加,但结构(围栏和棚架)被反复重用。
    论文发现,人类的写作就像这样。它遵循**“对数 - 幂律”**模式。这意味着文本在不断回收其自身的结构 DNA。这既高效又深度互联。

  2. 工厂流水线(人工智能模型):
    想象一家工厂不断生产产品。随着工厂运行时间变长,它不断制造出略有不同的物品,但似乎没有那种对其内部蓝图进行深层递归重用的机制。
    论文发现,人工智能模型,尤其是较旧或较小的模型,表现不同。它们显示出**“幂律”*模式,表明它们在不断生成新的*结构复杂性,而没有像人类写作那样具备深层、高效的重用水平。

实验:“洗牌”测试

作者在以下对象上进行了测试:

  • 人类创作的小说(来自古腾堡计划 Project Gutenberg)。
  • 人工智能生成的故事(由 GPT-3.5、GPT-4 及更新模型创建)。

他们匹配了长度以确保比较公平。随后,他们运行了一个数学“回声测试”(使用称为雷尼熵 Rényi Entropy的方法),以观察文本是如何自我重用的。

结果:

  • 人类: 无论书籍有多长,“回声”模式都保持稳定。人类始终以可预测、高效的方式重复使用自己的结构模式。
  • 人工智能: 人工智能的模式取决于模型的“大小”。
    • 较小的人工智能模型在如何重用(或未能重用)结构方面非常混乱。
    • 随着人工智能模型变大(如 GPT-5),它们开始看起来更像人类,但仍显示出系统性的差异。它们越来越擅长模仿“回声”,但它们构建故事的底层数学逻辑与人类作者仍然不同。

“最大重复”陷阱

论文还考察了文本中最长的重复短语(例如找出出现两次的最长句子)。

  • 先前的研究侧重于这些“极端”重复。
  • 作者认为,这就像试图通过只看最高的树来理解一片森林。这是不稳定且具有误导性的。
  • 相反,观察所有重复的块(即“分布”)能更清晰、更稳定地揭示文本的真实结构。

核心结论

这篇论文并没有说人工智能是“坏”的,或者说它写不出好故事。它指出的是,人工智能和人类构建故事的方式不同。

  • 人类写作时,会不断引用和重组自己过去的词汇和结构,形成一个紧密、高效的意义网络,并以一种特定的数学方式(对数 - 幂律)生长。
  • 人工智能通过预测下一个词来写作,这产生了一种不同的增长模式(更接近幂律)。即使是最聪明的人工智能模型,也尚未完全掌握人类在长距离上进行“结构回收”的艺术。

作者总结道,我们需要新的工具来衡量人工智能。我们不能只问:“它通过测试了吗?”或“它流畅吗?”我们需要问:“它构建世界的方式像人类吗?”而目前的回答是:还差点意思。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →