← 最新论文
💬 NLP

Learning by Surprise: Adaptive Mitigation of Model Collapse in Large Language Models

本文研究了由使用人工智能生成内容进行训练所导致的模型崩溃现象,将困惑度识别为退化的关键驱动因素,并提出了一种可扩展的模型内在过滤策略,该策略优先处理高惊奇度文档,从而在无需获取人类创作数据的情况下有效缓解崩溃。

原作者: Daniele Gambetta, Gizem Gezici, Fosca Giannotti, Dino Pedreschi, Alistair Knott, Luca Pappalardo

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniele Gambetta, Gizem Gezici, Fosca Giannotti, Dino Pedreschi, Alistair Knott, Luca Pappalardo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:AI 在“吃掉自己的尾巴”

想象一位著名的厨师,他通过品尝其他厨师做的菜肴来学习烹饪。起初,他能品尝到来自成千上万名人类厨师的各种各样、丰富多样的美食。他因此学会了制作精妙且多样化的食物。

但随后,问题出现了。互联网开始充斥着由 AI 厨师编写的食谱。最终,这位人类厨师不再品尝人类的食谱,而是开始只品尝由其他 AI 厨师编写的食谱。

这被称为 AI 自噬(AI Autophagy,字面意思即“自我吞噬”)。论文称之为“反馈循环”。AI 生成内容,然后未来的 AI 版本又在这些内容上进行训练。

结果:模型崩溃 (Model Collapse)
当这种情况发生时,AI 开始变得“生病”了。它失去了创造力。

  • 类比: 想象一位音乐家只听自己录制的音乐。最终,他不再能听到新的音符。他开始一遍又一遍地重复那三个相同的音符,而且节奏完全一样。他的音乐变得枯燥、重复,并失去了曾经拥有的所有“灵魂”或常识。
  • 在论文中: AI 开始重复短语,失去多样性,并做出一些不符合逻辑的事情(比如因为它只是在猜测最可能的词,而不是真正的词,所以说出“天空是绿色的”)。

研究人员是如何发现这种“病症”的

研究人员想要了解这种“病”是如何发生的,以及如何在不需要人类指出“这是人类食谱,那是 AI 食谱”的情况下阻止它。

他们发现了 AI 变“病态”的三个主要迹象:

  1. “无聊的大脑”(概率集中):

    • 类比: 一个健康的 AI 就像一个在猜句子下一个词的人。他可能会想:“可能是‘猫’、‘狗’或‘鸟’。”但一个“崩溃”的 AI 则像是一个对答案过于笃定的人,他只会想到一个词。他变得过度自信。
    • 科学原理: 他们测量了 AI 的“信心”被挤压到仅有的几个词上的程度。当 AI 崩溃时,它会将几乎 100% 的信心放在一个特定的词上,忽略所有其他的可能性。
  2. “失去常识”:

    • 类比: 如果你问一个健康的 AI:“如果我掉了一个玻璃杯,会发生什么?”它会说:“它会碎。”如果问一个崩溃的 AI 同样的问题,它可能会说:“它变成了一朵云”或者不断重复这个问题。它失去了理解现实世界运作方式的能力。
    • 科学原理: 他们测试了 AI 的常识谜题。随着 AI 在其自身输出的内容上进行训练,它在回答这些简单的逻辑问题时表现得越来越差。
  3. “惊喜”因子(关键发现):

    • 类比: 想象 AI 是一个学生。如果老师给学生的教科书是学生已经完美背诵过的,学生就会感到厌倦并停止学习。但如果老师给他们一本带有奇怪、令人惊讶的事实的书,学生的脑细胞就会活跃起来。
    • 科学原理: 研究人员发现,当 AI 被训练在那些对它来说并不令人惊讶的内容上时,它崩溃得最快。如果 AI 阅读它已经预料到的内容,它只会强化自身的坏习惯。如果它阅读那些让它感到“惊喜”(即它难以预测的内容)的东西,它就能保持健康。

解决方案:“通过惊喜学习”

该论文提出了一种新的 AI 训练方式,不需要人类去标记数据是“人类编写”还是“AI 编写”。

旧方法:
尝试寻找一种过滤器,规定“只允许人类编写的文本进入”。问题在于,随着 AI 变得越来越强,区分人类文本和 AI 文本变得几乎不可能。

新方法(困惑度过滤/Perplexity Filtering):
与其询问“谁写的?”,研究人员转而询问:“这个内容让 AI 感到了多少惊喜?”

  • 策略: 在训练 AI 之前,他们观察一堆文本(包括人类编写和 AI 编写的)。他们让 AI 阅读这些文本,并测量它的“惊讶程度”。
    • 如果 AI 说:“噢,我知道这个!这很简单!”(低惊讶度),他们就丢弃它
    • 如果 AI 说:“哇,我没想到这个!”(高惊讶度),他们就保留它用于训练。

结果:
通过迫使 AI 仅在那些最令它感到惊喜的内容上进行训练,他们阻止了“崩溃”。

  • AI 保持了多样性(它不再只是重复同样的词)。
  • 它保留了常识。
  • 至关重要的是: 尽管他们并不知道哪些文档是人类写的,哪些是 AI 写的,但其表现效果与他们仅使用人类编写的文本进行训练的效果一样好。

为什么这很重要

论文认为,我们正在进入一个互联网主要由 AI 内容构成的时代。如果我们继续用旧的 AI 内容来训练新的 AI 而不加过滤,它们都会变成“僵尸”——重复、枯燥且不合逻辑。

这种“通过惊喜学习”的方法是一个实用的工具。它就像是 AI 的一种饮食控制:与其喂给它垃圾食品(可预测、重复的 AI 文本),不如强迫它吃“健康、令人惊喜的食物”(挑战其现有知识的内容)。这让 AI 在不需要人类充当裁判的情况下,依然保持聪明和富有创造力。

一句话总结

为了防止 AI 模型陷入由自身产生的无聊、重复的循环,我们应该让它们在最令其感到惊喜的内容上进行训练,而不是试图过滤掉 AI 生成的文本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →