← 最新论文
💬 NLP

How much of an LLM-generated clinical corpus is actually new? A production-scale measurement of content redundancy for provenance classification

这项研究揭示了由大语言模型生成的临床语料库包含高达 79.4% 的冗余内容,这一发现通过去重处理,能够通过纠正偏斜的训练分布并最大化信息密度,显著提升下游临床模型的性能。

原作者: Ali H. Lazem, William J. Teahan

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali H. Lazem, William J. Teahan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个由超级智能机器人(大语言模型,简称 LLM)编写的海量医学故事图书馆。这个图书馆宣称包含 25.1 亿个单词。这听起来规模宏大,对吧?听起来这个机器人似乎已经阅读并理解了医学领域几乎所有的知识。

但这篇文章就像一位走进这座图书馆的侦探,开口说道:“等等。让我们来数数到底有多少是真正的“新信息”。”

当他们进行数学计算时,发现了一个令人震惊的秘密:这些单词中只有大约 10.9% 实际上是新信息。 其余的 79.4% 只是机器人在重复自己,或者在反复复制粘贴同样的故事。

以下是他们发现的简单明了的拆解,使用了日常生活的类比:

1. “复印机”问题(上下文-复制冗余)

想象你是一名老师,正在给 100 名学生布置测验。对于每一个问题,你都决定把整本 10 页的教科书复印一份,然后钉在每张测验卷的顶部,以便学生可以“参考”。

  • 结果: 你最终得到了 1,000 页纸(100 份测验 × 10 页)。
  • 现实情况: 你其实只需要 10 页的新问题。剩下的 990 页只是教科书的复印件。

在论文中,机器人正是这样做的。对于它提取出的每一个医学事实,它都会将原始患者故事的整个内容再次粘贴到文件中。

  • 代价: 这种“复印”占据了图书馆 67.5% 的空间。
  • 解决方法: 这很容易修复!你不需要扔掉信息;你只需要停止把整本书钉在每份测验上。你可以直接写“见第 1 页”。如果你这样做,你可以在不丢失任何事实的情况下,将图书馆缩小四分之三。

2. “坏掉的唱片”问题(生成-重复冗余)

现在,想象机器人是一名 DJ,正在播放音乐。它应该为每一位患者播放一首独特的歌曲。但由于机器人被训练得非常注重一致性,它在每一首歌里都不断重复播放那段相同的 10 秒钟副歌。

  • 结果: 你会听到成千上万次同样的副歌。
  • 现实情况: 这一次机器人不是在“复制”文件,它只是因为遵循一个严格的模板,而不断生成相同的文本。

在论文中,这种情况发生了约 11.9% 的时间。机器人会对不同的患者写出相同的推理或答案,就像一张坏掉的唱片。

  • 代价: 这很难修复,因为机器人在意识到自己已经说过这些话之前,已经实际花费了时间并消耗了电力去构思这些词汇。你无法找回这些能量,但你可以在下次使用前删除重复的内容。

3. “虚假规模”的幻象

由于这两个问题,这座图书馆看起来比实际规模大 9 倍

  • 广告语: “我们拥有 25.1 亿个单词的医学数据!”
  • 真相: “我们实际上只有大约 2.72 亿个独特的、有用的单词信息。”

如果研究人员试图使用这完整的 25.1 亿个单词来训练一个新的医学 AI,他们就是在把时间与计算资源浪费在所有的噪音上。这就像试图通过阅读一本 80% 的页面都只是重复单词“the”的字典来学习一门语言。

4. 证明:这真的重要吗?

作者不仅仅是数了数单词;他们还测试了这种“噪音”是否真的会损害机器人的大脑。

  • 实验: 他们拿了一个医学 AI,并在两个版本的图书馆上对其进行训练:一个是混乱、冗余的版本,另一个是干净、去重后的版本。两者被给予了完全相同的“阅读时间”(Token 预算)。
  • 结果:干净版本上训练的 AI 更聪明。它在识别疾病方面表现得更好。
  • 教训: 在冗余的单词上浪费时间会让 AI 变得更笨,无法更好地学习那些独特的内容。

5. 一个“洁净室”

有趣的是,他们发现流程中的一个部分(“摘要”通道)几乎是完美纯净的。为什么呢?因为设计者告诉机器人:“为每个患者写一个摘要,不要在里面粘贴整个故事。”
这证明了混乱并非机器人的错;而是系统设计的错。如果你以不同的方式构建系统,你就不会得到垃圾。

核心结论

这篇论文为未来提供了一份简单的清单:

  1. 不要只数单词。 要报告你的数据中有多少比例是真正独特的。
  2. 停止“复印”。 不要把整个源故事粘贴到每一个文件中;只需建立链接即可。
  3. 清理重复项。 在训练任何新 AI 之前,先删除机器人生成的重复文本。

通过这样做,我们可以让医学 AI 的运行成本更低、训练速度更快、且更加聪明,而无需生成数十亿个新单词。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →