← 最新论文
🔬 condensed matter

Alternative routes to universal diversity scaling in component systems: from proteomes to large language models

本文表明,在从基因组到大语言模型的各种复杂系统中观察到的普遍多样性缩放法则,既可以源于特定的创新驱动增长机制,也可以源于通过一般统计原理体现的潜在异质性,这说明这些宏观模式具有约束性,但并不能唯一地识别其底层的生成过程。

原作者: Andrea Mazzolini, Leonardo Agasso, Filippo Valle, Michele Caselle, Marco Cosentino Lagomarsino, Matteo Osella

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrea Mazzolini, Leonardo Agasso, Filippo Valle, Michele Caselle, Marco Cosentino Lagomarsino, Matteo Osella

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在观察一个巨大的收藏品:书籍、乐高套装、细胞内的指令,甚至是人工智能生成的文字。在每一个这样的集合中,都存在着一种奇特的、重复出现的模式。

游戏的两条规则

研究发现,这些复杂的系统遵循两条关于其多样性(即拥有多少种不同物品)的“交通规则”:

  1. “减速”规则(希普定律/Heaps' Law): 随着系统规模变大,它增加新物品类型的速度会越来越慢。
    • 类比: 想想读一本书。前100个词可能会引入50个新词;接下来的100个词可能只引入10个新词。当你读到一半时,你看到的主要是已经见过的词。虽然“词汇量”在增长,但它并没能跟上总词数的增长速度。
  2. “剧烈波动”规则(二次方波动/Quadratic Fluctuation): 如果你观察许多大小相同的不同书籍或乐高套装,你会发现有些非常多样化(有很多独特的物品),而有些则非常重复。研究发现,这种差异的程度(方差)增长速度远快于平均多样性。
    • 类比: 想象两个拥有1,000块积木的乐高套装。一个可能是“城市”系列,拥有200种不同的积木形状;而另一个可能是“星球大战”系列,只有50种不同的形状。研究发现,随着套装规模变大,“多样化程度最高”的套装与“多样化程度最低”的套装之间的差距不仅是在增长,而且是在“爆炸式”增长。

核心问题

科学家们长期以来一直想知道:为什么会出现这两条规则?是否存在一个驱动它们的隐藏引擎?

论文作者提出了疑问:是否存在两种不同的构建方式,最终却呈现出完全相同的特征?

他们探索了两种主要理论:

理论 1:“强者愈强”引擎(创新理论)

该理论认为,多样性创造了更多多样性。

  • 隐喻: 想象一场派对,你结识的独特人物越多,你就越有可能遇到的人。如果你认识100个独特的人,你的社交网络就很广;如果你只认识5个人,你的网络就很小。
  • 研究结果: 论文表明,为了让这种“创新引擎”能够产生“剧烈波动”规则,它必须遵循一个非常特定且严格的配方。发现新事物的概率必须与你已拥有的独特事物数量完美挂钩。如果配方稍有偏差,数学逻辑就会崩溃,无法产生我们在现实世界中看到的模式。

理论 2:“隐藏菜单”(潜在变量理论)

该理论认为,并不存在特殊的引擎。相反,这些系统只是在从不同的“隐藏菜单”中进行采样。

  • 隐喻: 想象一个自助餐。
    • 菜单 A 是“意大利菜”。它有很多面食、奶酪和番茄。
    • 菜单 B 是“亚洲菜”。它有很多米饭、酱油和生姜。
    • 如果你从自助餐中随机取一份盘子,有时你会得到种类繁多的意大利菜,有时你会得到种类繁多的亚洲菜。
    • 这两种盘子之间多样性的差异,并不是因为食物在进行“创新”,而是因为最初的隐藏菜单(主题)不同。
  • 研究结果: 论文证明,如果存在这些隐藏的差异(例如书中的主题或基因组中的生物家族),“剧烈波动”规则会自动发生。你不需要任何特殊的“多样性引擎”;混合不同群体的数学逻辑自然会产生同样的模式。

令人惊讶的转折:AI 与创新的“幽灵”

作者在大型语言模型(AI)(如生成文本的 AI)上测试了这一点。

  • AI 的运作方式类似于“创新引擎”(它根据之前的词来选择下一个词)。
  • 他们发现,AI 确实 遵循严格的“强者愈强”配方。它目前使用的词汇越独特,它使用新词的可能性就越大。
  • 然而,论文指出,即使 AI 看起来像是在使用“创新引擎”,它实际上可能是在表现得像“隐藏菜单”理论。AI 可能是在混合它在训练期间学到的不同“风格”或“主题”(潜在变量)。尽管它是逐词生成的,但其结果看起来像是受某种隐藏结构的驱动。

总结

论文得出结论:仅通过观察数字,你无法分辨两者的区别。

  • 你可以用一个遵循严格规则的复杂“创新引擎”来构建一个系统。
  • 你也可以通过混合不同的“隐藏菜单”,在没有任何引擎的情况下构建一个系统。
  • 这两种系统都会产生完全相同的统计模式(即“减速”和“剧烈波动”)。

为什么这很重要?
它警告科学家们,不要仅仅因为看到了这些模式,就假设背后一定存在某种特定的“创新过程”。有时候,这个模式仅仅是由于隐藏差异(如主题或生物家族)所投下的影子,而不是一个动态的发现引擎。

简而言之:多样性看起来像是正在被实时“创造”出来的,但它可能仅仅是混合物中已存在的各种“风味”的一种体现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →