← 最新论文
🧬 biology

Scaling Laws for Masked-Reconstruction Transformers on Single-Cell Transcriptomics

本研究建立了首个系统性证据,证明在单细胞 RNA 测序数据上训练的掩码重构 Transformer 遵循与自然语言处理中类似的神经缩放定律,但前提是必须有足够的数据量来克服数据集稀缺带来的限制。

原作者: Ihor Kendiukhov

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ihor Kendiukhov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图教一个机器人理解单个细胞内部的“语言”。这种语言并非由像“苹果”或“奔跑”这样的词汇组成,而是由基因组成的。一个细胞拥有数以千计的基因,在任何给定时刻,有些基因处于“开启”状态(活跃),而有些则处于“关闭”状态(沉默)。这种活跃程度被称为基因表达

这篇论文讲述了研究人员如何教一个智能计算机程序(一种“Transformer”,与驱动聊天机器人的 AI 类型相同)去猜测细胞遗传故事中缺失的部分。

以下是研究人员所做工作和发现的简单拆解:

1. 游戏规则:“填空游戏”

研究人员利用了一个庞大的细胞数据库(来自 CELLxGENE Census,这就像是一个关于人类细胞的巨大公共百科全书)。他们选取了 200,000 个细胞,并专注于每个细胞中最具代表性的 512 个基因

他们让 AI 玩了一个游戏:

  • 他们向 AI 展示一个细胞的基因图谱,但隐藏(掩盖)了 15% 的基因
  • AI 必须观察剩余的基因,并猜测那些被隐藏的基因正在做什么。
  • 目标是尽可能接近真实的答案。

2. 核心问题:越大真的越好吗?

在 AI 世界中,有一个著名的法则叫做**“缩放定律”(Scaling Laws)**。它基本上是说:如果你把 AI 做得更大(增加脑力),并给它更多的数据,它完成工作的能力会以一种可预测的方式提升。

科学家知道这在语言(聊天机器人)和图像(图像生成器)领域行之有效。但没人知道这是否也适用于生物学。研究人员想要看看这个规则是否也适用于细胞。

他们构建了 六个不同版本的 AI,范围从一个微小的“玩具”模型(仅有 500 个“脑细胞”)到一个巨大的“巨型”模型(拥有超过 1 亿个“脑细胞”)。

3. 结果:“甜点区”

他们用相同的数据训练了所有六个模型,并测量了它们猜测缺失基因的能力。

  • 好消息: 就像语言模型一样,AI 越大,它猜得就越准。误差率呈现出一条平滑且可预测的曲线。这证明了神经缩放定律在单细胞生物学领域确实存在
  • 代价(收益递减): 曲线开始趋于平缓。一旦 AI 达到约 2000 万个参数(即“中等”规模),再进一步扩大规模(直到 1 亿个)并不会带来太多帮助。这就像试图填满一个已经 99% 满的桶;增加更多的水(更多的计算能力)并不会显著改变水位。

4. “噪声”底线:什么是无法学习的?

即使是最大的、最聪明的 AI 也无法获得完美的分数。存在一个误差停止下降的“底线”。

研究人员问道:这是因为 AI 还不够聪明,还是因为数据本身很乱?

他们计算出,即使是完美的 AI,在尝试预测每个基因时,仍然会产生 2.3 比特(bits)的信息误差

  • 类比: 想象你在一个嘈ellous(嘈杂)的房间里试图听朋友低语。即使你拥有最好的耳朵(最大的 AI),你也无法听得完美无瑕,因为房间太吵了(生物噪声)或者朋友在含糊其辞(技术限制)。
  • 发现: 这“2.3 比特”代表了不可还原的不确定性。这是在给定当前数据和处理方式的情况下,基因表达具有的可预测性的极限。这并非宇宙的普遍法则,而是针对这项特定实验而言的极限。

5. 关于数据规模的警告

研究人员还进行了另一种实验:保持 AI 大小不变,但改变喂给它的数据量。

  • 惊喜: 当他们仅仅给 AI 更多的数据,但没有让它进行更长时间的训练时,性能并没有提高
  • 教训: 这不仅仅关乎拥有更大的藏书量(数据),更关乎你让学生阅读这些书的时间长短(训练步数)。如果你给一个学生一百万本书,但只允许他读 10 分钟,那么他学到的东西并不会比你给他一百本书并让他读 10 分钟要多。

总结

这篇论文首次证明了更大的 AI 模型在生物学领域表现更好,但仅限于一定范围内。

  1. 缩放是有效的: 更大的模型能更好地预测基因活动。
  2. 存在极限: 在 2000 万个参数左右,继续扩大规模的成本效益就不再显著。
  3. 存在噪声极限: 即使是完美的模型也无法预测一切,因为生物学本质上是“嘈杂”且不可预测的(约 2.3 比特的不确定性)。
  4. 训练至关重要: 你需要平衡模型的大小、数据的量以及用于训练的时间。

这对未来意味着什么:
论文表明,科学家们不应该盲目地持续构建庞大的模型。相反,他们应该专注于获取更好、更干净的数据,并进行更聪明的实验,以准确理解为什么预测细胞行为的能力存在上限。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →