← 最新论文
🧬 biology

Better Models, Faster Training: Sigmoid Attention for single-cell Foundation Models

本文证明,在单细胞基础模型中用 sigmoid 注意力机制替代 softmax,可借助理论上有界的导数实现更优的表征质量、更快的训练速度和更强的稳定性,并得到了高度优化的 Triton 内核实现的支持。

原作者: Vijay Sadashivaiah, Georgios Dasoulas, Judith Mueller, Soumya Ghosh

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Vijay Sadashivaiah, Georgios Dasoulas, Judith Mueller, Soumya Ghosh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

以下是用简单语言和创意类比对该论文的解释。

宏观图景:解读“生命语言”的更佳方式

想象你正在尝试教计算机理解人类细胞的“语言”。在这种语言中,每个基因都是一个单词,而整个细胞则是一个句子。科学家们一直使用一种名为Transformer的强大工具(即那种能写文章或与你聊天的同类人工智能)来阅读这些细胞句子。

然而,这些计算机用来理解单词之间关系的标准工具被称为Softmax 注意力机制。本文作者认为,对于生物学而言,这种标准工具就像试图用一本僵化、刻板的规则书去应对活细胞中混乱的现实。他们提议将其替换为一种名为Sigmoid 注意力机制的新工具,称其速度更快、更稳定,且实际上能帮助人工智能更好地学习。

以下是他们的具体拆解:

1. 问题所在:“零和博弈”

旧方法(Softmax):
想象你是一位老师,手中只有有限数量的“注意力代币”(比如 100 张贴纸)要分发给教室里的学生。如果你给了学生 A 50 张贴纸,你就必须从其他人那里拿走这些贴纸。这就是Softmax的工作原理。它迫使人工智能做出决定:“我将重点关注基因 X,因此我必须忽略基因 Y。”

这对生物学为何不利:
在真实的细胞中,基因往往协同工作。单个基因可能同时受到多个不同调节因子的控制。这就像一名学生需要同时得到三位不同老师的帮助。Softmax 的“零和”规则迫使人工智能只选择一位老师,这与生物学实际运作方式不符。

新方法(Sigmoid):
Sigmoid 注意力机制就像如果学生值得,就给他们每人一张贴纸,且没有数量限制。如果学生 A、学生 B 和学生 C 都需要帮助,老师可以给所有人贴纸。这允许人工智能说:“这个基因很重要,而且那个基因也很重要”,而无需为了关注其中一个而忽略另一个。

2. 稳定性问题:“走钢丝者”

旧方法(Softmax):
Softmax 就像一位对风非常敏感的走钢丝者。如果数值变得太大(当基因序列很长时就会发生这种情况),数学计算可能会失控。“风”会将走钢丝者吹下绳索,导致训练崩溃。在论文中,他们通过移除安全网(梯度裁剪)并使用非常长的序列来测试这一点。Softmax 模型从悬崖上跌落,其数学计算爆炸了10,000 倍

新方法(Sigmoid):
Sigmoid 就像一位在宽阔平坦桥梁上行走的人。它拥有内置的护栏。无论数值变得多大,数学计算都保持在安全、可预测的范围内。在同样的“无安全网”测试中,Sigmoid 模型保持完美行走,从未崩溃。

3. 速度问题:“参差不齐的拼图”

挑战:
生物数据是混乱的。一个细胞可能只有 500 个基因(短句),而另一个可能有 10,000 个基因(长篇小说)。为了将它们一起处理,计算机通常必须用“空白空间”(零)填充较短的序列,使它们看起来长度相同。这就像试图通过将短诗塞满填充泡沫来将其与长篇小说装入同一个盒子。

解决方案:
作者构建了一种名为TritonSigmoid的全新超快速引擎。

  • 类比: 想象一辆通常必须驶向社区中每一栋房子的送货卡车,即使是空房子(填充部分)也不例外。TritonSigmoid 是一辆智能卡车,它确切知道哪些房子是空的,并完全跳过它们。
  • 结果: 这个新引擎速度极快。在最新的超级计算机芯片(NVIDIA H100)上,其运行速度达到515 TFLOPS(每秒万亿次计算)。这比当前最佳的 Softmax 引擎更快,甚至比之前的 Sigmoid 尝试更快。它使这些生物模型的训练速度提高了高达10%

4. 结果:更聪明的头脑,更快的训练

该团队训练了四种不同的人工智能模型,以观察哪种模型学习得更好。他们使用了一个包含 1.31 亿个细胞的庞大数据集。

  • 更好的学习: 使用 Sigmoid 的模型不仅学得更快,而且学得更好。它们区分不同细胞类型(例如区分心脏细胞和脑细胞)的能力比 Softmax 模型提高了25%
  • 更低的错误率: Sigmoid 模型在预测基因模式时犯的错误更少。
  • 无崩溃: 在压力测试中,Softmax 模型崩溃并被迫重启,浪费了时间和金钱。Sigmoid 模型则毫无故障地完成了任务。

总结

该论文声称,对于理解单细胞生物学中复杂、混乱且多变的数据,标准的"Softmax"注意力机制过于僵化且不稳定。通过切换到Sigmoid 注意力机制,他们创建了一个系统,能够:

  1. 允许多重连接(基因可同时受多种因素影响)。
  2. 保持稳定,即使数学计算变得激烈(不再崩溃)。
  3. 运行更快,通过智能跳过空白数据(填充部分)。

他们已将这种新的、更快的引擎(TritonSigmoid)免费开放,以便其他科学家利用它构建更好的生物模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →