← 最新论文
🤖 machine learning

Compact SO(3) Equivariant Atomistic Foundation Models via Structural Pruning

本文提出了一种结构剪枝方法,通过移除不可约表示块,在原子基础模型中保持SO(3)等变性,从而显著降低参数量和计算成本,同时在精度和下游微调效率方面均优于从头训练的小规模模型。

原作者: Chen Wang, Siyu Hu, Guangming Tan, Weile Jia

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Chen Wang, Siyu Hu, Guangming Tan, Weile Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位能完美烹饪世间任何菜肴的大厨。这位大厨才华横溢,但体型庞大:他背着一个装满数千种香料、巨型锅具和复杂工具的背包。虽然他能做出完美的佳肴,但烹饪耗时很长,能耗巨大,且需要一间巨大的厨房来运作。

现在,想象你想开设一个小型快餐摊。你并不需要这位大厨那整套庞大的工具箱;你只需要掌握快速制作美味汉堡和薯条的核心技能。

本文介绍了一种新方法,旨在将那位“大厨”(一种用于预测原子行为的大型高精度人工智能模型)通过手术式修剪,转化为“快餐厨师”(一种更小、更快的模型),同时不丧失其烹饪美味佳肴的能力。

以下是他们如何实现这一目标的分解说明,使用了简单的类比:

1. 问题:“沉重的背包”

当前化学领域最佳的人工智能模型(称为SO(3) 等变模型)就像那些完美理解旋转物理原理的大厨。如果你旋转一个分子,该模型能确切知道原子之间如何相对移动。这使得它们极其精准。

然而,为了实现这一点,它们背负着由复杂数学(高阶张量)构成的“沉重背包”。

  • 权衡取舍:背包越大,烹饪越精准,但运行速度越慢,成本越高。
  • 旧方法:如果你想要一位更小的大厨,通常必须从头开始训练一位全新的小厨师。这位新厨师毫无经验,学习时间长,且最终做出的食物往往不如那位大厨美味。

2. 解决方案:“结构剪枝”(手术式修剪)

作者没有从头开始训练新厨师,而是对现有的大厨进行了“结构剪枝”。这可以想象为一次非常精细的理发,或者是对背包的修剪。

  • 挑战:你不能随意剪掉一个香料罐或工具。在这些模型中,“工具”(数学部分)紧密相连。如果你切断工具的某一部分,整个工具就会损坏,模型也会失去理解旋转的能力(不再具备“等变性”)。
  • 创新:作者发现如何一次性剪掉整个工具块。他们将一组特定的关联工具视为一个单一的“原子单元”。如果决定移除一个单元,就将其整体移除,从而确保剩余的工具仍能完美协同工作。

3. 如何决定剪掉什么(“敏感性测试”)

你如何知道该保留哪些工具,该丢弃哪些?不能仅凭猜测。

作者使用了一种基于能量和力的巧妙测试:

  • 想象模型正拿着一件精致的玻璃雕塑(分子)。
  • 他们问道:“如果我移除这个特定工具,雕塑会破裂或倒塌吗?”
  • 他们测量了当移除一个工具时,模型对“能量”和“力”的预测发生了多大变化。
  • 规则:如果移除一个工具几乎不改变结果,那它就是一个“懒惰工具”,会被剪掉。如果移除它会导致模型出错,那它就是一个“关键工具”,会被保留。

4. 过程:四步食谱

本文概述了将巨型模型转化为紧凑模型的四个步骤:

  1. 校准:让大厨做几道测试菜,观察哪些工具实际上被使用了,以及它们有多重要。
  2. 剪枝:根据测试结果,手术式地移除“懒惰”的工具块。
  3. 再训练:模型现在变小了,且留下了工具被移除后的空缺。他们利用少量数据给它上一堂快速的“复习课”,帮助它适应新的、更小的身体。
  4. 微调:最后,他们教导这个新的紧凑模型执行特定任务(例如预测特定药物分子的行为)。

5. 结果:更快、更便宜,且依然美味

结果令人印象深刻:

  • 优于从头开始:经过修剪的模型比从头开始训练的全新小模型更精准,尽管它们的规模相同。
  • 巨大节省
    • 训练:与从头训练一个小模型相比,创建修剪后模型所需的计算机时间和成本减少了2.5 到 4 倍
    • 速度:在使用模型进行预测时,速度快了2.7 倍
    • 内存:它所需的计算机内存显著减少(最多减少 5.7 倍)。
  • 通用性:这种方法不仅适用于一种类型的模型(MACE),也适用于其他模型(SevenNet, eSCN),证明它是这类人工智能大厨的通用食谱。

6. “额外”组合

本文还指出,这种修剪方法可以与其他效率技巧相结合:

  • 量化:就像从高清视频切换到标清视频以节省空间。
  • 知识蒸馏:就像让大厨教小厨师特定的技巧。
    当这些方法结合使用时,模型会变得更小、更快,且不会损失质量。

总结

简而言之,作者找到了一种方法,通过仔细剪除不必要的部分,同时保留核心的“物理大脑”,从而缩小用于化学领域的庞大且昂贵的人工智能模型。其结果是一个更小、更快、更便宜的模型,其智能程度甚至超过任何从头构建的小模型。这使得先进材料发现和药物设计能够惠及更多没有超级计算机的研究人员。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →