← 最新论文
🔬 materials science

Bayesian Neural Networks versus deep ensembles for uncertainty quantification in machine learning interatomic potentials

本文在 aenet-PyTorch 框架内引入了一种贝叶斯神经网络实现,并系统地比较了其在 TiO2_2 结构上的不确定性量化能力与深度集成(deep ensembles)的差异,旨在为开发可靠的机器学习原子间势函数提供指导。

原作者: Riccardo Farris, Emanuele Telari, Nongnuch Artrith, Konstantin Neyman, Albert Bruix

发布于 2026-06-23✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Riccardo Farris, Emanuele Telari, Nongnuch Artrith, Konstantin Neyman, Albert Bruix

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位大厨,正试图根据现有的食材精确预测汤里应该加多少盐。你有一份食谱(机器学习模型),当你拥有一本庞大的往期食谱库供其学习时,它表现得非常出色。但当你尝试烹饪一道全新的、奇特的菜肴,而这道菜并不在你的食谱库中时,会发生什么?一个标准的食谱可能会自信地告诉你:“加2茶匙!”即便它是完全错误的,因为它并不知道自己在瞎猜。

在材料科学领域,科学家使用被称为“机器学习原子间势”(MLIPs)的“食谱”来预测原子的行为。问题在于,这些食谱往往缺乏一个“信心计”。它们不知道自己何时处于不确定状态。这篇论文比较了构建这种信心计的两种不同方法:深度集成(Deep Ensembles)贝叶斯神经网络(Bayesian Neural Networks)

以下是对其实验和发现的简单拆解:

两位竞争者

  1. 深度集成(“厨师委员会”):
    想象一下,你不仅雇佣了一位大厨,而是雇佣了五位不同的厨师。每一位都从同一本食谱中学习,但他们的初始思维方式略有不同(随机初始化)。当你询问他们预测盐量时,他们都会给出一个答案。

    • 运作方式: 如果五位厨师意见一致,你就充满信心;如果他们在争论(一位说1茶匙,另一位说5茶匙),你就知道预测是不确定的。
    • 论文观点: 这种方法简单、实用,且一旦训练完成,使用起来非常快。
  2. 贝叶斯神经网络(“数学先知”):
    想象一位不仅学习食谱,还学习概率分布的食谱。这位大厨掌握的不是“盐 = 2茶匙”,而是知道“盐可能在1到3茶匙之间,但我不是100%确定”。

    • 运作方式: 这是基于复杂的数学(贝叶斯概率),将食谱的规则视为随机变量。它试图从一开始就计算出“真实”的不确定性。
    • 论文观点: 这在理论上非常优美且具有深厚的数学根基,但在计算上非常沉重,且难以训练。

实验:“二氧化钛”与“有机物”测试厨房

研究人员在两个不同的“厨房”(数据集)中测试了这两种方法:

  1. 二氧化钛(TiO2)厨房: 一个包含特定金属氧化物7,815种结构的数据集。他们使用了一本完整的食谱(高数据量)和一本微小的、不完整的食谱(低数据量)进行了测试。
  2. QM7 厨房: 一个包含7,165个小型有机分子的数据集。这是一个化学成分更加多样化的“厨房”,拥有许多不同类型的食材。

结果:谁赢了?

1. 在二氧化钛厨房中(大多数场景):

  • 获胜者: **“厨师委员会”(深度集成)**几乎在所有情况下都赢得了胜利。
  • 原因: 它们在预测能量和力方面更准确。更重要的是,它们的“信心计”表现更好。当它们说自己不确定时,通常确实是不确定;当它们表现出信心时,通常也是正确的。
  • 贝叶斯先知: 表现尚可,但经常出现过度自信或信心不足的情况。此外,它的训练时间更长,进行单次预测也更慢,因为每次猜测都需要运行复杂的数学模拟。
  • “低数据量”转折: 当食谱非常微小时(低数据量),贝叶斯先知在预测(原子如何推力和拉力)方面实际上变得稍微好了一些,这可能是因为其数学“先验”起到了有益的防护网作用。但对于整体准确性和信心而言,委员会仍然保持着领先地位。

2. 在有机物厨房(QM7)中:

  • 惊喜: 当食材变得非常多样化(不同类型的分子)时,贝esian 先知在预测能量值方面实际上比委员会做得稍好一些。
  • 代价: 尽管先知的数值预测略微准确,但委员会在告诉你它有多确定方面仍然更胜一筹。委员会的信心计依然是最可靠的工具。

“信心的成本”

  • 训练: 训练委员会需要更长时间,因为你需要训练五位厨师而不是一位。然而,贝叶斯先知同样难以训练且难以捉摸;它通常需要多次运行才能获得理想结果,因为它对初始设置非常敏感。
  • 使用模型(推理): 这是两者产生巨大差异的地方。
    • 委员会: 要做出预测,你只需询问五位厨师一次即可。它很快。
    • 先知: 要做出预测,先知必须为每一个原子运行20次复杂的模拟来计算其不确定性。它在使用速度上大约比委员会慢20倍

核心结论

该论文为科学家提供了一个实用的配方:

  • 如果你需要可靠性和速度: 选择深度集成(委员会)。它是了解模型何时在瞎猜的最稳健工具,尤其是在处理特定类型的材料时。它更容易构建,且使用起来更快。
  • 如果你只有极少的数据或面对极其多样化的化学空间: 贝叶斯神经网络可能会在准确性上提供微弱的优势,因为其数学“安全网”有助于它更好地泛化。然而,你必须为此付出更慢的预测时间和更困难的训练过程。

简而言之,虽然“数学先知”听起来更高级,但在本研究中,“厨师委员会”被证明是大多数情况下更实用、更可靠且更高效的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →