When Does AI for PDEs Yield Scientific Evidence?
本文通过引入一种新的评估框架,展示了现有基准测试如何可能偏向于那些数值上准确但对特定科学主张提供支持较弱的模型,从而解决了人工智能在偏微分方程(PDEs)领域中预测准确性与科学证据支持之间存在的关键差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代科学的广袤版图中,一种强大的新工具已经出现,旨在帮助研究人员理解物理世界:即将人工智能应用于支配自然的方程。这些方程被称为偏微分方程,是描述从水的流动、空气的运动到热量和电力的行为等一切现象的数学语言。几十年来,科学家们一直依赖传统的计算机模拟来求解这些方程,但近年来,人工智能模型已经展示出它们可以以惊人的速度和精度学习预测这些物理行为。衡量这些人工智能模型的标准一直以来都是简单直接的:人工智能的预测与已知正确答案之间的匹配程度如何?如果数字吻合,该模型就被认为是优秀的。这种方法推动了快速进展,引发了一场构建能够最小化输出与真相之间差异的模型之竞赛。
然而,一个关键问题却一直未被问及:一个产生高度精确数值的模型,是否真的能提供科学家进行真正发现所需的证据?在现实世界中,研究人员不仅仅想要一个数字;他们想要支持特定主张的证据,例如“这个冰架融化得比我们想象的要快”或“这种流体在这种条件下会变得不稳定”。一个模型可能在整体上非常精确,但仍可能遗漏对该主张至关重要的特定细节;或者它可能在某些方面稍有偏差,而这种偏差会完全改变结论。直到现在,科学界一直假设高准确度自动等同于强有力的证据。一项新研究挑战了这一假设,认为我们衡量成功的方式可能会导致我们选择错误的 AI 模型来执行科学发现的任务。
由华南理工大学的王文硕(Wenshuo Wang)领导的研究团队,通过创建一种新的评估 AI 模型的方法,着手测试这一想法。他们不再仅仅询问:“你的答案与正确答案有多接近?”而是询问:“你的答案是否提供了足够的证据来支持这一特定的科学主张?”为了实现这一点,他们采用了两个现有的、广泛用于物理领域的人工智能基准——一个用于预测系统随时间演化的过程,另一个用于从数据中推断隐藏的物理属性——并增加了一个新的评估维度。他们使用相同的 AI 模型,输入相同的数据,并要求它们解决相同的问题。但这一次,除了传统的准确率得分外,他们还检查了模型的输出是否能够支持特定的、预定义的科学陈述。
想象一位气象预报员,他能完美地预测全国每个城市的温度,却未能预测到一场风暴将袭击某个沿海小镇。如果你只看平均温度误差,这位预报员看起来很出色。但如果你的目标是向该小镇发布风暴预警,那么这位预报员就失败了。研究人员发现,在物理学领域也发生了类似的情况。他们发现,在纯数值准确率排名中最高的模型,往往并不是在提供科学主张证据方面排名最高的模型。事实上,这两个目标经常指向不同的获胜者。
为了得出这一结论,团队检查了各种各样的 AI 模型,包括目前正在使用的最先进且最流行的模型。他们在从模拟浅河中水流到推断地下岩层隐藏属性的任务上对这些模型进行了测试。对于每项任务,他们都定义了具体的科学主张,例如该地区的平均水位是否会保持在一定范围内,或者某种特定类型的岩石在压力下会如何表现。然后,他们为每个模型测量了两项指标:其预测值与真实答案的接近程度,以及其预测结果连同其估计的不确定性是否足以证实该主张。
结果令人震惊。在几乎所有的主要对比中,那个在最小化误差方面表现“最好”的模型,与在支持科学主张方面表现“最好”的模型并不一致。有时这种差异很小,但通常非常显著。研究人员发现,一个模型即使在数值上非常准确,如果其误差发生在错误的方向,或者模型本身的不确定性过高,导致无法排除其他可能性,它仍然无法支持某项主张。相反,一个整体误差稍大的模型,如果其误差发生在特定的关键区域内足够小,仍可能为某项主张提供强有力的证据。
这项研究进一步解释了这种不匹配发生的原因。事实证明,准确度与证据之间的关系取决于三个关键因素:真实值距离主张边界的远近、模型误差发生的位置,以及模型不确定性的范围。如果真实值就在主张的边缘,即使是微小的误差也会使结论从“支持”变为“反驳”。如果模型的误差方向不对,即使整体误差很小,也会削弱一项主张。此外,如果模型的不确定性过大,无论其平均预测多么准确,它都无法提供支持主张所需的决定性证明。
这一发现对科学界如何开发和使用人工智能具有深远的影响。多年来,研究人员一直致力于优化模型以实现尽可能高的准确度,并假设这自然会带来更好的科学洞察。这项研究表明,这一假设是有缺陷的。通过仅仅关注准确度,我们可能会在无意中倾向于那些擅长复制数据、但在提供科学发现所需的特定证据方面表现较差的模型。作者认为,我们需要改变评估这些工具的方式。我们不能只看单一的准确度评分,必须评估一个 AI 模型是否能够真正支持科学家试图提出的特定主张。
研究人员不仅指出了问题,还构建了一个衡量解决方案的框架。他们创建了一个新的评估系统,将对科学主张的支持视为一个独立于数值准确度的不同目标。他们在现实场景中测试了这一系统,包括南极冰架的流动和多孔岩石中的流体运动,并发现它确实发挥了作用。该系统能够清晰地分辨出哪些模型提供了强有力的证据,而哪些模型则没有,即使它们的数值准确度非常相似。
这项工作是一个至关重要的提醒:在科学领域,目标不仅在于“正确”,更在于以一种“有意义的方式”正确。一个在统计上准确但在科学上无用的模型,是一个错失的机会。随着人工智能越来越多地融入科学研究,我们评判这些模型的方式也必须进化。我们需要确保我们构建的工具不仅擅长猜测数字,而且能够提供驱动人类理解前进的可靠且坚实的证据。研究结论指出,我们必须停止假设准确度等于证据,并开始将两者分开衡量,从而确保未来的 AI 模型真正符合科学发现的目的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。