Multi-stage neural operator learning with application for convolutions
本文介绍了两种多阶段神经算子学习框架,即深度配置点神经算子(DCNO)和深度伽辽金神经算子(DGNO),它们分别通过监督训练和无监督训练迭代优化算子近似,从而在求解卷积积分及相关的多输入问题时实现机器精度级的准确度与卓越的效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代科学与工程的广阔领域中,许多问题最终都归结为理解一个事物如何跨越距离影响另一个事物。想象一下,在一个人群中,每一个人都在对其他人施加微妙的拉力或推力,从而创造出一个复杂的相互作用网络。在物理学中,这可能是恒星之间的引力,粒子间的电荷,或者是信号在介质中传播的方式。科学家们称这种现象为“卷积”(convolution),这是一种数学运算,通过汇总这些远距离的影响来预测最终结果,例如引力场的形状或电势的强度。几十年来,计算这些相互作用一直是一个沉重的计算负担。传统方法可以解决特定点集的问题,但当被要求处理新场景或空间中任意散布的点时,它们就会显得力不从心。它们就像一位只能在固定网格上绘制道路的制图师;如果你询问网格线之间的位置,他们只能靠猜测,从而往往会损失精度。
研究人员最近转向人工智能来解决这一问题,通过训练计算机程序直接学习这些相互作用的规则。然而,标准的 AI 方法往往会撞上准确性的壁垒,产生的结果虽然不错,但对于最严苛的科学任务来说还不够精确。它们就像一个学习概念很快,却会犯下一些微小且持续错误的优等生。来自中国机构的一支科学家团队现在开发了一种新的教学方式,让机器能够达到此前无法企及的精度水平。他们的工作引入了两种不同的学习策略,其作用类似于一位精雕细琢的工匠:他们从一个粗略的形状开始,然后分阶段不断地剔除瑕疵,直到结果近乎完美。
由毛志平及其同事领导的研究小组专注于教导神经网络处理这些长程相互作用的具体挑战。他们意识到,试图一次性学习整个解是瓶颈所在。相反,他们提出了一个多阶段方法,其中计算机首先学习主要模式,然后在随后的轮次中,仅学习前一次尝试留下的误差或“残差”(residuals)。可以将其想象成一位画家,先勾勒出风景的轮廓,然后描绘细节,最后添加细微的高光和阴影,使图像栩栩如生。通过将任务分解为这些渐进的步骤,计算机能够建立起对所涉及物理过程更丰富、更准确的理解。
他们开发了两个版本的这种方法,以适应不同类型的问题。第一种被称为“深度配置神经算子”(Deep Collocation Neural Operator),这是一种监督学习方法。它的工作方式就像一个带着教科书和答案解析的优等生。计算机被输入一对输入值及其对应的正确输出(这些输出是由传统的、速度较慢的求解器生成的)。它学习预测答案,检查自己的工作是否符合正确答案,然后训练一个新的专门网络来修正它所犯的特定错误。这个循环不断重复,每个新网络只专注于前一个网络的误差,直到总误差变得微乎其微。第二种方法被称为“深度伽辽金神经算子”(Deep Galerkin Neural Operator),旨在处理那些物理过程可以用一组特定的控制方程描述,但由于生成训练所需的正确答案成本过高而无法获取的情况。这个版本是无监督的;它不需要答案解析。相反,它通过检查其预测是否满足编码在这些方程中的基本物理定律来进行学习。它不断调整内部逻辑,以确保遵守物理定律,通过不断精炼其解,使其即使在从未见过任何预先计算的示例的情况下,也能与物理现实完美契合。
为了测试这些想法,团队将其应用于各种现实场景,包括引力和电势的计算。在一次涉及二维引力场的实验中,他们发现这种多阶段方法可以将误差降低到几乎无法与计算机自身的精度极限区分的程度。在单精度算术(这是许多高速计算的标准)中,误差降到了极小的百分比,实际上达到了机器的极限。这与标准方法相比是一个巨大的进步,因为标准方法通常会在较高的误差率处停滞不前。研究人员还在一些相互作用规则复杂且没有简单方程描述的问题上测试了该系统,证明了监督版本能够以同样的高精度处理这些困难案例。
这种方法的益处远不止于更高的准确性。一旦训练完成,新系统几乎可以瞬间预测空间中任何位置的结果,而无需重新计算整个网格。在与一种高度优化的传统求解器进行直接对比时,新方法在评估大量不同场景的结果时,速度快了数千倍。虽然初始训练需要一些时间,但回报在于应用的效率。对于需要运行数千次模拟或探索系统如何随参数变化而变化的科学家来说,这种加速是变革性的。它将一个可能需要数小时或数天的工作缩短到了几秒钟,为探索那些此前因计算成本过高而无法详细研究的复杂系统打开了大门。
研究人员还展示了他们的方法可以处理更为复杂的情况,即多个因素同时发生变化。在一次测试中,他们训练系统去理解当材料密度和相互作用核(interaction kernel)同时发生变化时,结果会如何变化。该系统成功学习了如何在这些变化条件下进行泛化,并保持了高精度。这表明该方法具有鲁棒性和灵活性,可以应用于广泛的科学问题,从模拟量子粒子的行为到模拟流体的流动。
这项工作代表了科学计算领域迈出的重要一步,表明人工智能可以被推向能够达到与传统数学方法相媲美的严谨程度。通过放弃在这一领域占据主导地位的“一蹴而就”式学习风格,转而拥抱迭代精炼的过程,研究人员展示了机器可以通过层层构建知识,直到图像完整,从而能够以近乎完美的精度解决复杂的物理问题。研究结果表明,科学模拟的未来不仅在于更快的硬件,更在于更聪明的教学方式,让计算机能够通过层层递进的学习来构建知识。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。