Decomposable Neural Symbolic Regression
本文介绍了一种可分解的神经符号回归方法,该方法利用多集 Transformer(Multi-Set Transformers)、遗传算法和遗传编程,将不透明的回归模型提炼为准确且可解释的多变量表达式,在保持竞争性预测性能的同时,能够一致地恢复原始的数学结构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代科学世界中,计算机已成为寻找数据模式的极其强大的工具。它们可以观察自然界成千上万次的测量值,并构建出能够高精度预测未来结果的复杂模型。这些模型通常被称为“不透明”的,因为尽管它们运行良好,但其内部逻辑过于错综复杂,以至于人类无法轻易理解它们是如何得出结论的。它们就像一个黑匣子:你输入数据,输出答案,但中间的过程路径仍然隐藏着。对于研究物理学、生物学或工程学的科学家来说,这种缺乏透明度的现象是一个主要的障碍。要真正理解宇宙,研究人员需要的不仅仅是预测;他们需要的是支配方程,即描述自然运作方式的清晰数学语句。这正是符号回归(symbolic regression)的目标,该领域致力于寻找能够解释观测数据的简单、可读的公式,而非仅仅是记忆数据。
蒙大拿州立大学的一个研究团队开发了一种解决这一问题的新方法,提供了一种可以剥开这些复杂计算机模型层层外壳,从而揭示其底层简单数学真理的方法。他们的方法被称为 SeTGAP,其过程首先是训练一个标准的、高度复杂的计算机模型来学习系统的行为。一旦这个“不透明”的模型训练完成并开始工作后,研究人员并不试图逆向工程其数百万个内部设置。相反,他们将该模型视为一种“真理来源”,并要求它逐一解释自身。他们系统地隔离每一个输入因子,例如温度或压力,并询问模型当只有一个因子发生变化时,输出会如何改变。通过这种方式,该系统生成了一系列简单的单变量草图,用以描述每个碎片化部分的关联形状。
随后,研究人员使用一种复杂的流程将这些单独的草图缝合在一起。想象一下,试图通过首先弄清楚每个齿轮是如何独立转动的,然后再看它们是如何啮合在一起的,从而理解一台复杂的机器。该团队结合了人工智能和进化算法,将这些单变量草图合并为一个完整的多变量公式。他们并非简单地将所有碎片一次性堆叠在一起,因为这往往会导致混乱和过于复杂的结果。相反,他们逐个添加变量,确保公式的结构在每一步都保持简洁且符合逻辑。这种方法使他们能够保留早期识别出的原始函数关系,防止最终的方程变成一个虽然拟合数据但毫无意义的杂乱数字纠缠体。
当团队将此方法应用于各种问题时——从合成数学挑战到现实世界的物理方程——结果令人瞩目。在合成问题上,他们的这种方法在每一次进行的测试案例中都成功恢复了底层系统的正确数学结构。相比之下,其他领先的方法(包括依赖深度学习或传统进化计算的方法)经常无法找到正确的形式,即便能正确预测数值,也往往会产生过于复杂或完全错误的表达式。当数据包含噪声或误差时(这是现实世界测量中的常见现象),这种新方法表现出了极强的鲁棒性。当其他方法在超出训练数据范围的数值上进行泛化时往往难以应对,而该方法发现的方程在测试新的、未见过的数值范围时依然表现良好。
研究人员还将他们的技术应用于著名的费曼数据集(Feynman dataset),该数据集包含了描述从引力到光行为等各种定律的物理方程。在这个基准测试中,他们的方法在识别正确方程方面取得了很高的成功率,在符号解恢复方面排名第二,成功率约为 61.2%,并展示了相对于许多既有技术具有竞争力的预测性能。这项研究表明,通过将一个复杂问题分解为更小、更易处理的部分,然后进行仔细的重新组装,是有可能绕过当前人工智能的局限性的。这并不意味着计算机的能力减弱了;相反,这意味着让它们“解释自身”的方法更为有效。这项工作证明,从现代机器学习深层且隐藏的层次中提取清晰、人类可读的自然法则是一件可能的事,从而将不透明的预测转化为透明的理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。