← 最新论文
📊 statistics

SPINEX_ Symbolic Regression: Similarity-based Symbolic Regression with Explainable Neighbors Exploration

本文介绍了 SPINEX_SymbolicRegression,这是一种新型的基于相似性的符号回归算法,它利用可解释的邻域探索来识别高价值表达式,并在超过 180 个基准函数上展示了相对于领先方法的竞争性准确度和结构相似性。

原作者: MZ Naser, Ahmed Z Naser

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: MZ Naser, Ahmed Z Naser

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代科学的广袤版图中,数据无处不在。桥梁上的传感器、太空中的望远镜以及实验室中的仪器,都在不断产生描述世界运作方式的无穷数字流。几十年来,理解这些数据的标准方法是使用机器学习模型,这些模型就像功能强大的“黑箱”。这些系统在预测未来方面表现卓越;它们可以高精度地预报风暴或识别疾病。然而,它们往往无法解释其做出预测的“原因”。它们只提供结果而没有理由,让科学家得到了正确的答案,却无法理解背后的底层机制。

这正是被称为“符号回归”(symbolic regression)的一种不同方法发挥作用的地方。与那些强行将数据套入预设形状的传统方法不同,符号回归更像是一个充满好奇心的探险家。它在寻找能够描述变量之间关系的实际数学句子。它不仅仅是在猜测一个数字,而是试图编写方程本身,去发现支配数据的公式。其目标不仅是预测,更是以人类可以阅读、理解和验证的方式,揭示隐藏的自然法则。这种产生透明、可解释模型的能力,对于物理学和工程学等领域至关重要,因为在这些领域中,了解“为什么”与了解“是什么”同样重要。

基于对清晰度的需求,一个研究团队开发了一种名为 SPINEX_SymbolicRegression 的新算法。该工具旨在通过使用一种称为“相似性”的概念,更有效地寻找这些数学句子。想象一下,该算法正在广袤的森林中寻找一种特定类型的树木。它不是孤立地观察每一棵树,而是将它们相互比较。它会问:“这棵新树看起来像那些已经表现良好的树吗?”通过关注与有潜力的候选对象在结构上相似的表达式,该算法可以更智能地引导搜索过程。它不仅寻找最符合数字的答案,还寻找那些与它目前发现的最成功的模型拥有相同构建模块(如相同的变量和运算)的答案。

研究人员使用包含 182 个不同数学问题的庞大集合对这种新方法进行了测试。这些问题涵盖了从简单、随机生成的方程到源自现实世界物理现象(如运动定律和热力学)的复杂公式。他们将这种新算法与该领域的领先工具 PySR 进行对比,进行了数千次模拟实验,以观察哪一个能更频繁地找到正确的数学表达式。结果显示,在特定领域,新方法具有明显的优势。虽然成熟的工具有时在原始预测的准确度方面略胜一筹,但新算法在寻找“正确成分”方面表现得更为出色。它更有可能识别出描述该系统所需的正确变量集和正确的数学运算。在许多情况下,当研究人员要求算法使用所有可用变量时,新方法实现了完美匹配,比竞争对手更频繁地找到了真实方程的精确结构。

这项工作的核心特征在于其对“可解释性”的关注。研究人员不仅想要一个能工作的黑箱,他们还想看到算法是如何思考的。他们加入了相关工具,允许用户准确查看算法如何演化其解决方案、哪些变量被认为很重要,以及其最佳猜测与真实的底层规律有多相似。在一次演示中,算法被要求寻找一条简单曲线的公式。它成功演化出了一个与目标高度匹配的表达式,并且系统提供了详细的分解说明,解释了为什么公式的某些部分比其他部分效果更好。这种透明度水平让科学家能够信任模型,不仅是因为它预测得好,还因为他们可以看到其背后的逻辑。

研究结论指出,这种基于相似性的方法为揭示数学关系提供了一种强大的新途径。通过平衡对准确性和结构相似性的需求,该算法始终能生成既精确又易于理解的模型。研究人员指出,虽然该方法非常有效,但它需要大量的计算能力,且在如何更快地计算这些相似性方面仍有改进空间。然而,研究结果表明,通过利用相似性原则来引导搜索,科学家可以生成不仅准确而且符合物理世界基本原理的模型。这使机器学习领域向着这样一个未来迈进了一步:计算机不仅可以预测未来,还可以解释支配未来的规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →