← 最新论文
📊 statistics

Geometry-Constrained Kolmogorov-Arnold Networks: Learning Edge Geometry via Banach Duality

本文介绍了几何约束型 Kolmogorov-Arnold 网络(Banach-KANs),该网络通过由标量指数 pp 控制的、源自 Banach 对偶映射的可学习函数来取代固定的边激活函数,从而在符号回归中实现了卓越或具有竞争力的性能,并证明了与传统的固定基 KAN 相比,其对噪声和小样本量具有更强的鲁棒性。

原作者: K S Sesh Kumar

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: K S Sesh Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在科学发现的世界里,许多自然法则描述了一个量如何随另一个量的变化而变化。钟摆的摆动取决于它的角度;汽车的速度取决于交通密度;恒星的亮度取决于它的温度。几十年来,科学家们一直使用数学模型来捕捉这些关系,但一种新的方法已经出现,它将模型本身视为一个灵活的学习实体。这种被称为柯尔莫哥洛夫-阿诺德网络(Kolmogorov–Arnold Network)的方法,通过将复杂问题分解为许多微小且简单的部分来发挥作用。它不再强迫整个系统学习单一、僵化的规则,而是构建了一个网络,其中每两个点之间的每一个连接都由其自身独特的、可学习的函数所控制。这些网络面临的核心挑战始终是决定这些函数的形状应当是什么样的。传统上,研究人员必须预先设定一种特定的形状——比如一条平滑的曲线或一个重复的波形——并将其应用于整个问题。这有点像试图只用一种类型的扳手去修理一台损坏的机器;它对某些螺栓很有效,但在面对另一些时却表现得一败涂涂。

伦敦帝国理工学院的一位研究人员提出了另一种思考这个问题的方法。他意识到,真正的问题不在于函数本身的形状,而在于该函数所处的底层“几何结构”或空间。在数学中,几何决定了距离如何测量,以及一条曲线可以有多尖锐或多平滑。该研究人员开发了一种新型网络,其几何结构在学习开始前并非固定的。相反,网络会直接从数据中学习每个单独连接的最佳几何结构。他通过为网络中的每个连接引入一个单一的可调节数值实现了这一点。这个数字就像一个旋钮,可以改变连接的行为:使其从尖锐且具有阈值感的特性,转变为平滑且线性的特性,甚至是扁平且饱和的状态。通过让数据来决定如何设置这个旋钮,网络可以调整其自身的内部结构,以匹配其正在解决的问题的特定特征。

该研究人员在五十个不同的数学问题上测试了这个想法,这些问题涵盖了从标准物理方程到旨在压力测试系统的合成挑战。他将这种新型的几何自适应网络与依赖固定形状的旧模型进行了对比,例如样条函数(splines,类似于用于绘制平滑曲线的柔性尺子)或多项式。结果显示,当数据包含突然跳变或尖锐棱角时,固定形状的模型表现挣扎,往往会产生波动且不准确的结果,因为它们的形状过于僵化,无法足够弯曲以拟合数据。相比之下,能够调整自身几何结构的新型网络,其表现达到或超过了所有固定形状基准模型的水平。在十八个核心难题方程组中,新方法取得了最佳的平均排名;而在完整的五十个问题集中,它的表现也同样不逊于最强的传统方法。

或许最重要的发现是这些新网络处理噪声的方式。在现实世界中,测量很少是完美的;它们通常包含随机误差或“静电噪声”。当研究人员在数据中加入越来越多的噪声时,传统模型很快就会崩溃。随着噪声的增加,它们的误差率增长了二十一倍或更多。而几何自适应网络则表现得更为稳健。即使噪声水平上升,它们的误差率增长也非常有限,通常不到原始误差的四倍。这表明,通过学习正确的几何结构,网络可以忽略随机静电,从而专注于真实的信号,而这种能力是固定形状模型所欠缺的。

研究还揭示,网络并不仅仅学习一种统一的几何结构。相反,同一网络内的不同连接学习到了不同的几何旋钮设置。一些连接学会了变得非常尖锐以处理突发变化,而另一些则学会了变得平滑以处理渐进趋势。这种专业化现象在不同类型的方程和输入维度中一致地发生。例如,当问题涉及更多变量时,网络往往会学习到更尖锐的几何结构。这种行为提供了一种可解释性:通过观察网络选择的设置,研究人员可以看到反映问题底层结构的信号。网络本质上是在告诉我们:“这个部分的问题需要一个尖锐的边缘,而那个部分则需要一条平滑的曲线。”

研究人员还探索了在数据量极少的情况下会发生什么。在这些小样本场景中,新网络再次超越了固定形状模型,后者通常需要大量数据才能进行有效学习。这种自适应几何的能力使得新网络可以用更少的样本来逼近正确答案。然而,研究也指出了这种方法的局限性。虽然该方法在低维到中维问题上表现出色,但它并不是用于图像识别等任务的深度、大规模神经网络的替代品。事实上,在测试图像数据集时,只有当给予新方法二十到三十倍的参数量时,它才能达到标准网络的性能,这表明其优势在于针对特定回归问题的效率和适应性,而非单纯的规模扩张。

最终,这项工作将焦点从“选择正确的工具”转向了“构建一个可以改变自身形状的工具”。研究人员证明,解决复杂回归问题的关键不在于用于表示数据的特定数学基础,而在于该表示所处的几何空间。通过将这个空间变为一个可学习的参数,他创造了一个对噪声更具鲁棒性、对小数据集更高效、并且更能捕捉其试图建模的关系之本质特征的系统。研究结果表明,在未来,最有效的模型可能不是那些拥有最复杂固定架构的模型,而是那些能够学习其所解决问题的几何结构的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →