← 最新论文
📊 statistics

On the Rate of Convergence of Kolmogorov-Arnold Network Regression Estimators

本文确立了采用 B-样条分量的 Kolmogorov-Arnold 网络(KANs)能够实现与环境维度无关的极小极大最优回归率,同时也提供了自适应节点选择规则,并阐明了其一元分量的不可识别性。

原作者: Wei Liu, Eleni Chatzi, Zhilu Lai

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Liu, Eleni Chatzi, Zhilu Lai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一台计算机预测天气。世界是混乱的,温度、湿度、风速和气压以复杂的方式相互作用。在机器学习的世界里,这被称为“非参数回归”(nonparametric regression)。这是一种在海量数据中寻找隐藏模式的艺术,而不是将数据强行塞进一个简单的、预设好的“盒子”里(比如一条直线)。几十年来,科学家们一直在使用两种主要的工具。第一种是“神经网络”,它是一个由层级构成的数字大脑,几乎可以学习任何事物,但它通常是一个“黑盒”——我们知道它有效,但很难看清它究竟是如何运作的,或者为什么它能得出正确的答案。第二种是“样条函数”(spline),这是一种通过点集拟合出平滑曲线的数学工具,就像一把灵活的直尺。样条函数透明且易于理解,但在面对过于复杂或维度过高(例如增加更多天气变量)的数据时,它们会显得力不从心。

最近,一种名为“柯尔莫哥洛夫-阿诺德网络”(Kolmogorov–Arnold Network,简称 KAN)的新型神经网络出现了。你可以把 KAN 想象成一个聪明的混合体:它拥有神经网络的层级结构,但它不是通过神秘且纠缠不清的连接来构建预测,而是通过堆叠简单的、一维的曲线(即样条函数)来构建预测。这就像是用透明的玻璃面板而非不透明的混凝土来建造一座摩天大楼。科学家们面临的一个重大问题是:“这种新的玻璃摩天大楼是否真的能像旧的混凝土建筑一样有效,我们能否在数学上证明这一点?”本文深入探讨了这个问题,不仅是通过实验,更是通过建立严密的数学证明,来展示这些网络学习的速度和准确度究竟如何。

玻璃摩天大楼 vs. 混凝土墙

本文的作者旨在证明 KAN 不仅仅是一个酷炫的概念,更是一种在数学上最优的学习方式。他们专注于一种特定类型的 KAN,其构建模块是“B-样条”(B-splines,即前文提到的那些灵活的直尺)。他们的主要发现是一个学习的“速度限制”。他们证明了,如果他们试图预测的数据具有一定的平滑度(我们称之为“平滑度 rr”),那么 KAN 的学习速度大约为 O((logn/n)2r/(2r+1))O((\log n/n)^{2r/(2r+1)})

用日常语言来说,想象你正试图通过手指触摸来猜测一个隐藏物体的形状。如果物体非常光滑(比如一颗抛光的弹珠),你只需要很少的触摸就能弄清楚它的形状。如果它凹凸不平、棱角分明,你就需要更多的触摸。论文表明,KAN 预测形状的速度取决于物体的平滑程度,而与物体的维度无关。这是一个巨大的突破。通常情况下,当你增加维度(即追踪更多变量)时,学习会变得指数级困难——这就是所谓的“维度诅咒”(curse of dimensionality)。这就像是在一个随着你每增加一个房间就不断扩大的谷仓里寻找一根针。作者发现,由于 KAN 是由简单的、一维的组件构建的,它完全避开了这个诅咒。只要数据确实遵循 KAN 特定的结构,无论数据是 5 维还是 20 维,它的学习速度都一样快。

对数微瑕与“Log”因子

然而,故事并非完全平滑。作者发现 KAN 的学习速度比绝对理论最优值要慢一点点,差在一个微小的对数因子上(具体来说是 (logn)2r/(2r+1)(\log n)^{2r/(2r+1)} 因子)。他们发现这个“微瑕”并非源于 KAN 的架构本身,而是因为该网络是非线性的。

换个角度想:如果你试图在一个书籍按完美直线排列的图书馆里找到一本特定的书(线性系统),你可以瞬间找到。但如果书籍排列在一个复杂的、扭曲的迷宫中(非线性系统),你就必须进行更多的搜索,这增加了那个微小的“对数”延迟。作者证明,如果我们简化 KAN 使其表现得像一条直线,这个额外的延迟就会消失。这表明 KAN 本身并不“难”学习;只是导航其非线性扭曲的数学过程增加了一点点开销。

隐藏组件之谜

论文中最引人入胜的部分之一是,当你试图观察 KAN 内部,看它使用了哪些单个组件来构建答案时,会发生什么。作者证明,仅通过观察最终答案,你无法唯一地识别出这些单个组件。这就像是仅仅通过品尝完成的蛋糕,就试图推断出其精确的配料。如果你吃到的蛋糕味道是“香草味”,你无法确定烘焙师是用了 1 杯香草精和 2 杯面粉,还是用了 2 杯香草精和 1 杯面粉,因为配方允许存在一个“比例群”(scale group)——一种可以在不改变最终口感的情况下,在不同配料之间交换用量的机制。

他们表明,仅仅通过“中心化”数据(确保平均值为零)并不能解决这个谜团。网络仍然可以以某种方式重新分配权重,从而改变内部组件,但却让最终的预测结果保持完全一致。这意味着,虽然 KAN 在预测“结果”方面表现出色,但除非你添加额外的规则将其锁定,否则你不能总是信任其“内部组件”所代表的“真实”潜在原因。

节点与适应性

为了让这些网络正常工作,你需要决定使用多少个“节点”(即灵活直尺弯曲的点)。节点太少,直尺就会太僵硬,无法跟随曲线;节点太多,它就会开始剧烈摆动,转而记住噪声而非模式。作者推导出了一个完美的规则:节点的数量应该大致增长为 n1/(2r+1)n^{1/(2r+1)},其中 nn 是你的数据量。

更酷的是,他们展示了你不需要提前知道数据的“平滑度”(rr)就能做到这一点。他们创建了一种方法,让网络可以通过测试不同的选项来自动选择正确的节点数量,就像徒步旅行者尝试不同的路径,以找到那条能最快到达顶峰的路径一样。在他们的模拟实验中,这种“自适应”方法的效果与他们预先知道答案时一样好。

在实验室中验证理论

最后,作者不仅停留在数学层面,还将理论付诸实践。他们创建了具有已知平滑度水平的伪造数据,并观察 KAN 的学习过程。结果非常精准:

  • 速度: KAN 按照预测的速度进行学习,随着数据的增加,其准确度也随之提高。
  • 维度: 当他们将变量数量从 5 个增加到 20 个时,KAN 保持了其速度,而其他标准方法(如 k-最近邻算法)则大幅减速,这证实了 KAN 确实逃脱了“维度诅咒”。
  • 节点: 他们在实验中发现的最优节点数与他们的数学预测完美契合。

论文结论认为,KAN 是一种强大且在数学上合理的工具。它们提供了两全其美的优势:深度神经网络的学习能力以及样条函数的透明度。尽管关于如何完美识别网络内部组件仍存在一些悬而未决的问题,但他们证明了 KAN 能以最优速率进行学习(仅差那个微小的对数因子),这迈出了重要的一步。它告诉我们,当数据具有特定的结构时,KAN 不仅仅是一个聪明的技巧,更是学习这种结构的最高效方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →