← 最新论文
💻 computer science

Dictionary-KAN: Resolving the Optimization Paradox of Kolmogorov-Arnold Networks via Complex RKHS, Machine-Verified Theory, and Discrete Hierarchical Refinement

本文介绍了字典式 KAN(Dictionary-KAN, DKAN),这是一种经过机器验证的架构,它通过采用复系数径向基函数(RBF)字典和离散分层细化技术,解决了 Kolmogorov-Arnold 网络中的优化悖论,从而在实现卓越的多变量回归、偏微分方程(PDE)系数恢复以及硬件高效的可解释性的同时,避免了基于连续样条的 KAN 所存在的内存和收敛问题。

原作者: Kiarash Mohammadi

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Kiarash Mohammadi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的广阔版图中,一个持久的挑战长期以来一直困扰着研究人员:如何构建能够学习复杂模式,却又不会在数学混乱的海洋中迷失方向的机器。几十年来,标准方法一直依赖于大规模、稠密的连接网格,其中系统的每个部分都与所有其他部分进行通信。虽然这些系统功能强大,但它们往往难以找到解决问题的最有效路径,容易陷入局部陷柜,或者由于需要过多的内存而导致根本无法在现有硬件上运行。一种被称为柯尔莫哥洛夫-阿诺德(Kolmogorov-Arnold)表示法的较新理念提供了一条不同的路径。它提出,任何复杂的、多维的关系都可以分解为一系列相加的更简单的、一维的步骤。这个概念承诺了一种更优雅、更具可解释性的建模世界的方式,但当科学家们试图构建它时,却遇到了一个根本性的悖论。他们用来使这些网络具有灵活性的数学工具过于不稳定,导致学习过程崩溃或变得计算成本极高。

研究员基亚拉什·穆罕默迪(Kiarash Mohammadi)现在提出了一种解决方案,通过一种名为 Dictionary-KAN 的新架构来解决这一悖论。该系统不再试图拉伸和扭曲连续的数据点网格(这往往会导致困扰以往尝试的不稳定性),而是使用了一组固定的、预定义的构建模块。想象一本永不改变的词典;网络只需学习如何将这些词汇组合成句子,而不是试图即时发明新的字母。通过将每一个连接锚定在这个稳定的词典中,研究人员确保了计算机求解的数学问题始终是平滑且可预测的,从而避免了旧模型中出现的突然崩溃和进度丢失。这种方法允许系统在不忘记已学知识的情况下变得更大、更详细,而这在以前这类网络中是不可能实现的。

这项创新不仅限于稳定性。研究人员将整个系统提升到了一个复杂的数学空间中,使网络能够自然地理解不同变量是如何相互乘积并产生交互作用的。在之前的版本中,系统必须通过沉重且低效的计算来强制学习这些交互。在这里,结构本身处理了乘法,使得学习过程更加高效。这种设计还包含了一种独特的精细化方法。当网络需要变得更加精确时,它可以在现有层之间插入新的细节层,而不会干扰已经完成的工作。新部分从零影响力开始,确保网络在扩展前后的输出完全保持一致,从而有效地消除了“灾难性遗忘”问题,即学习新事物时抹去了旧知识。

为了确保这些主张不仅仅是理论上的希望,研究人员对核心逻辑进行了严格的机器验证检查。通过一个专门设计的用于证明数学真理的计算机程序,优化理论的每一步都在特定条件下被验证为正确。计算机确认该系统具有唯一的、最优的解,并且用于寻找该解的方法总能收敛到该解,而不会陷入停滞。这种确定性在领域内是罕见的,因为许多理论都依赖于难以证明的假设。这些验证结果随后在了一系列现实世界的模拟中接受了测试。在涉及多个变量交互的任务中,新系统比标准的稠密模型高出二十倍,以极少的资源实现了更高的准确度。

该系统还展示了卓越的科学发现能力。当被要求识别受空气阻力影响的摆钟运动规律时,网络成功分离出了正确的物理变量,包括其他模型忽略的微弱阻尼力。同样,在被要求揭示被称为 Burgers 方程的流体力学问题背后的方程时,即使它必须自行发明必要的乘法项,它也以不到 1% 的误差重建了正确的数学关系。在一次实际应用中,研究人员训练该网络模拟光线从粗糙金属表面反射的方式,这是一项对于实现逼真计算机图形至关重要的任务。生成的模型非常简洁且具有结构性,以至于它可以直接转化为一段简短的、人类可读的计算机程序,从而不再需要沉重的神经网络软件。

然而,这项研究并非没有局限性,作者也以同样的清晰度报告了这些局限。当系统在处理具有剧烈跳变的数据(如阶跃函数)时,表现出了一个已知的弱点,即“振铃效应”(ringing),即输出会在锐利的边缘附近发生轻微振荡。虽然新系统在这些特定情况下比之前的版本处理得更好,但仍无法达到比简单旧模型更高的精度。此外,机器验证提供的数学保证依赖于某些条件的满足(例如数据具有特定的结构),这意味着该理论并非对所有可能的数据集都有普遍的保证。研究人员明确指出,该系统并非旨在成为记录每一个细节的完美记忆,而是一个理解和精炼复杂关系的工具。

这项工作代表了使人工智能变得更加可靠和高效的重要进步。通过用固定的函数词典取代不稳定的连续网格,研究人员解决了阻碍此类网络发展的长期优化悖论。这种在不遗忘的情况下扩展网络的能力、发现物理定律的高精度能力,以及将最终结果编译为简单代码的能力,预示着一个系统不仅强大而且可理解且实用的未来。这些发现并非被呈现为所有问题的最终答案,而是作为一个稳定的基础,可以在其之上构建更先进的版本,其核心理论已被机器验证为在数学上是稳健的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →