想象一下,你正试图制造一台能够模仿你在纸上画出的任何形状、曲线或图案的机器。在数学和计算机科学领域,这被称为“通用近似”(universal approximation)。大多数现代人工智能模型(如神经网络)是通过堆叠简单的开关(即通过控制开关的开启或关闭)来实现这一点的。
这篇论文介绍了一种由一种特殊的数学“乐高积木”——EML(代表 Exp-Minus-Log,即指数减对数)构建出的不同类型的机器。
以下是作者所做工作的拆解,使用了简单的类比:
1. 神奇的积木:EML
把 EML 函数想象成一个结合了两种强大力量的通用工具:指数(增长极快,就像滚下山坡的雪球)和对数(将事物缩小,就像望远镜向后缩放)。
作者发现,如果你使用这个特定的工具并结合一些可调节的旋钮(参数),你就可以构建出你能想到的任何基础数学函数——加法、乘法、幂运算,甚至是像正弦波这样复杂的曲线。这就像拥有一种单一类型的乐高积木,只要你知道正确的指令,就可以用它来搭建汽车、房子或宇宙飞船。
2. 构建方式:构建树状结构
作者并没有将这些积木像标准神经网络那样堆叠成一条直线,而是将它们排列成一种树状结构。
- 类比: 想象一棵家族树。底层是叶子(你的输入数字)。当你沿着树枝向上移动时,EML 积木会对这些数字进行混合与匹配。在最顶端(树干处),你得到了最终结果。
- 主张: 论文从数学上证明了,无论曲线多么扭曲或复杂,你都可以构建一棵由这些 EML 积木组成的树,使其几乎完美地匹配那条曲线。
3. “棘手”之处:对数的“洞”
这里有一个陷阱。EML 积木中的对数部分讨厌零和负数。如果你尝试向它输入零或负数,数学逻辑就会崩溃(就像尝试除以零一样)。
- 解决方案: 作者证明了,只要你保持在“安全区域”(大于零的数字),这棵树就能完美运行。
- 变通方法: 为了处理安全区域的边缘(例如数字 0 本身),他们提出了一个聪明的技巧:他们将整个问题稍微缩小,使其完全落在安全区域内,在其中进行求解,然后再将其拉伸还原。这确保了即使在边界处,数学逻辑依然成立。
4. 蓝图 vs. 现实
这篇论文主要做了两件事:
- 蓝图(理论): 他们编写了一个严密的数学证明,表明如果遵循他们特定的指令,你可以构建出一棵能够以保证精度近似任何光滑函数的树。他们甚至精确计算了这棵树需要多大、多深才能完成任务。
- 现实检验(实验): 他们尝试让计算机利用数据(通过学习示例而非遵循蓝图)来学习构建这些树。
- 结果: 计算机非常擅长学习曲线的“形状”。它可以高精度地模仿目标函数。
- 转折: 然而,计算机并没有重新发现那些简洁、直观的“符号化”指令(例如 x2+1),而是找到了那些虽然看起来很乱但同样有效的复杂数字组合。这就像一位厨师可以完美地复制一道名菜,但他使用的却是一套看起来与原版食谱完全不同的秘密且复杂的配方。
总结
论文确立了 EML 树是近似复杂数学函数的理论完美工具。他们证明了如果构建得当,这些树可以模拟任何光滑曲线。虽然计算机的学习实验表明它们在实践中效果很好,但目前“学习到”的版本与其理论所暗示的整洁、可读的公式相比,更像是黑盒。
简而言之: 他们证明了你可以使用这些特定的积木构建出一个完美的数学“变形金刚”,并且他们展示了计算机确实可以学会使用它们,即便计算机的版本与纯粹的理论设计相比显得有些凌乱。
技术摘要:EML 树是通用近似器
问题陈述
本文探讨了最近引入的指数-减-对数(Exp-Minus-Log, EML)函数的树状结构组合是否具有足够的表达能力,能够作为光滑函数的通用近似器。虽然之前的研究 [22] 已经证明,通过显式的符号构建,EML 组合可以精确表示任何初等函数(包括三角函数和指数函数),但关于这些结构能否在带有可量化误差界限的 Sobolev 空间 Wk,∞ 中近似任意函数,仍是一个开放的理论问题。此外,本文还研究了配备可学习参数的广义 EML 函数是否可以在连续参数空间中进行有效的优化,这与先前文献中探索的离散符号恢复有所不同。
方法论
作者通过一种结合局部多项式近似与显式代数表示的构造性证明策略,为 EML 树开发了一套严谨的近似理论。
- 广义 EML 函数: 研究引入了一个广义 EML 原子,EMLθi(x,y)=aiebix+ci+diln(eiy+fi),每个单元包含六个可学习参数。这种泛化允许直接编码系数,从而避免了从数字 1 递归构建常数的需求,否则会导致树规模出现极差的缩放问题。
- 构造性近似框架: 通用近似定理的证明依赖于一个三步过程:
- 局部化(Localization): 将定义域 (0,1]d 划分为小的立方体。利用 Bramble–Hilbert 引理,在重叠的立方体上为目标函数构建局部多项式近似项。
- 平滑化(Smoothing): 为了避免使用指示函数拼接局部多项式时产生的间断性,作者使用平移和缩放的双曲正切(tanh)函数构建了一个光滑的“近似单位分解(approximate partition of unity)”。
- 显式构造(Explicit Construction): 作者证明了所需的代数运算(加、减、乘、除、幂运算)以及 tanh 函数本身都可以由 EML 树精确表示。通过组合这些“模块”,他们构建了一个能够精确表示全局平滑多项式近似的 EML 树。
- 处理奇异性(Handling Singularities): 由于自然对数在非正参数下未定义,理论结果最初是在半开区间 (0,1]d 上建立的。作者通过将近似器与一个将定义域推入内部的仿射收缩映射(affine contraction mapping)进行组合,将这些结果扩展到了闭区间 [0,1]d,从而控制了边界效应。
- 实证验证: 作者实现了一种使用基于梯度的优化算法(先 Adam 后 L-BFGS)来学习 EML 型树的算法。他们在五个一维基准函数上测试了模型,并对比了实值参数化与复值参数化的表现。
核心贡献
- 通用近似定理: 本文证明了 EML 树是 Sobolev 空间 Wk,∞((0,1]d) 中函数的通用近似器。该定理为实现特定近似误差所需的 EML 树的大小(原子数量)和深度提供了显式上界,其规模随维度 d 和误差倒数呈多项式级缩放。
- 向闭域的扩展: 通过利用仿射收缩来避免零点处的对数奇异性,一个推论将近似保证扩展到了闭立方体 [0,1]d。
- 广义参数化: 引入六参数广义 EML 函数促进了算子的更紧凑表示,并实现了直接的系数编码,这对于构造性证明和实际优化至关重要。
- 算子的显式构造: 本工作提供了使用 EML 树表示初等运算(加法、乘法等)及 tanh 函数的详细构造,建立了近似理论所需的组合构建模块。
结果
- 理论层面: 本文确立了对于任何 f∈Ws,∞([0,1]d),存在一个 EML 树 p~Nθ,使得在 Wk,∞ 范数下的近似误差以 O(N−(s−k)) 的速度衰减,其中 N 与定义域划分的分辨率相关。树的大小和深度受维度 d、光滑度 s 以及目标分辨率函数的限制。
- 实证层面: 在针对一维目标(多项式、tanh、sin、高斯函数和调制正弦波)的实验中,广义 EML 树在固定的计算预算内,在深度为 4 时,在大多数目标上达到了低于 1% 的相对 RMSE。
- 实值参数化足以应对多项式和双曲正切目标。
- 复值参数化对于高度振荡的目标(例如 sin(3x)e−x2/2)提供了明显的优势,这可能是由于其能够通过欧拉恒等式精确表示三角函数。
- 可解释性局限: 一项“贪婪捕捉(greedy snap)”分析显示,学习到的连续参数并未坍缩到构造性证明所预测的离散符号配置(例如 {0,±1})。只有极小比例的参数捕捉到了离散值,且没有原子完全变为离散形式。这表明,虽然树可以精确近似函数值,但它们不一定会恢复理论证明中所衍生的特定符号结构。
意义与主张
本文声称将 EML 树确立为一个“具有理论基础的函数近似框架”。通过架起初等函数表示的符号精确性与连续参数统计学习之间的桥梁,这项工作为 EML 架构的表达能力提供了严谨的辩护。
作者对其实证结果的实际意义保持谦逊。他们明确指出,本研究旨在作为对 EML 树实际能力的“合理性检查(sanity check)”,而非对近似定理收敛速率的全面验证。他们承认,学习到的模型作为连续近似器而非符号重建器运行,并指出若要恢复离散符号结构,则需要额外的结构正则化或归纳偏置,这属于未来的研究课题。这项工作将 EML 树与神经网络、物理信息神经网络(PINNs)及符号回归领域中关于通用近似的广泛文献联系起来,将其定位为一种可解释且具高表达力的函数近似替代方案。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。