Do Neural Networks Really Beat the Curse of Dimensionality? A Bit-Complexity View
本文认为,当通过计算比特复杂度而非参数量来评估逼近效率时,没有任何方法能从根本上超越由度量熵所设定的内在极限,这揭示了感知到的神经网络优势往往源于函数类复杂度的差异而非架构本身的优越性,并将传统的“维度诅咒”重新定义为更为根本的“比特复杂度诅咒”。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图向一位朋友描述一个复杂的高维物体——比如一个旋转的星系,或者一个多层蛋糕——而这位朋友只能理解简单的平面图。在计算机科学和数学领域,这被称为“高维近似问题”。几十年来,科学家们一直在与一个可怕的敌人作斗争,这个敌人被称为“维度诅咒”。这个名字听起来很吓人,但其核心思想很简单:随着问题中变量(或维度)数量的增加,准确描述该问题所需的信息量会呈爆炸式增长。这就像是在尝试画一幅一百维物体的画;所需的笔触数量增长得如此之快,以至于这项工作似乎根本无法完成。
长期以来,衡量计算机解决这些问题的标准方法是计算“参数”。把参数想象成机器上的旋钮、拨盘和设置。如果一种方法使用更少的旋钮就能达到同样的结果,它就被认为更高效。最近,神经网络(驱动图像识别和语言模型等 AI 系统的系统)因其似乎打破了这种诅 easily 诅咒而受到赞誉。它们似乎能用一个不随维度增长而爆炸的旋钮数量来解决高维问题,这让许多人相信它们已经找到了开启科学中最复杂问题的万能钥匙。
然而,这里有一个经常在兴奋中被忽视的陷阱。在现实世界中,计算机并不能以无限的精度存储数字;它们将数字存储为 0 和 1 的字符串,即“比特”(bits)。机器上的每一个旋钮都需要被编码成特定数量的比特才能进行存储和计算。本文提出了一个基本问题:如果我们停止仅仅计算旋钮的数量,转而开始计算存储这些旋钮实际所需的比特数,神经网络看起来是否依然如此神奇?作者佟茂(Tong Mao)和徐进超(Jinchao Xu)深入探讨了这个问题,利用一个叫做“度量熵”(metric entropy,本质上是衡量描述一个形状或函数所需的最小信息量)的概念,来观察神经网络是真的战胜了诅咒,还是仅仅以另一种方式隐藏了成本。
大比特计数劫案
论文的作者佟茂和徐进超决定戴上侦探帽,从一个新的角度审视“维度诅咒”。他们没有仅仅计算一个方法使用了多少个参数(旋钮),而是问道:“存储这些旋钮并获得正确答案实际上需要多少比特的内存?”
为了理解他们的调查,请想象你正在尝试向一个机器人描述一座平滑起伏的小山丘。
- 旧方法(计算参数): 你可能会说:“我需要 100 个点来描述这座小山。”如果你换成一种新方法,比如神经网络,并说:“我只需要 10 个点。”你会觉得自己赢了。你战胜了诅咒!
- 新方法(计算比特): 但等等。如果这 10 个点极其敏感呢?如果为了准确描述小山的形状,这 10 个点中的每一个都需要以极高的精度来存储——比如每个点需要 1,000 个比特?突然间,你使用的不是 10 个信息单位,而是 10,000 个。与此同时,旧方法虽然使用了 100 个点,但每个点只需要 10 个比特。最终,旧方法实际使用的总比特数反而更少。
论文指出,长期以来,我们一直被“参数计数”所蒙蔽。我们看到神经网络使用更少的旋钮,就假设它们更高效。但当作者以“比特”(计算的实际货币)来衡量效率时,故事发生了变化。
并非如此神奇的“魔力”
研究人员研究了神经网络闻名的两种主要“魔力”:
- 维度无关速率: 一些研究声称,神经网络可以近似某些复杂的函数,而其性能不会随着维度的增加而恶化。这听起来像是它们找到了一种完全忽略问题规模的方法。
- 超收敛(Superconvergence): 这是指深度神经网络(具有许多层的网络)可以比多项式或有限元等传统方法更快地近似平滑函数。这看起来像是它们正在超越竞争对手。
作者的调查表明,这些“超能力”在很大程度上是由于我们衡量方式不同而产生的幻觉。
当他们分析度量熵(即被近似函数类的内在复杂性的专业术语)时,他们发现神经网络擅长近似的函数(如“Barron 空间”中的函数)实际上只是比传统方法难以处理的函数更简单。并不是因为神经网络是一位更好的艺术家,而是因为它被要求复制的那幅画本身就没那么精细。所谓的“维度无关”速度并不是因为网络很特殊,而是因为目标函数本身就很简单。
深层网络陷阱
最令人惊讶的发现涉及深度神经网络。这些是拥有许多层、备受关注的网络。论文表明,虽然深度网络在按参数(旋钮)数量衡量时确实可以实现更快的误差率,但这种速度伴随着一笔隐藏的税收。
因为深度网络如此复杂且敏感,其中的数值(权重和偏置)需要以更高的精度来存储,以避免误差。作者证明,随着网络变得越来越深,存储这些参数所需的比特数会呈爆炸式增长。
可以这样类比:浅层网络就像一座坚固的木桥。它需要很多木板(参数),但每块木板都易于测量和存储。深度网络则像一座玻璃桥。它使用的木板较少,但每块木板都极其脆弱且精密,以至于你需要用激光扫描仪来测量它。如果你试图用普通的卷尺(有限精度)来建造这座玻璃桥,它就会坍塌。
论文展示了,当你计算建造这座玻璃桥所需的总比特数时,那种“效率”就消失了。为了保持深度网络稳定而需要的额外比特,抵消了拥有更少参数所带来的优势。事实上,对于许多标准问题,深度网络最终所需的比特数与多项式或有限元等经典方法一样多,甚至更多。
结论:这是一种“比特”层面的诅咒
那么,神经网络战胜了维度诅咒吗?根据佟茂和徐的说法,答案是没有,至少不是以我们想象的方式。
“诅咒”其实并不在于维度的数量,而在于比特复杂度。能否很好地近似一个函数的根本限制,取决于该函数实际包含多少信息(比特)。这受“度量熵”的支配。
- 如果一个函数很复杂,无论你使用什么工具,它都需要很多比特来描述。
- 如果一个函数很简单,它需要的比特就较少。
神经网络并没有改变游戏规则,它们只是改变了计分方式。当我们通过比特而非参数的视角来看待这场游戏时,神经网络的“优越性”往往会消失。那些看似优越的特性,如维度无关速率或超收敛,通常是因为神经网络被测试的函数类本身就比传统方法测试的函数类具有更低的内在复杂度(较低的度量熵)。
这为什么重要
这篇论文并不是说神经网络没用。它是在说我们需要更聪明地去评估它们。在现实世界中,计算机拥有有限的内存。它们无法以无限的精度存储。如果一种方法因为使用了较少的参数而在理论上看起来很棒,但却需要海量的内存来精确存储这些参数,那么它在现实应用中可能并不是最佳选择。
作者指出,“维度诅咒”实际上是“比特复杂度的诅咒”。真正的限制不是你有多少个维度,而是你需要多少比特来描述这个问题。通过将我们的注意力从计算旋钮转向计算比特,我们可以得到一个更清晰、更真实的关于这些强大工具能做什么以及不能做什么的图景。这提醒我们,在高维数学的世界里,细节决定成败——而这些细节是用比特来衡量的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。