← 最新论文
📊 statistics

Limitations of Learning Tanh Neural Networks with Finite Precision

本文表明,在有限精度约束下,包含局部凸起函数(bump functions)的 tanh\tanh 神经网络的学习过程本质上被限制在蒙特卡洛收敛速率,除非采样预算随网络规模呈指数级增长,从而将已知的从 ReLU 网络到 tanh\tanh 设置的局限性进行了扩展。

原作者: Philipp Grohs, Matěj Trödler

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Philipp Grohs, Matěj Trödler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一台计算机去识别一个隐藏在巨大、黑暗房间里的非常特定且微小的秘密。这台计算机是一个“神经网络”,一种通过观察示例来学习的 AI 类型。在这篇论文中,作者研究了一种使用名为 tanh(双曲正切)的数学工具来处理信息的特定 AI。这个工具是平滑且弯曲的,不像许多其他 AI 使用的 “ReLU” 工具那样,后者更像是一个锐利的开关。

作者提出了一个根本性的问题:假设计算机具有观察极小数值的有限能力,它需要多少个“样本”(或“窥视”)才能完美地学习到这个秘密?

以下是他们研究结果的分解,使用了简单的类比:

1. “模糊视觉”问题(有限精度)

想象计算机戴着一副略微模糊的眼镜。如果一个数字比一粒微小的尘埃(我们称之为“机器精度”)还要小,计算机的眼镜就会将其完全模糊化,它会将其视为 。它无法区分微弱的低语和完全的寂静。

作者表明,由于这种“模糊视觉”,计算机面临着巨大的障碍。除非那个“凸起”大到足以穿透迷雾被看见,否则它无法区分一个在任何地方都真正为零的函数,与一个在角落里隐藏着微小、尖锐“凸起”的函数。

2. “隐形凸起”的构建

作者构建了一个特殊的数学技巧来证明他们的观点。他们创造了一个“凸起”函数(一小堆数据),它具有以下特征:

  • 中心部分高而尖(因此拥有大量的“质量”或重要性)。
  • 边缘部分呈指数级变薄

因为边缘变薄的速度如此之快,它们最终会变得如此微小,以至于计算机的“模糊眼镜”会将它们变成零。对计算机而言,除了一个微小的、不可见的点之外,这个凸起看起来就像是一个平坦、空旷的地板。

3. “大海捞针”游戏

现在,想象你在玩寻找这些隐藏凸起的游戏。

  • 设置: 你有一个巨大的房间(数据空间)。你可以投放有限数量的“传感器”(样本)来检查是否存在凸起。
  • 陷阱: 作者证明了,如果凸起是以利用计算机“模糊视觉”的方式隐藏起来的,你可以把成千上万个这样的凸起藏在房间里。
  • 结果: 即使你投放了大量的传感器,这些传感器也极有可能一个都落不到那些凸起实际存在的微小、隐藏点上。你的传感器读数都会显示为“零”(因为在这些微小的中心之外,凸起对它们来说是不可见的)。

4. “指数级成本”

这引出了论文的核心结论:学习的成本极其昂贵。

在 ReLU 网络(那些锐利的开关)的世界里,学习所需的样本量增长相对可预测。但在这些平滑的 tanh 网络中,作者发现,为了保证你能准确地学习该函数,你所需的样本量会随着网络规模的增大而呈指数级增长。

换个方式理解:

  • 如果你想学习一个小型的网络,你可能需要 10 个样本。
  • 如果你把网络稍微做大一点,你可能需要 100 个样本。
  • 如果你再做大一点,你可能需要 1,000,000 个样本。
  • 如果你仅仅是再稍微做大一点点,你可能需要的样本量会超过宇宙中的原子总数。

5. “不稳定的真相”

论文还强调了一种可怕的不稳定性。他们展示了你可以拥有两个看起来对计算机而言完全相同的函数(因为它们的差异小于“模糊眼镜”所能看到的范围),但实际上它们是完全不同的(一个有大凸起,另一个没有)。

即使你拥有完美的算法,由于计算机无法看到这些微小的差异,这意味着它永远无法是稳定的。输入的微小、不可见的改变可能会导致输出产生巨大且不可预测的变化。这就像是在震动的桌子上搭建纸牌屋;无论你的手有多稳,桌子的震动(有限精度)都会让稳定的结构变得不可能。

总结

论文认为,对于平滑、弯曲的神经网络(tanh),有限精度充当了一道硬墙。 它阻止了计算机学习具有尖锐、局部特征的函数,除非你愿意向这个问题投入天文数字般的样本量。在许多现实场景中,这使得学习这类特定网络在计算上是不可能实现的——这并非因为数学本身太难解决,而是因为在计算机的“模糊眼镜”将其模糊掉之前,你根本没有足够的“眼睛”(样本)去观察细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →