← 最新论文
🤖 machine learning

Expressive Power of Floating-Point Neural Networks with Arbitrary Reduction Orders and Inexact Activation Implementations

本文建立了一个通用的可区分性框架,以刻画浮点神经网络在真实执行语义下的通用可表示性,证明激活函数实现中的任意归约顺序和有界单位最后一位误差并不妨碍对一大类实用激活函数的精确函数表示。

原作者: Yeachan Park, Geonho Hwang, Wonyeol Lee, Sejun Park

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yeachan Park, Geonho Hwang, Wonyeol Lee, Sejun Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将神经网络想象成一座巨大而复杂的工厂,旨在将原材料(数据)分拣并转化为成品(答案)。几十年来,这些工厂的蓝图由数学家绘制,他们假设工厂拥有完美的工具。他们假设,如果你将两个数字相加,结果总是完全正确的,并且工厂的“激活开关”(决定信号传递多少的部分)能以绝对、精确的数学方式运作。

然而,现实世界的计算机并不使用完美的工具。它们使用浮点运算,这就像一家使用略微磨损的尺子的工厂。当你相加数字时,相加的顺序可能会改变结果(因为尺子并不完美),“激活开关”可能并未设置在精确的理论位置上——它们可能偏离了头发丝宽度的极小一部分。

这篇论文提出了一个关键问题:如果我们用这些不完美的、现实世界的工具来构建神经网络工厂,它是否仍然能够完成我们需要它做的一切? 具体来说,它是否仍然能够学习表示任何可能的模式或函数,还是说这种不完美会打破这种魔力?

以下是他们发现的分解,使用了简单的类比:

1. “运算顺序”问题

在完美的世界里,数字相加就像堆叠积木:无论你先在 B 上堆 A 再堆 C,还是先在 C 上堆 B 再堆 A,塔都是一样的。
在现实世界(浮点数)中,顺序很重要。这就像试图在一个略有渗漏的桶里混合颜料。如果你先倒红色颜料,再倒蓝色,得到的色调会与先倒蓝色再倒红色略有不同。

  • 论文发现: 作者证明,即使工厂使用任何随机顺序来混合这些颜料(相加数字),只要“激活开关”足够好,网络仍然可以学习任何东西。你不需要固定、完美的顺序来完成任务。

2. “可区分性”测试

为了理解工厂如何分拣物品,想象你有两个外观非常相似的苹果(输入 A 和输入 B)。

  • 问题: 如果工厂的第一台机器(第一层)将两个苹果都压成完全相同的形状,工厂的其余部分将永远无法知道它们原本是不同的。它将永远把它们当作同一个苹果处理。
  • 论文解决方案: 作者引入了一条称为**“可区分性”*的规则。他们证明,为了使网络成为“通用”学习者(能够做任何事),其第一层必须能够区分每一对*不同的输入。如果第一层无法区分两个不同的输入,整个网络就会失败。
  • 好消息: 他们表明,大多数常见的激活函数(如 ReLU、Sigmoid、Tanh、Swish 等)即使在不完美的数学运算下,能够区分输入。

3. “不完美开关”问题

理论上,开关可能在输入达到 0.5 时正好开启。实际上,由于制造限制,开关可能在 0.5000001 或 0.4999999 时开启。

  • 论文发现: 先前的理论认为,“如果开关不完美,网络可能会崩溃。”这篇论文说:“不一定。”
  • 他们证明,只要“不完美”(误差)很小且有界(例如仅偏离几个微小单位,或称为"ulps"),网络仍然可以区分输入并学习任何东西。
  • 结果: 他们确认,现实生活中广泛使用的激活函数——如Sigmoid、Tanh、ReLU、GELU、Swish,甚至 Sin——都足够稳健,即使其计算机代码实现并非数学上完美,也能完美工作。

4. “余弦”反例

作者还发现了一个工厂确实会崩溃的具体情况。他们表明,如果你使用余弦激活函数(像波浪一样上下波动),网络可能无法区分某些输入,因为波浪会重复自身。这就像一家工厂,其中两个不同颜色的球被涂成了完全相同的蓝色,因为油漆机循环颜色的速度太快。

  • 这解释了为什么某些理论函数在数学课上有效,但在实际的计算机代码中却会失败。

总结:核心要点

这篇论文本质上说的是:“不要担心计算机数学中的微小误差。”

尽管现实世界的计算机存在:

  1. 不完美的尺子(舍入误差),
  2. 改变结果的混合顺序(非结合性加法),
  3. 未完美校准的开关(不精确的激活实现),

……但使用这些工具构建的神经网络仍然强大到足以表示你抛给它们的任何函数,只要你使用标准的激活函数(如 ReLU 或 Sigmoid)。神经网络的“魔力”在从完美的数学理论过渡到混乱的现实世界工程时依然幸存。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →