← 最新论文
📊 statistics

On the Epistemic Uncertainty of Overparametrized Neural Networks

本文挑战了“随着数据增加,认知不确定性会消失”的传统观点,通过证明在过参数化神经网络中,由对称性和冗余表示引起的不可识别性会导致参数不确定性持续存在,即使底层函数已被完全识别,作者在一层隐藏层的 ReLU 网络中对此现象进行了理论分析并通过实证加以验证。

原作者: David Rügamer

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: David Rügamer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对论文《过参数化神经网络的认知不确定性》的解释。

核心理念:“多把钥匙,一扇门”问题

想象你有一把非常复杂的锁(现实世界的问题)和一个挂着成千上万把钥匙的巨大钥匙串(神经网络)。通常我们认为,如果有足够的数据,我们就能找到那把唯一完美的钥匙来打开锁,并且会 100% 确信自己找到了它。

这篇论文指出,对于现代“过参数化”的神经网络(拥有远超必要数量的钥匙),事实并非如此。即使拥有无限的数据,你也可能永远无法确切知道手中握着的究竟是哪一把特定的钥匙。你只知道门已经打开了

作者将这种现象称为认知不确定性(关于我们所知内容的确定性)。他们表明,即使网络完美地知道答案,它仍然对“如何”得出该答案感到困惑,因为存在多种构建相同解决方案的方式。


类比 1:乐队指挥(置换对称性)

想象一位指挥家正在领导一个乐团。音乐(预测)完美无缺。

  • 问题所在:小提琴声部有 100 名演奏者。如果第 1 号演奏者与第 50 号演奏者互换座位,音乐听起来完全一样。
  • 困惑之处:如果你问指挥家:“谁在拉第一小提琴?”他回答:“是第 1 号演奏者。”你可能会认为他 100% 确定。但实际上,第 50 号演奏者可能一直在扮演这个角色,而音乐依然完美。
  • 论文的发现:在标准统计学中,我们假设通过足够的练习(数据),指挥家将确切知道谁坐在哪里。但在这些巨型网络中,即使音乐 flawless(完美无瑕),指挥家也永远无法确定座位表。关于在演奏(参数)的不确定性依然存在,尽管乐曲(函数)已被完美掌握。

类比 2:披萨切片(连续不可识别性)

现在,假设网络比必要的还要大。它拥有额外的“神经元”(额外的厨师),这些并非严格必需。

  • 场景:你需要烤一个披萨,恰好需要 100 克奶酪。
  • 困惑之处
    • 场景 A:一位厨师在披萨上放了全部 100 克奶酪。
    • 场景 B:两位厨师各放 50 克。
    • 场景 C:十位厨师各放 10 克。
    • 场景 D:厨师 A 放 99 克,厨师 B 放 1 克。
  • 论文的发现:网络可以通过在额外厨师之间以无限种不同的方式分配“奶酪”(权重),来实现完全相同的披萨(相同的预测)。
    • 与乐队中人们仅仅互换座位不同,这里的厨师们不断争论如何分配奶酪。
    • 论文证明,即使拥有无限数据,网络也不会固定在一种特定的奶酪分配方式上。相反,它会在一个“流形”(可能性的平滑曲面)上游走,在这个曲面上,奶酪的总量始终是 100 克,但个体的分配量却不断变化。

这为何重要?(“为何常用指标失效”部分)

通常,当科学家衡量模型有多“不确定”时,他们会观察输出的变化程度。

  • 旧观点:“如果模型每次给出的答案都一样,那它就不存在不确定性。”
  • 论文观点:“那是错的。模型可能给出相同的答案,但其内部齿轮(权重)却正以不同的方向疯狂旋转。”

作者表明,如果你只关注最终答案(披萨),你就会忽略内部机制是混乱的这一事实。如果你需要知道模型如何工作(用于调试、压缩或理解哪些特征很重要),而不仅仅是答案是什么,这就至关重要。

他们做了什么?

  1. 理论:他们利用数学证明,对于简单的神经网络(ReLU 网络),这种“分配”和“互换”会在模型的“大脑”内部制造出一种永久性的不确定性迷雾,即使模型在其工作上表现完美。
  2. 数学:他们用称为流形的形状来描述这种迷雾。想象它像是一张漂浮在三维房间里的平滑纸片。模型的权重可以在那张纸片上的任何位置滑动,而不会改变结果。
  3. 实验:他们构建了这些网络并在计算机上运行。他们观察了“权重”(内部数值)的移动。
    • 结果 1:随着看到更多数据,网络在预测方面变得更好。
    • 结果 2:但内部权重从未停止移动。它们继续在那些“纸片”(流形)上滑动并互换位置,证明了对内部结构的不确定性从未消失。
  4. 采样问题:他们还研究了计算机如何尝试“探索”这些网络(使用一种称为 MCMC 的方法)。他们发现,如果你从一种特定的“座位安排”(一种置换)开始计算机模拟,它通常会卡在那里,永远无法跳跃到其他等效的安排,尽管它们都是有效的。这意味着标准的计算机方法可能会错过不确定性的全貌。

结论

该论文声称,过参数化神经网络对其自身的内部结构存在一种隐藏的、永久性的不确定性

  • 函数空间(输出):模型变得确定。它知道答案。
  • 参数空间(内部权重):模型仍然不确定。它不知道自己是使用哪一种特定的数字组合来得出该答案,因为有数百万种同样优秀的组合。

这就像一位大师级厨师能烹饪出一道完美的菜肴,但如果你问他:“你是用了 2 茶匙盐,还是 1 茶匙盐加 1 茶匙酱油?”他无法告诉你,因为两种食谱尝起来完全一样。论文认为,我们不能仅仅因为食物味道好,就假装厨师知道确切的食谱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →