← 最新论文
💻 computer science

Distributional Neurons: Making Uncertainty a Unit of Computation

本文介绍了 EVE,一种将不确定性视为计算原语并通过传播分布式潜状态进行处理的变分神经元,证明了这种神经元层面的方法在保持具有竞争力的点准确率的同时,能够提升密集 MLP 和 Transformer 架构中的不确定性校准能力与性能。

原作者: YVES RUFFENACH

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: YVES RUFFENACH

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

脑细胞的秘密生活

想象一下,你正试图教一台计算机识别照片中的猫。你构建了一个由被称为“神经元”的微小、简单处理器组成的数字大脑。在这些数字大脑的标准版本中,每个神经元都像是一个刻板、专一的机器人。它接收信息,进行计算,然后吐出一个单一、确定的答案:一个特定的数字。如果这个机器人说“0.8”,那就是它所知道的唯一真相。它不知道自己是在猜测,还是照片很模糊,或者它只是今天心情不好。这是一个绝对确定性的世界,即便现实世界充满了混乱。

但现实生活充满了“也许”。当你看着雾气中模糊的形状时,你看到的不仅仅是“猫”或“不是猫”;你会感到一丝不确定。科学家们长期以来一直试图教会计算机这种不确定性,通常是通过摇晃整个大脑,或者在最后阶段添加额外的怀疑层。然而,一项新的研究表明,我们可能看问题的角度错了。与其让整个大脑变得不确定,如果我们将这些微小的、单个的构建模块本身变得不确定呢?这项研究提出了一个简单而有趣的疑问:如果数字大脑中的每一个神经元不再是僵硬的机器人,而是一个在口袋里揣着好几种不同可能性的“小赌徒”,会怎样?

认识 EVE:保留选择余地的神经元

在这篇论文中,研究人员 Yves Ruffenach 介绍了一种新型数字神经元,称为 EVE。把标准神经元想象成一个每次都冲压出特定零件的工厂工人。相比之下,EVE 就像是一个不仅冲压一个零件,而是创造出一整盒略有不同的版本,随机挑选其中一个,然后用它来构建下一层的工人。

论文称之为“分布式神经元”(distributional neuron)。EVE 不再传递一个单一的数字(比如 5.0),而是传递一个“分布”——一团可能的数字云。它通过拥有一个内部的“后验”(posterior,一个表示其当前对真相最佳猜测的专业术语)和一个“先验”(prior,它认为普遍可能的情况)来实现这一点。它从这团云中采样一个随机的“潜在状态”(latent state),利用该随机状态进行工作,然后将结果传递下去。至关重要的是,神经元通过“KL 正则化”(KL regularization)惩罚项来保持其内部猜测的诚实,这就像一位老师在温柔地训诫神经元,防止它在没有充分理由的情况下开始胡乱猜测。

该研究通过三个不同的阶段测试了这一想法,就像科学家先观察单个细胞,然后构建一个完整的器官,最后将其放入一台复杂的机器中。

第一阶段:显微镜下的观察
首先,研究人员隔离了一个单独的神经元,以观察它在独立时能做什么。他们设置了一个游戏,目标是预测带有特定变化程度“噪声”(随机性)的数字。他们将 EVE 与三种其他类型的神经元进行了对比:

  1. 一个标准的、枯燥的确定性神经元(即那个僵硬的机器人)。
  2. 一个“匹配的”确定性神经元,它拥有相同的计算能力但没有随机性。
  3. 一种特殊的“异方差”(heteroscedastic)神经元,它被明确告知要在最后阶段预测不确定性。

结果非常迷人。标准的机器人虽然能猜对数字,但在了解自己有多不确定方面表现糟糕。那个“匹配的”机器人也同样不确定。但 EVE 呢?它简直是个明星。虽然它在猜测数字的准确度上与强大的匹配机器人不相上下,但它在追踪真实不确定性方面表现得极其出色。事实上,它在 93.9% 的时间内都与真实的噪声模式保持一致,而标准的机器人几乎接近于零。EVE 证明了单个神经元可以学会将不确定性保留在自身内部,而不只是在输出端。

第二阶段:深层堆叠
接下来,研究人员问道:“如果你把 128 个这样的神经元堆叠在一起,这套方法还奏效吗?”他们构建了一个庞大的深层神经网络(128 层深,每层 128 个神经元)来预测建筑物的能源效率。这是一个真正的“组合性”(composition)测试:这些不确定的神经元能否协同工作而不会导致整个系统陷入混乱?

答案是肯定的,“但有一个前提条件”。当他们在深层网络中进行测试时,EVE 显著提高了模型处理不确定性的能力。它将“负对数似然”(Negative Log Likelihood,衡量模型预测整个可能性范围能力的得分)降低了约 18.8%,并在所有五次测试运行中,将其他不确定性得分提高了 4.5% 到 8.3%。然而,在仅仅预测精确数字方面(通过 MSE 和 MAE 衡量),EVE 与标准机器人大致相当,有时稍好,有时稍差。最大的胜利在于,这种“不确定性”并没有随着信号穿过 128 层而消失;它保持了生命力且可测量。研究人员同时也指出,这带来了一个代价:由于需要进行所有的额外采样和数学运算,EVE 的运行速度慢了约 7.1 倍。

第三阶段:Transformer 之桥
最后,研究人员尝试将 EVE 融入到现代的“Transformer”架构中——这类架构是像那些能写文章或与你聊天的语言模型所使用的“大脑”。他们用 EVE 神经元替换了 Transformer 中的标准“前馈”(feed-forward)部分,并要求它预测故事中的下一个词(使用名为 PG-19 的数据集)。

结果表明,EVE 确实可以被插入到这些复杂的现代系统中。由 EVE 驱动的 Transformer 提高了预测下一个词的能力(将“困惑度/perplexity”从 189.74 降至 161.94),并且在猜对单词方面表现更好(准确率从 0.1938 提升至 0.2064)。它还产生了“非退化的蒙特卡洛不确定性信号”(non-degenerate Monte Carlo uncertainty signals),这是一种高级说法,意味着当模型被要求多次进行猜测时,它会给出不同且有趣的答案来反映其不确定性,而不是仅仅重复同一个猜测。然而,研究发现,这种“不确定性”主要发生在网络的第一个层级;更深层的层级尚未完全发挥其潜力。

这意味着什么(以及并不意味着什么)

论文指出,将不确定性作为一种基本的计算单元——直接置于神经元内部——是一个可行且强大的想法。它表明你可以隔离这种行为,构建带有这种特性的深层网络,甚至将其插入到最先进的语言模型中。

然而,作者们谨慎地表示,这并不是一个“灵丹妙药”。他们明确排除了这仅仅是因为拥有更多计算能力的观点;因为一个具有相同计算能力的标准神经元并没有得到同样的结果。他们还注意到,虽然 EVE 在处理不确定性方面表现出色,但在仅仅追求“正确”预测精确数字方面并不总是胜出。在深层网络测试中,标准误差率(MSE 和 MAE)非常接近,有时标准模型甚至略好。此外,研究承认目前的版本运行速度较慢,且在 Transformer 实验中的“不确定性”在各层之间的平衡尚不完美。

简而言之,EVE 表明,如果我们希望计算机理解世界的混乱,我们不应该只是在最后添加一个“怀疑”按钮。我们应该教会微小的构建模块本身保留几种不同的可能性,从中采样,并学会接受未知。这是构建数字大脑方式的一个微小且有趣的转变,但它或许能帮助它们像我们一样看待这个世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →