← 最新论文
🤖 machine learning

Learning from almost nothing: How neural networks survive heavy input corruption

本文表明,即使在输入数据受到超过 90% 的损坏时,神经网络仍能通过有效地实现一种通用的“最近类均值”原型规则来保持鲁棒的分类准确率,这种机制跨越了多种架构,并利用无限宽网络理论进行了解析推导。

原作者: Justin Tahmassebpur, Asadullah Bhuiyan, Hyejin Kim, Omri Lesser

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Justin Tahmassebpur, Asadullah Bhuiyan, Hyejin Kim, Omri Lesser

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人识别不同种类的水果。通常情况下,你会给它看清晰、鲜明的苹果、香蕉和橙子的照片。但在这一篇论文中,研究人员决定做一件奇怪的事情:他们把这些照片拿过来,并在上面覆盖了大量的静态噪声、模糊效果和随机像素,以至于机器人几乎看不见水果了。事实上,这些图像被破坏得如此严重,以至于人类看过去只会看到一个混乱的灰色团块。

核心问题是:当图像几乎完全被破坏时,机器人仍然能学会分辨苹果和香蕉吗?

答案,令人惊讶地是,可以。即使图像中有 90% 被替换成了随机噪声,神经网络(机器人的大脑)仍然能以很高的准确率对干净的测试图像进行分类。

以下是这篇论文如何使用简单的类比来解释这种“魔法”的:

1. “拥挤的房间”类比

想象你处在一个巨大的、嘈杂的房间里,每个人都在大声喊着随机的胡言乱语。你听不清任何一个单词。然而,如果你知道其中一组人正试图说“苹果”,而另一组人正试图说“香蕉”,你可能听不清具体的词,但你可以听到每组噪声的大致方向

研究人员发现,当输入数据受到严重破坏时,神经网络不再试图去“清理”图像或寻找特定的细节(比如苹果的果柄)。相反,它放弃了对细节的追求,开始倾听每个类别的平均声音

  • 旧的方法: “我看到了一个红色的圆圈和一个绿色的果柄;因此,它是一个苹果。”
  • 新的方法(在重度噪声下): “来自‘苹果’组的噪声与来自‘香蕉’组的噪声略有不同。我将仅仅根据当前的输入最符合哪组平均噪声模式来进行猜测。”

2. “最近邻”技巧

论文称之为**“最近类均值”“质心”**规则。

可以这样想:想象你在沙滩上有两堆沙子。一堆贴着标签“苹果”,另一堆贴着标签“香蕉”。即使你在两堆沙子上都泼了一桶随机的脏物(噪声),“苹果”那一堆的中心仍然与“香粉”那一堆的中心略有不同。

当网络看到一个新的、混乱的测试图像时,它并不尝试重建图像。它只是问道:“这个混乱的团块看起来更像‘苹果’堆的平均值,还是更像‘香蕉’堆的平均值?”

事实证明,即使图像中有 90% 是垃圾,苹果的“平均”垃圾与香蕉的“平均”垃圾仍然是截然不同的。网络只需将测试图像与这两个平均值进行比较,然后选出胜者。

3. 为什么网络的“聪明程度”并不重要

你可能会认为,一个超级复杂的深度神经网络需要非常聪明才能解决这个问题。但论文表明,在这种特定的“重度噪声”情况下,神经网络的复杂程度实际上并不重要。

无论你的网络是 3 层深还是 100 层深,或者它使用的是哪种数学函数,这一切都会坍缩为同一个简单的规则:“将输入与类别平均值进行比较。”

这就像是在说,无论你的车多么豪华,如果你正在浓雾中驾驶,看不清路面,那么唯一的安全策略就是直接朝着车道的中心线行驶。汽车的高级功能并不能提供帮助;简单的规则才救了你。

4. “匹配噪声”的惊喜

研究人员还测试了如果测试图像(机器人必须猜测的图像)本身也带有噪声时会发生什么。

  • 如果你在干净的数据上进行训练,但在噪声数据上进行测试,它会表现得很吃力。
  • 如果你在噪声数据上进行训练,但在干净数据上进行测试,它表现得很好。
  • 转折点: 如果你在噪声数据上进行训练,并在同样带有噪声的数据上进行测试,它的表现实际上比用干净数据训练时还要更好

类比: 想象你在学习玩电子游戏。

  • 如果你在没有闪烁故障的屏幕上练习,但之后玩的实际游戏有闪烁故障,你会感到困惑。
  • 如果你在带有闪烁故障的屏幕上练习,并且之后玩的也是具有相同闪烁故障的游戏,你就完美地适应了这种混乱。你学会了如何应对你所面临的特定类型的混乱。

总结

这篇论文揭示了一个反直觉的事实:神经网络对糟糕的数据具有惊人的鲁棒性(稳健性)。 当输入几乎完全是噪声时,网络不再试图做一个侦探;它变成了一个统计学家。它忽略了受损图像的个体细节,而仅仅学习每个类别的“平均形状”。只要各个类别具有不同的平均值,网络仍然可以将它们区分开来,即使在人类眼中这些图像看起来只是一堆静电噪声。

这并不是因为网络在进行“去噪”,而是因为网络的数学机制迫使它在信号过于微弱而无法做其他事情时,依赖于这些简单的平均值。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →