← 最新论文
🤖 machine learning

Interleaved Noise Injection Improves Clean, Corrupted, and OOD Performance

本文提出了一种结合梯度范数稳定化的交替噪声注入策略,该策略在理论上作为一种双重正则化机制,能以极低的计算成本显著提升模型在洁净数据、噪声数据以及分布外数据上的抗损坏能力与鲁棒性。

原作者: Matt L. Wiemann, Peter Melchior, Andrew K. Saydjari

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Matt L. Wiemann, Peter Melchior, Andrew K. Saydjari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人识别照片中的动物。你给它看一张猫的照片,它学会了耳朵的形状和尾巴的弧度。但如果照片是模糊的、被雪覆盖的,或者带有奇怪的颜色滤镜怎么办?一个仅在完美、清晰照片上训练的机器人可能会感到困惑并彻底失败。这就是机器学习的世界,在这里,计算机通过观察数据来学习。为了变得真正出色,这些计算机使用一种叫做优化(optimization)的过程,这就像是在雾气弥漫的山谷中寻找最低点的徒步旅行者。目标是找到“最佳”答案,但地形中充满了小坑(局部极小值),它们看起来像是底部,但其实并不是。为了避免陷入这些浅坑,科学家们通常会在训练数据中加入一点噪声(noise)——即随机的静电或故障。这就像是晃动徒步旅行者的腿,帮助他们从一个小洞里跌跌撞碌地爬出来,从而找到真正的谷底。长期以来,科学家们一直认为你应该随着机器人的学习,逐渐将噪声减弱到零,就像慢慢调低背景音乐的音量一样。

现在,想象一个新想法:与其逐渐调低音乐,不如快速地将其“开”与“关”切换。你播放歌曲,然后静音,然后播放歌曲,然后静音。这正是普林斯顿大学的研究人员发现的方法。他们发现,交错式噪声注入(interleaved noise injection)——一种在干净、完美的数据与杂乱、多噪的数据之间来回切换的方法——让机器人变得更聪明、更强壮,即使在照片质量很差的情况下也能更好地识别动物。他们不仅仅是靠猜测发现这一点的;他们建立了一个数学理论来解释为什么这行得通,并在著名的图像数据集如 CIFAR-100 和 ImageNet 上进行了测试。他们的结果表明,这种简单的“开关”式切换有助于计算机摆脱错误的学习习惯,而无需额外的计算能力或新数据。

让机器人更聪明的“开关”

这篇论文介绍了一种巧妙的新型训练方案,称为交错式噪声注入。把训练神经网络(机器人大脑)想象成为一场大考做准备。通常,你可能会用教科书(干净数据)学习,然后可能会做一些带有错别字的练习题(噪声数据)。传统方法会说:“先用有错别字的数据来打好坚实的基础,然后再切换到干净的教科书,”或者“从干净开始,然后慢慢加入错别字。”但作者发现这些方法都有缺陷。如果切换得太早,你会忘记干净的细节;如果切换得太晚,你会陷入定式。

相反,作者提出了一种“乒乓球”式的方案。他们在干净的数据上训练模型几个轮次(epochs),然后突然切换到覆盖了“脉冲噪声”(如椒盐噪声)或“高斯噪声”(如轻微模糊)的数据中进行一个轮次的训练,然后又切回干净的数据。他们重复这个循环:干净、干净、干净、有噪声、干净、干净、干净、有噪声。这种不断的切换就像是一个重置按钮。当模型处于噪声数据状态时,它会被从一个浅显、容易找到的解(局部极小值)中“踢”出来,被迫去寻找一个更深、更稳健的解。当它切换回干净数据时,它会记得之前学到的重要细节,因此不会忘掉一切。

为什么噪声很重要:两种“混乱”类型

论文提出了一个迷人的发现:并非所有的噪声都是一样的,不同的机器人大脑喜欢不同类型的“混乱”。

  1. 脉冲噪声(椒盐噪声): 这就像是将一张照片中的某些像素随机变成纯黑或纯白。作者发现,这种噪声最适合 ResNets(一种通过观察图像的小块局部特征来工作的机器人大脑,就像人类逐一观察面部特征一样)。脉冲噪声迫使机器人停止纠结于微小的特定像素,转而学习宏观的整体轮廓。这就像告诉学生:“不要只死记硬背每个字母的拼写;要学习整个单词的形状。”
  2. 高斯噪声(轻微模糊): 这就像是在整个图像上添加一层均匀的柔和模糊。这种噪声最适合 Vision Transformers (ViTs),它们会同时观察整张图像并尝试连接遥远的各个部分。模糊迫使这些模型停止依赖可能虚假的宏大、明显的模式(例如背景纹理),转而关注实际的局部细节。

作者展示了如果你把错误的噪声用于错误的机器人,效果并不会那么好。但如果你将噪声与机器人的“个性”相匹配,结果会非常惊人。

稳定性的魔力:不至于晕头转向

这种“开关”想法存在一个问题。当你从一张干净的照片切换到一张超级多噪的照片时,机器人的学习信号(其“梯度”)可能会变得疯狂,变得过大或过小,导致训练不稳定。为了解决这个问题,作者发明了一种**梯度范数稳定化(gradient-norm stabilization)**技术。想象一下你在开车。当你遇到颠簸的路面(噪声数据)时,你不会直接猛踩油门;你会根据你在平坦路面上的速度来调整车速。作者的方法正是如此:它根据干净数据产生的“推力”强度,来缩放噪声数据给机器人的“推力”。这保持了训练的平滑,并防止机器人脱轨。

结果:更好、更强、更快

研究人员在两个主要数据集上测试了这种方法:CIFAR-100(包含 100 类物体的一组对象)和 ImageNet(包含 1,000 类对象的庞大集合)。他们将自己的方法与其它流行的提高机器人鲁棒性的方法进行了对比,例如“Cutout”(遮挡图像的部分区域)和“AugMix”(混合不同的图像风格)。

结果令人印象深刻:

  • 干净数据: 尽管机器人花在观察完美照片上的时间变少了,但它在识别完美照片方面的表现实际上比仅在完美照片上训练的机器人还要好。
  • 受损数据: 当测试面对带有雪、模糊或数字故障的照片时,交错式噪声训练的机器人准确率显著提高。例如,在 ImageNet 数据集上,向 ResNet50 模型添加脉冲噪声,使受损图像的错误率比标准方法降低了近 2%。
  • 分布外(OOD)测试: 这是“现实世界”的测试。机器人被展示了与训练内容完全不同的图像(例如用绘画代替照片)。交错式方法在处理这些意外情况时,比几乎任何其他方法都表现得更好。

最棒的是?这种方法几乎不需要额外的成本。它不需要更多的计算时间或更多的数据。它只是改变了展示数据的顺序。作者发现,每 5 个轮次(干净)切换 1 个轮次(有噪声)的简单设置在所有情况下都表现出色。

为什么这改变了现状

论文指出,实现鲁棒 AI 的秘诀不仅仅在于看到更多的数据或使用更大的计算机。而在于你如何展示数据。通过以节奏性的、交错的模式将“安全”的干净世界与“混乱”的有噪声世界混合在一起,模型学会了变得灵活。它学会了忽略那些通常会误导它的微小、干扰性的细节,并学会了寻找那些即使在世界变得混乱时依然保持不变的真实、潜在的模式。

作者总结道,这是一个简单且强大的工具。它表明,在未来,我们可能不需要构建更复杂的机器人来应对现实世界;我们可能只需要用一点点“混沌”,并在恰当的时机将其开启与关闭,来教导它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →