← 最新论文
🤖 machine learning

A Data-dependent Early Stopping Rule using Rademacher Complexity with L1-norm

本文提出了一种基于带有 L1 范数的 Rademacher 复杂度的分析框架,用于在不需要训练或概率假设的情况下估计线性回归模型的最佳早停时间,并通过线性探测展示了其在非线性神经网络中的适用性。

原作者: Duy Hoang, Bastien Berret, Olivier Bruneau, Laurent Fribourg

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Duy Hoang, Bastien Berret, Olivier Bruneau, Laurent Fribourg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

训练计算机识别模式——无论是识别照片中的猫,还是预测股票价格——都涉及一种微妙的平衡。机器通过观察示例进行学习,通过调整其内部设置来拟合所见数据。然而,如果它学习得过于完美,它就会开始记忆这些示例的具体特征,而不是理解底层的规则。这有点像一个学生背下了练习题的答案,却因为无法将逻辑应用于新问题而在正式考试中失败了。在人工智能领域,这种无法泛化的问题是一个主要的障碍。为了防止这种情况,研究人员经常使用一种称为“早停”(early stopping)的策略,即在恰当的时机停止学习过程——即在模型学到了规则之后,但在它开始记忆噪声之前。挑战始终在于如何准确知道那个时刻何时到来。传统上,寻找这个平衡点需要通过在不同的数据集上多次运行训练过程,这种方法速度慢、计算成本高,且往往依赖于猜测。

巴黎-萨克莱大学(Université Paris-Saclay)的一个研究小组提出了一种解决这一时机问题的新方法,而无需进行重复试验。他们没有采用猜测或运行额外的模拟,而是开发了一种数学方法,可以直接从数据本身预测理想的停止点。他们的方法依赖于一个被称为“拉德马赫复杂度”(Rademacher complexity)的概念,该概念本质上衡量了一个模型区分真实模式与随机噪声的能力。通过使用这一度量标准,研究人员创建了一条规则,可以告诉计算机何时停止学习。他们的工作的独特之处在于,它不需要对数据的形状或分布做出假设,而这是以往方法的一个常见要求。此外,他们发现使用一种特定的误差测量方式(称为 L1 范数),比该领域使用的标准方法能提供显著更准确的预测。

研究人员最初将工作重点放在线性模型上,线性模型是最简单的机器学习算法类型,但他们证明了其发现可以扩展到复杂的非线性神经网络。为了测试他们的理论,他们将该方法应用于一个经典问题:区分手写数字。在一个实验中,他们训练了一个神经网络来区分超过一万张图像数据集中的数字 3 和 5。使用他们的新规则,系统计算出的停止步数为 342 步。当他们将此结果与通过运行完整训练过程并检查单独测试集所得到的实际最佳停止时间进行比较时,发现实际最优值为 357 步。两者的差异微乎其微,且在预测停止时间停止的模型的性能,与在真实最优值停止的模型的性能几乎完全相同。在另一个涉及数字 0 和 1 的测试中,预测的停止时间为 415 步,而实际最优值为 418 步。在这两种情况下,使用他们规则训练的模型都避免了过拟合的陷阱,并针对未见数据达到了最佳准确度。

研究还表明,当相对于模型的复杂度有大量数据时,该方法的效果最好。当研究人员测试数据点较少的场景时,该方法变得不再精确,有时会建议停止时间为零,这意味着模型根本不应该进行训练。这符合“复杂模型需要足够数据来学习通用规则”的理解。研究人员还将他们的新方法与依赖于不同数据数学假设的旧技术进行了比较。他们发现,他们使用 L1 范数进行计算的方法,始终能产生比旧方法更接近真实最优值的停止时间。这表明,误差的测量方式与停止规则本身一样重要。

或许最重要的一点是,研究人员展示了“早停”不仅是一个理论概念,在许多情况下也是一种实际的必要手段。他们计算了如果允许训练无限期进行会发生什么。在他们研究的例子中,如果训练超过最优值继续进行,模型在新数据上的表现实际上会变差,这证实了早停可以防止模型性能退化。然而,他们也指出,在某些特定的、参数远多于数据点的极高复杂度场景中,继续训练最终可能会带来更好的结果,这种现象被称为“良性过拟合”(benign overfitting)。他们的方法有助于识别用户处于哪种情况,从而让他们决定是提前停止还是继续进行。

通过提供一种无需运行完整训练过程即可计算出理想停止时间的方法,这项工作为开发可靠的人工智能提供了一条更高效的路径。它消除了对试错的需求,节省了时间和计算资源。该方法特别适用于数据充足但计算能力有限,或者训练成本较高的场景。虽然目前的研究侧重于线性模型和特定类型的数据,但研究人员相信其框架可以被改编用于更复杂的系统和不同类型的输出。他们的工作为这个长期依赖猜测的问题提供了一个清晰的、数据驱动的答案,为在学习与记忆之间的权衡提供了更精确的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →