← 最新论文
🤖 machine learning

Is Oracle Pruning the True Oracle?

本文通过大量实验证明,预训练性能与重训练后的结果之间相关性极低,从而挑战了关于“先验剪枝(oracle pruning)能有效识别不重要权重”这一长期存在的假设,进而表明许多现有剪枝方法的基础前提是值得怀疑的,且剪枝标准必须考虑重训练阶段。

原作者: Sicheng Feng, Keda Tao, Huan Wang

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Sicheng Feng, Keda Tao, Huan Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一台巨大且复杂的机器(神经网络),它已经学会了执行一项特定任务,比如识别照片中的猫。现在,你想通过移除其中一些内部齿轮和电线来使这台机器变得更小、更快(这个过程被称为**“剪枝”**)。

三十五年多来,科学家们一直使用一种特定的“金标准”方法来决定哪些部分该被剪掉。他们称之为**“预言机剪枝”(Oracle Pruning)**。

旧有的信念:“水晶球”

“预言机剪枝”背后的逻辑简单且直观。它就像一个水晶球:

  1. 你剪掉一个部件。
  2. 你立即检查:“这是否让机器在当前训练数据上的表现变差了?”
  3. 如果表现没有下降太多,你就假设这个部件并不重要。
  4. 如果表现大幅下降,你就假设这个部件至关重要。

当时的信念是:“如果我们能找到那些造成即时损伤最小的剪切方式,那么在稍后进行修复后,这些剪切将带来最好的最终机器。”

新的发现:水晶球破裂了

这篇题为《预言机剪枝真的是真正的预言机吗?》(Is Oracle Pruning the True Oracle?)的论文提出了一个大胆的问题:“对于现代、复杂的机器,这个水晶球真的有效吗?”

作者进行了一项大规模实验,训练了 37,000 个不同的模型,范围涵盖了从微小的简单网络到巨大的现代 AI 系统(如那些能够看图说话的系统)。他们将“预言机”方法与模型经过重新训练后的最终结果进行了对比测试。

令人震惊的结果:
对于现代、复杂的 AI 模型,水晶球破裂了。

  • 发现: 在模型剪枝后立即的表现,与模型在重新训练后的表现之间,几乎没有任何联系
  • 隐喻: 想象你正在修剪一棵巨大的、复杂的树。旧的方法说:“剪掉那根现在不会让树摇晃的树枝。”这项研究表明,对于大而复杂的树,那些现在不会摇晃的树枝,可能正是那些会导致树木在稍后倒塌的树枝。相反,那些现在会稍微摇晃的树枝,在愈合后反而可能成为让树木长得最强壮的部分。

为什么会这样?

论文指出,罪魁祸首是复杂性

  • 过去(1980年代): 当这些想法诞生时,AI 模型就像简单的玩具车。在玩具车中,如果你拆掉一颗螺丝而车子立刻还能滚动,那么这颗螺丝可能确实不重要。这种关系是直接且可预测的。
  • 现在: 现代 AI 模型就像复杂的生态系统或庞大的城市。在一个复杂的系统中,一切都以隐藏的方式相互连接。移除一个部件可能不会导致立即崩溃,但它可能会破坏一个隐藏的支撑梁,而这种破坏只有在系统尝试重建自身(重新训练)之后才会变得明显。

这对 AI 意味着什么?

  1. “最佳”剪切并非显而易见的那个: 仅仅因为一个权重(AI 内部的一个数字)根据即时测试看起来不重要,并不意味着它是安全的。
  2. 重新训练至关重要: 你不能孤立地判断一个剪枝决策。你必须考虑模型在重新训练后会如何表现。论文认为,未来的剪枝方法需要“向前看”,关注重新训练阶段,而不仅仅是关注即时的后果。
  3. 简单即有效: 有趣的是,这解释了为什么简单的策略(比如仅仅剪掉最小的数字)通常表现得和这些复杂的“预言机”理论一样好,甚至更好。既然复杂的理论失效了,那么简单的猜测往往也同样有效。

总结

论文得出结论:对于我们今天使用的复杂 AI 模型,沿用了 35 年之久的剪枝规则书已不再可靠。“预言机”不再是预言机,而仅仅是一个猜测。为了构建更好的、更小的 AI,我们不能再依赖即时的损害控制,而要开始设计能够考虑到模型如何愈合与重生的剪枝策略。

注:该论文专门针对“训练 \rightarrow 剪枝 \rightarrow 重新训练”这一流程。它承认,对于某些不涉及重新训练的特定类型剪枝,旧规则可能仍然适用,但对于绝大多数现代 AI 开发而言,其基础需要重新审视。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →