← 最新论文
💻 computer science

Entropy Reveals Block Importance in Masked Self-Supervised Vision Transformers

本文介绍了 Gardener,一种无需数据的单次剪枝方法,它利用预训练块权重的信息熵来识别并移除掩码自监督视觉 Transformer 中的冗余块,从而在对下游性能影响极小的情况下实现显著的模型压缩。

原作者: Peihao Xiang, Kaida Wu, Ou Bai

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Peihao Xiang, Kaida Wu, Ou Bai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、极其聪明的机器人大脑(一个“视觉 Transformer”),它通过观察数百万个无标签视频,花费了数年时间来学习理解世界。这个大脑非常庞大,包含 12 个不同的思考块(layers),由于它规模如此之大,很难放入手机或无人机等较小的设备中。

核心问题在于,作者们提出了这样一个疑问:我们真的需要所有这 12 个思考块来完成一项出色的工作吗? 还是说其中一些只是“累赘”,我们可以直接丢弃掉?

问题所在:“先知”法太慢了

通常,为了弄清楚哪些模块是重要的,你必须玩一场“移除并测试”的游戏。你取出一个模块,测试机器人,再取出一个模块,再次测试,如此重复 12 次。这就像是通过在每次移除一种食材后都品尝一次汤的味道,来试图找出这锅巨型汤里哪些配料是必不可少的。这种方法可行,但耗时极长,且需要大量的计算能力(并且通常,你还需要一个特定的数据集来进行测试)。

解决方案:“园丁”法

作者裴浩翔及其团队想出了一个聪明的捷径,叫做 Gardener(园丁)

他们没有去“品尝汤的味道”(用数据测试模型),而是决定直接查看“食谱”(模型的内部权重),并推测哪些配料是必不可少的。

他们发现了隐藏在机器人大脑数学逻辑中的一个秘密代码:熵(Entropy)

  • 类比: 想象每一个思考块都是一个图书馆。
    • 低熵(“枯燥”的模块): 这个图书馆里只有同一本书的无数副本。它非常重复且单一。作者发现,这些模块就像是“冗余的图书管理员”——你可以解雇他们,图书馆依然能正常运转。
    • 高熵(“忙碌”的模块): 这个图书馆里有各种各样、极其多样化的书籍,散落在各个书架上。它既混乱又丰富。作者发现,这些模块是持有最多独特且重要知识的“超级图书管理员”。

Gardener 是如何工作的

  1. 无需数据: Gardener 不需要看任何视频或图像。它只需观察预训练模型内部的数字。
  2. 一次性决策: 它为每一个单独的模块计算一个“混沌分数”(熵)。
  3. 剪枝: 它会立即识别出那些具有最低“混沌分数”(即最重复)的模块并将其移除。它通过单次处理即可完成,瞬间完成。

结果

团队在名为 VideoMAE 的视频识别模型上进行了测试。

  • 令人震惊的结果: 他们发现,即使你切掉多达 91.7% 的模块(只留下极小的一部分),机器人在识别人类动作方面几乎仍能与全尺寸版本表现得一样出色!
  • 对比: 他们的“园丁”法与那种缓慢且昂贵的“品尝汤的味道”的方法(基于敏感性的剪枝)效果同样出色,但由于不需要任何数据或重新训练,其速度快了数千倍。

这为什么重要

这篇论文证明了这些巨大的 AI 大脑充满了冗余。它们并非同等重要。通过使用一种简单的数学测量方法来衡量数字的“混乱程度”,我们可以瞬间修剪掉这些庞大模型的脂肪,使它们足够小,从而能够在日常设备上运行,而无需重新训练或访问私有数据。

简而言之:你不需要通过品尝汤的味道来得知哪些配料是没用的;你只需要观察这些配料是如何被储存的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →