Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers
本文介绍了 SAPER,一种由可解释性引导的软剪枝框架,该框架利用注意力头的谱分析和语义聚类,在保持高分类准确度的同时,有效地降低了视觉 Transformer 的计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下人工智能的世界,就像一座繁忙、高科技的城市,计算机在这里学习观察世界。在这座城市中,最强大的建筑被称为“视觉 Transformer”(Vision Transformers)。它们不仅仅是简单的照相机,而是庞大而复杂的结构,能够以惊人的准确度识别出猫、汽车或云朵。它们通过将图像分解成微小的拼图碎片,并将这些碎片送入一个由“注意力头”(attention heads)组成的网络来进行工作。可以将这些“头”想象成一支专业的侦探团队,每个侦探都在为图像寻找不同的线索:有的寻找边缘,有的寻找颜色,还有的寻找物体的整体形状。
然而,这里有一个问题。为了让这些侦探变得超级聪明,工程师们将他们建造进了巨大的、耗能巨大的摩天大楼中。这些建筑如此庞大,以至于需要消耗大量的电力和高性能计算机才能运行,这使得它们很难在手机或机器人等小型设备上使用。科学家们提出的核心问题是:我们真的需要团队中的每一位侦探吗?还是说有些侦探只是在原地踏步,要么是在互相抄袭,要么是在盯着无关紧要的事物?如果我们能在不损失团队破案能力的前提下,解雇那些冗余的侦探,我们就能把摩天大楼缩减成一间温馨的小屋,从而节省能源,让这些智能系统走进千家万户。
这正是开发出一种名为 SAPER(Soft Attention PrunER,软注意力剪枝器)新方法的科研团队所解决的难题。他们意识到,这些 AI 模型中的冗余并非错误,而是模型为了获得超强灵活性而在训练过程中产生的副作用。因为模型是在没有特定指令的情况下,通过数百万张图像进行学习的,所以它们建立了许多备份路径以防万一。研究人员希望找到一种方法,来识别哪些“侦探”正在进行独特且重要的工作,而哪些只是在重复劳动,以便可以安全地移除它们。
为了解决这个问题,团队首先发明了一种新的方式来“洞察”每个侦探在思考什么。他们创造了名为 Laplace maps 的工具,这就像是每个注意力头的彩色热力图或光谱指纹。这种方法不再仅仅观察数字,而是将注意力头聚焦于图像的复杂数学过程转化为一种视觉模式。这有点像听一场合唱,你会发现虽然有些歌手在唱相同的音符,但另一些人则在唱完全不同的旋律。通过分析这些模式,研究人员发现这些“侦探”并不是整齐地排列在行中,而是形成了功能性的群体。网络早期层中的一些“头”表现得像“卷积”头,专注于简单的边缘和纹理;而深层中的另一些“头”则专注于复杂的全局形状。令人惊讶的是,他们发现执行相同任务的“头”可能散落在整座大楼的各个角落,而不仅仅是固定在某一层楼。
凭借这种理解,他们构建了 SAPER,这是一个聪明的工具,扮演着“温柔编辑”的角色。SAPER 并不是盲目地切除模型的某些部分,而是使用一种“软性”的选择过程来决定保留哪些“头”以及舍弃哪些。它就像一个筛子,逐渐过滤掉冗余的注意力头,同时保留核心的部分,让模型学会哪些才是真正必要的。他们在 ImageNet-1K 和 CIFAR-100 等大规模图像数据集上进行了测试。结果非常理想:SAPER 显著减少了注意力头的数量——有时仅保留了原始团队的一小部分——同时仍保持了识别物体的高准确度。例如,他们展示了即使在注意力头非常少的情况下,模型依然能表现出色,特别是在使用一种称为“知识蒸馏”(knowledge distillation,即让较小的模型向较大、更聪明的模型学习)的技术时。
该论文表明,这种方法在速度与智能之间提供了比以往方法更好的平衡。虽然其他技术试图一次性切除模型的整个区块,但 SAPER 能够挑选并剔除单个注意力头的能力使其拥有了更精细的控制力。在实验中,SADP 往往比竞争对手的方法使用更少的计算量(以 FLOPs 衡量),同时实现了相同甚至更好的结果。研究人员总结道,通过利用这些注意力头的特定角色及其光谱特征,我们可以构建出不仅强大而且高效且透明的视觉模型,为那些既强大又能轻松装进口袋且不耗电的智能 AI 铺平道路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。