Model Fusion via Retrofitting
本文提出了一种以神经元为中心的模型融合框架,该框架通过将中间神经元分组并利用归因分数对齐显著特征,将融合视为表征匹配问题,从而在无需重新训练的情况下,于 VGG、ResNet 和 ViT 等多种架构上实现了超越现有方法的性能,尤其在零样本和非独立同分布场景中表现尤为突出。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有两位专家级厨师,他们花费多年时间完善各自独特的食谱。厨师 A 专精意大利菜,厨师 B 专精日本菜。他们从未共事过,使用不同的工具,甚至可能用不同的单位来测量食材。
现在,想象你想创造一位能够完美烹制意大利菜和日本菜的“主厨”,但你不能要求他们回到烹饪学校从头重新学习一切。你只想立即将他们的现有知识融合到一个人身上。
这就是模型融合(Model Fusion)的问题。在人工智能(AI)领域,我们通常拥有分别训练的不同神经网络(即“厨师”)。我们希望将它们合并为一个强大的模型,而无需在数据上进行昂贵且耗时的重新训练。
问题:“语言障碍”
论文指出,简单地平均这两个模型的权重(就像逐页混合他们的食谱书)通常会失败。为什么?因为即使它们是在相似的数据上训练的,它们学习的方式也不同。
- “排列”问题:想象厨师 A 的“香料架”,其中“孜然”放在顶层抽屉,而厨师 B 的“孜然”放在底层抽屉。如果你只是平均他们的抽屉,最终会得到一团混乱且毫无意义的混合物。AI 神经元(即“食材”)处于不同的顺序和位置。
- “零样本”挑战:大多数现有方法在厨师背景相似时表现尚可。但如果它们是在完全不同的数据上训练的(例如一个在意大利菜上,一个在日本菜上),现有方法就会彻底失败。合并后的模型会变得困惑,表现甚至不如单独的厨师。
解决方案:通过“改造”(Retrofitting)设定“目标”
作者提出了一种名为通过改造进行模型融合(Model Fusion via Retrofitting)的新方法。他们不是简单地平均厨师,而是使用一个巧妙的两步过程,充当翻译和教练的角色。
步骤 1:“分组”(寻找双胞胎)
首先,算法观察神经元(神经元就像人脑中的单个神经元,或者是厨师的特定“技能”)在看到数据时实际在做什么。
- 它将厨师 A 和厨师 B 的相似神经元归为一组。
- 创意转折:论文引入了神经元归因分数(Neuron Attribution Scores)。想象并非所有食材都同等重要。有些香料对风味至关重要;而有些只是装饰。该算法识别出哪些神经元是“明星球员”(高重要性),哪些是“板凳队员”(低重要性)。
- 然后,它为每个组创建一个**“目标”**。这就像一张“黄金标准”食谱卡,代表了按重要性加权后的分组神经元的完美平均值。
步骤 2:“改造”(教练)
现在,算法构建新的“主厨”(融合后的模型)。它不只是复制旧厨师;而是训练新模型的层,使其匹配刚刚创建的这些“黄金标准”目标。
- 这就像带着一名新学徒说:“不要只是模仿厨师 A 或厨师 B。看看我们设计的这个特定目标菜肴。调整你的烹饪,直到你的输出完美匹配这个目标。”
- 这从网络的底部到顶部逐层进行。
为什么这更好(结果)
论文在各种 AI 架构(如 VGG、ResNet 和 Vision Transformers)上测试了这种方法,发现:
- 它在其他方法失败时依然有效:在“零样本”场景(即在没有额外新数据训练的情况下合并模型)中,现有方法通常会崩溃并退化为随机猜测。作者的方法保持了高准确率,即使模型是在完全不同的、不重叠的数据上训练的(例如“分片”设置,其中一个模型只看到红色汽车,另一个只看到蓝色汽车)。
- 它尊重重要性:通过使用这些“神经元归因分数”,该方法确保原始模型中最关键的特征得以保留,而不是在不太重要的特征的噪声中丢失。
- 它具有灵活性:它适用于不同类型的 AI 架构,而不仅仅局限于某一种特定类型。
权衡
论文承认,与“快速但粗糙”的平均方法相比,这种方法在计算上稍慢且更重。然而,他们认为这是值得的,因为:
- 它能立即产生一个可用的模型(零样本),而其他方法通常需要数小时甚至数天的额外微调才能生效。
- 从长远来看,修复损坏模型所节省的时间超过了初始融合所花费的额外时间。
总结类比
- 旧方法:你取两种不同的语言,逐字翻译成第三种语言,并希望意思保持不变。这通常会导致胡言乱语。
- 新方法(改造):你识别出两位厨师都理解的核心概念(即“目标”),根据重要性赋予它们价值,然后教导一位新厨师完美地掌握这种特定的、统一的“语言”。
论文得出结论,这种方法使我们能够有效地结合独立的 AI 模型,即使它们差异很大,也无需从头重新训练它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。