← 最新论文
💻 computer science

PACT: Preserving Anchored Cores in Task-vectors for Model Merging

本文介绍了 PACT,这是一个模型合并框架,它识别并保留了“承重墙”维度——即嵌入在预训练权重而非任务向量中的关键任务特定知识——以防止知识退化,并显著提升了现有基于任务向量的合并方法的性能。

原作者: Ningyuan Shi, Zhipeng Zhou, Hao Wang, Chunyan Miao, Peilin Zhao

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ningyuan Shi, Zhipeng Zhou, Hao Wang, Chunyan Miao, Peilin Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《PACT: Preserving Anchored Cores in Task-Vectors for Model Merging》的解释,采用了通俗易懂的语言和富有创意的类比。

大局观:在不破坏模型的前提下进行 AI 模型合并

想象你有一位大师级厨师(预训练模型),他已经是一位精通各种菜肴的专家了。随后,你聘请这位厨师专门钻研三种特定的菜系:意式料理、日式料理和墨西哥料理。你分别对他们进行了训练,使他们成为了各自领域的专家。

现在,你想将这三位专业厨师合并成一位“超级大厨”,让他能完美地烹饪这三种菜系,而无需从头开始重新训练。这个过程被称为模型合并(Model Merging)

长期以来,科学家们认为,要实现这一目标,最好的方法是只观察厨师为了学习每种菜系所做的“改变”。他们把这些改变称为**“任务向量”(Task Vectors)**。旧的方法就像是在说:“让我们把厨师为意大利菜写的笔记、为日式料理写的笔记以及为墨西哥菜写的笔记全部混合在一起,然后把它们添加到原始的食谱书中。”

问题所在: 该论文指出,这种旧的方法是有缺陷的。它假设厨师通过写笔记学会了所有新知识。但实际上,厨师原本深厚的烹饪理解(预训练模型)中仍保留了一些关键的、隐秘的知识,这些知识在训练过程中并没有发生太大变化。如果你粗心地混合这些笔记,你可能会不小心覆盖或破坏掉那些原始且至关重要的基础。

发现: “承重墙”

作者们发现了他们称之为承重墙(Load-Bearing Wall, LBW)维度的东西。

类比:
想象厨师原始的食谱书就是一座房子。

  • 任务向量(Task Vectors) 就像是厨师为了让房子看起来像意大利风格、日式风格或墨西哥风格而添加的新家具和装饰。
  • 承重墙维度(LBW Dimensions) 则是房子的实际墙壁和地基

当厨师钻研意式料理时,他并没有拆掉墙壁,只是移动了家具。然而,这些墙壁对于房子的屹立不倒仍然至关重要。

旧的合并方法只关注家具(任务向量)。当他们试图将日式家具与意式家具合并时,他们不小心撞倒了维持意式房屋屹立不倒所需的墙壁。结果就是?那位“超级大厨”无法再很好地烹饪意式料理了,因为基础被毁坏了。

解决方案:PACT(保护锚定核心)

为了解决这个问题,作者们创造了一种名为 PACT 的新方法。

PACT 是如何工作的(类比):
PACT 不仅仅是混合家具,它更像是一个保护盾

  1. 识别墙壁: 在混合之前,PACT 会观察原始房屋,并准确识别出哪些墙(LBW 维度)对意大利房屋是关键的,哪些对日式房屋是关键的,以此类推。
  2. 建立护盾: 它为每种菜系在这些特定的墙周围建立一个“力场”。
  3. 过滤混合物: 当它尝试将日式家具添加到意式房屋中时,PACT 会检查:“这个新家具会撞到意式的墙吗?”如果答案是肯定的,PACT 会在添加之前移除那个特定的家具部件。
  4. 安全合并: 最终的结果是一个合并后的房屋,其中的新家具被添加进来了,但每种菜系的关键墙壁都保持原样且依然坚固。

为什么这很重要

论文证明,通过使用 PACT,你可以比以前更好地合并模型。

  • 没有 PACT: 合并后的模型就像一座地基开裂的房子;它会在多项任务的压力下坍塌。
  • 有了 PACT: 合并后的模型在成功结合新技能的同时,保持了每项任务的基础完整性。

作者在许多不同的计算机视觉任务(如识别汽车、交通标志和花朵)上测试了该方法。他们发现 PACT 持续提升了现有合并方法的性能,使得最终的“超级大厨”比以往任何方法所能达到的水平都更擅长处理各项任务。

关于速度的简要说明

进行这种“墙壁识别”可能会消耗大量的计算资源(就像雇佣一支建筑师团队来检查每一块砖头一样)。作者还开发了一个“快速版本”的 PACT,它使用了一种聪明的数学捷径——随机奇异值分解(Randomized SVD)。这个捷径就像是使用无人机扫描房屋,而不是走遍每个房间,它更快,但依然能高精度地找到关键的墙壁。

总结

  • 旧方法: 混合变化(任务向量),并祈祷原始模型不会损坏。(结果:经常损坏)。
  • 新方法 (PACT): 识别原始模型中未曾改变的、隐形的、关键的部分(承重墙),保护它们,然后围绕着它们小心地混合变化。(结果:更强大、更稳定的模型)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →