想象一下,你拥有一个庞大且技艺高超的图书库(即预训练 AI 模型),它熟知世界的方方面面。你希望教会这个图书库一项新的、具体的技能,比如识别不同种类的鸟类,或在杂乱的房间中寻找物体。
传统上,实现这一目标有两种方法:
- 全量微调(Full Fine-Tuning):你重写整个图书库。这效果很好,但成本高昂、速度缓慢,而且每你想学习一项新技能,最终都会得到一个全新的、庞大的图书库版本。
- 参数高效微调(PEFT):你尝试仅用几张便签纸或小书签来教导这个图书库。这既便宜又快速,但图书库往往无法很好地掌握新技能,因为这些“书签”过于简单。
本文介绍了一种名为ParaX的新方法,它试图兼得两者之长:既拥有便签纸的低成本,又具备重写整个图书库的高性能。
当前“便签纸”方法的问题
作者指出,现有方法(如 LoRA 或 AdaptFormer)存在两个主要缺陷:
- 它们是“一刀切”的:想象一位老师给初学者、专家和孩子讲授完全相同的课程。现有方法对它们看到的每一张图片都使用相同的“规则”,无论图片内容如何。它们无法根据输入的具体细节进行适应。
- 它们是“孤立”的:如果你有一支工人团队(即 AI 中的各层),现有方法让每个工人在孤岛中独自学习。它们彼此之间不交流。这导致每个人都在做同样的事情(冗余),而不是协作解决复杂问题。
ParaX 解决方案:“共享专家中心”
ParaX 通过将 AI 的学习工具视为混合专家模型(MoE),彻底改变了游戏规则。
类比:大师工具棚
想象 AI 拥有一个巨大的共享工具棚(即专家中心),里面装满了成千上万种专用工具(可训练的参数矩阵)。
- 旧方法:工厂里的每个工人都有自己的小型、固定工具箱。他们无法根据工作任务更换工具。
- ParaX 方法:每个工人都有一个智能路由器。当新任务到来(即一张图片进入)时,智能路由器会查看图片并说道:“哦,这是一个充满大量细节的棘手场景。我需要从大师工具棚中抓取工具#4 和工具#12,并将它们组合起来,为这一刻定制一把专属扳手。”
工作原理(神奇步骤)
- 动态路由:ParaX 不使用固定规则集,而是根据具体图片,动态决定从共享工具棚中使用哪些“工具”(参数矩阵)。这就像一位厨师品尝汤后,瞬间决定添加哪些特定香料,而不是死板地遵循固定食谱。
- 共享知识:由于所有工人(网络中的各层)都从同一个大师工具棚中获取工具,它们自然开始相互学习。如果某一层发现了一种针对特定类型边缘的绝佳工具组合,该知识便可供整个团队使用。这减少了冗余,使 AI 在识别复杂场景时更加智能。
- 多尺度混合:ParaX 还增加了一项功能,使其能够同时以不同的“缩放级别”观察事物(例如,从远处看树以观察其形状,近距离看以观察树叶),这对于图片中的物体检测等任务至关重要。
结果:为何重要
作者在以下困难任务上测试了 ParaX:
- 语义分割:为图像中的每个像素着色以说明其内容(例如,“天空”、“汽车”、“人”)。
- 目标检测:在图片中定位并框出物体。
- 全景分割:上述两种任务的超级困难混合体。
主张:
ParaX 取得了优于以往最佳“便签纸”方法的结果,在某些情况下,甚至击败了昂贵的“重写整个图书库”方法,同时仅使用了不到 4% 的可训练参数。
简单来说:ParaX 教会了 AI 成为一位大师级厨师,能够利用一套微小的共享食材和智能计划烹制出美食;而其他方法则被困在使用预制餐食中,这些餐食味道尚可,但并非上乘。
总结
ParaX 是一种教导 AI 模型掌握新技能的新方法。它不是给 AI 一套静态的、一刀切的指令,而是赋予 AI 一个动态的、共享的工具箱,使其能够针对看到的每一张图片即时进行定制。这使得 AI 能够在无需从头重新训练的情况下,显著提升对复杂场景的理解能力。
技术摘要:ParaX - 通过动态参数路由适配视觉模型
1. 问题陈述
参数高效微调(PEFT)旨在使用最少数量的可训练参数将预训练视觉模型适配到下游任务,同时保持与全量微调相当的性能。尽管在分类任务中取得了成功,但现有的 PEFT 方法在处理复杂的密集预测任务(如目标检测、语义分割)时仍面临困难。该论文指出了当前基于适配器(Adapter)的方法(例如 AdaptFormer、Mona)存在的两个主要局限性:
- 表征不足:现有适配器通常采用与输入无关的低秩建模。它们学习的是静态变换,必须对所有输入通用,无法支持密集预测中捕捉复杂空间依赖关系所必需的输入相关适配。这导致其有效感受野(ERF)小于全量微调。
- 特征冗余:嵌入在不同网络层的适配器通常是孤立的,缺乏跨层交互。这导致了表征冗余,即不同层捕捉相似的信息,现有方法中层与层之间较高的中心核对齐(CKA)相似度证实了这一点。
2. 方法论:ParaX
作者提出了ParaX,这是一种基于简单混合专家(MoE)架构的新型适配器风格 PEFT 方法。ParaX 不是为每一层学习孤立的适配器权重,而是引入了共享专家中心和动态参数路由机制。
2.1 共享专家中心
ParaX 为分层视觉网络的每个阶段构建了一个大型的可训练参数矩阵(专家)共享库。
- 通道变换:中心包含用于下投影和上投影的矩阵对(EA,EB)。
- 空间变换:为了增强空间建模,中心包含设计用于生成多核深度卷积核的矩阵集(SA,SB,SC)。
- 容量:专家中心的大小(M)和潜在维度(C^)是控制参数总数的超参数。
2.2 动态参数路由
在前向传播过程中,每个 ParaX 模块根据当前输入和模块位置动态生成权重矩阵:
- 路由机制:一个轻量级路由网络处理输入特征(通过全局平均池化和线性层),生成动态门控向量(G)。
- 动态权重生成:这些门控向量选择性地聚合来自共享专家中心的参数矩阵。
- 对于通道投影:W1=G1×EA 且 W2=G2×EB。
- 对于空间混合:路由网络生成动态门控向量,将专家矩阵组合成动态深度卷积核($D2Convs$)。
- 输入依赖性:与静态适配器不同,生成的权重矩阵依赖于输入,允许模型根据特定的输入变化定制特征表征。
2.3 动态多尺度空间混合
ParaX 通过依次堆叠具有递增核大小(例如 3、5、7)的动态深度卷积来集成多尺度空间建模。这些输出通过空间可变聚合(SA)模块进行聚合,该模块利用空间注意力动态重新校准跨尺度的特征。这种设计明确依赖于输入,与 Mona 等方法中使用的固定、与输入无关的权重形成对比。
3. 主要贡献
- 动态参数路由:论文引入了一种机制,其中可训练参数矩阵作为“专家”,通过门控向量进行动态聚合。这促进了以输入依赖方式进行的低秩适配,生成更强大且定制化的特征表征。
- 共享专家中心:通过在多个网络层共享同一个专家中心,ParaX 促进了隐式的跨层特征交互。这在不需显式跨层连接的情况下,多样化了信息流并减少了特征冗余。
- 输入依赖的空间建模:该方法将动态路由扩展到空间变换,生成特定于输入的多尺度卷积核,从而解决了静态适配器在密集预测任务中的表征不足问题。
4. 实验结果
作者使用 Swin 和 ConvNeXt 骨干网络,在多样化的视觉识别任务上评估了 ParaX,并与全量微调及最先进的 PEFT 方法(VPT、LoRA、AdaptFormer、Mona 等)进行了比较。
- 语义分割(ADE20K):使用 Swin-L,ParaX 达到了52.0% mIoU,在仅使用不到 4% 的可训练参数的情况下,超越了全量微调(51.2%)0.8%,同时也比强基线 Mona 高出 0.4%。
- 目标检测与实例分割(COCO2017):使用 ConvNeXt-L,ParaX 在 APb/APm 上分别比全量微调提高了1.4%/1.6%,比 Mona 提高了0.6%/0.4%。
- 全景分割(COCO2017):当与 Swin-B 和 ConvNeXt-B 集成时,ParaX 分别将 PQ 提高了 1.7% 和 2.0%(相较于 AdaptFormer)。
- 图像分类:在 ImageNet-R(一个具有显著域偏移的数据集)上,ParaX 的 top-1 准确率比 Mona 高出 1.6%,证明了对域偏移的鲁棒性。
- 泛化能力:该方法在 ViT 架构、基于 Mamba 的模型(VMamba)、人体姿态估计和遥感分割上均表现出优越的性能。
5. 意义与主张
论文主张 ParaX 解决了当前 PEFT 方法中与输入无关的建模和特征冗余的根本局限性。通过利用共享专家中心和动态路由,ParaX 实现了:
- 卓越的表征能力:权重的输入依赖性质使模型能够更有效地捕捉长程依赖和复杂的空间上下文,其有效感受野(ERF)与全量微调相当。
- 增强的特征多样性:共享专家中心促进了隐式的跨层交互,减少了冗余,使各层能够提取更具代表性的特征。
- 效率:尽管采用了动态路由和多尺度卷积,ParaX 仍保持了具有竞争力的计算效率,并显著降低了存储成本(仅需<4% 的可训练参数),相较于为多个任务维护全量微调模型而言。
作者得出结论,ParaX 为密集预测任务中的参数高效适配设立了新的最先进水平,证明了动态的、输入依赖的参数生成对于弥合 PEFT 与全量微调之间的性能差距至关重要。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。