Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation
本文提出了自路由张量适配器(Self-Routed Tensor Adapters, SRTA),这是一个参数高效的框架,通过内部路由和共享的 Tucker 核心生成样本特定的适配矩阵,从而实现跨异构领域的通用视觉适配,并以显著少于现有基于混合专家(MoE)方法的训练参数量实现了具有竞争力的准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,计算机在视觉方面已经变得异常出色。它们能够识别照片中的猫,或者发现街道上的停止标志,其准确度足以媲美人类视觉。这种能力源于在数十亿张图像上训练的大型模型,这些模型学习到了对视觉世界的通用理解。然而,这些强大的系统往往是僵化的。当工程师试图教导这样一个模型去识别新环境中的特定物体时——例如,区分浑浊河流与清澈水族馆中不同种类的鱼——模型就会陷入困境。新环境的视觉风格、光照和背景与它之前学到的内容差异太大。为了解决这个问题,研究人员通常不得不重新训练整个庞大的模型,这个过程既缓慢又昂贵,而且往往会破坏模型原有的通用知识。一种更高效的方法应运而生:科学家们对模型进行微小且有针对性的调整,而不触动其主脑。这就像是为相机添加一个小型专业镜头,而不是从头制造一台新相机。然而,即使是这些微小的调整也面临着一个问题:单一且固定的调整往往无法处理计算机在导航不同视觉世界时所需的各种多样性。
位于德里因德拉普拉斯信息技术学院(IIIT Delhi)的研究员 Suraj Yadav 提出了一种解决这一难题的新方法。目标是创建一个能够同时将冻结的、预训练的视觉模型适配到许多不同领域的系统,而不会导致知识碎片化或需要大量的额外计算能力。以往解决此类问题的尝试使用了“专家混合”(mixture of experts)方法,即模型拥有多个专门的子程序(即“专家”),并由一个独立的控制器决定为每张图像使用哪一个。虽然这种方法有效,但该控制器充当了一个独立的门卫,增加了额外的复杂性和参数量。Yadav 的工作——名为“自路由张量适配器”(Self-Routed Tensor Adapters)——完全移除了这个外部门卫。该系统不再要求一个单独的控制器来选择路径,而是允许图像本身决定模型应如何进行适配,通过一种紧凑的共享结构,实时融合不同的学习风格。
这种新方法的核心是对模型存储新知识的方式进行了巧妙的重新思考。想象一下,模型的适配空间不是一组分离、孤立的专家集合,而是一个单一的、共享的视觉因子库。在这个库中,模型持有一组核心的可调节组件,这些组件可以被混合和匹配。当一张新图像到达时,系统将其投影到一个低维空间,并利用该投影来计算应使用库中多少比例的每个组件。这种计算直接从图像自身的特征中自动完成,无需额外的决策网络。随后,系统将这些组件融合在一起,为该特定图像创建定制化的适配。如果图像看起来像素描,系统就会从库中的“素则”部分提取更多内容;如果看起来像照片,它就会从“照片”部分提取更多内容。这种融合过程非常平滑,使得模型能够在保持对独特领域专业化的同时,在相似领域之间共享通用知识。
为了确保模型能正确学习这些融合决策,研究人员引入了一种训练技术,在处理的每一步都对系统进行引导。他们发现,如果模型仅被告知最终答案是否正确,它在处理的早期阶段可能会难以学习如何进行路由。因此,他们增加了一个二级训练信号,用于监督网络每一层的路由决策,从而为模型提供一条更清晰的路径,使其学习哪些视觉因子属于哪个领域。这有助于模型为不同类型的图像开发出独特的路径,同时保持整体结构的紧凑与高效。
该方法的效率结果令人瞩目。在涉及多样化视觉领域(从艺术风格到现实世界照片及数字识别)的五项基准测试中,该方法实现的准确率与现有的最先进方法相当,在某些情况下甚至略优。然而,真正的突破在于成本。在包含四个不同领域的设置中,该方法仅需 277 万个可训练参数即可达到其效果。相比之下,使用独立专家库的领先替代方法在执行相同任务时需要 952 万个参数。在六个领域的设置中,差距进一步扩大,新方法仅使用 300 万个参数,而竞争对手则需要 1431 万个。这意味着新系统在提供相似性能的同时,使用的参数量大约减少了三到五倍。
研究人员还观察了系统的内部行为。通过可视化路由决策,他们发现对于差异极大的领域(如不同的艺术风格),系统学会了几乎排他性地激活特定的路径,就像开关切换到了单一设置一样。对于更相似或存在重叠的领域,系统则学会了融合多条路径,并在合理之处共享知识。这种行为表明,该系统不仅仅是在为每个领域记忆独立的规则,而是在学习一种灵活的、共享的表示形式,并理解它们之间的关系。这项研究表明,通用的视觉适配并不需要庞大的专家大军或复杂的外部控制器。相反,一种允许输入引导自身适配的紧凑、共享结构,就能以极小的计算成本实现高性能,为使大型视觉模型变得更加多功能且高效提供了一条充满前景的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。