在人工智能领域,计算机在识别模式方面已变得异常出色,从识别照片中的猫到诊断医学扫描图像。这种能力通常源于在海量数据集上训练大规模模型,这一过程教会了机器视觉的基本规则。然而,当科学家想要将这些强大的预训练模型用于新的特定任务时——例如区分不同的狗品种或发现稀有植物——他们面临着一个艰难的选择。传统方法涉及重新训练整个模型,这就像为了换个车漆而拆解并重建汽车引擎;它既缓慢又昂贵,且需要海量的数据。一种被称为“视觉提示”(visual prompting)的更现代的方法提供了一种更轻量级的替代方案。这种方法并非改变模型的内部大脑,而是在输入图像中直接添加一层微小的、可调节的信息层,引导现有模型专注于对新任务重要的部分。这有点像给相机镜头添加一个特定的滤镜,以突出某些细节,而不必改变相机本身。
这种轻量化方法的挑战在于寻找简单性与有效性之间的平衡。早期的方法使用单一的、静态的引导,适用于每张图像,假设“一招鲜吃遍天”。虽然这种方式效率很高,但往往会失败,因为一张波涛汹涌的大海照片所需要的关注点与一张平静草地的照片是不同的。其他研究人员尝试为每一张图像都创建独特的引导,但使用了额外的计算机网络,这增加了过多的复杂性和内存占用,从而违背了追求高效的初衷。这是一个困境:要么使用一个对所有事物都表现平平但能应付全局的钝器,要么使用一个效果很好但过于笨重、不切实际的复杂工具。
一支研究团队现在提出了一种在两者极端之间寻求平衡的解决方案,引入了一种名为“能量塑造视觉提示”(Energy-Shaped Visual Prompting)的方法。他们的方法始于一个简单的、通用的起点——低秩初始化(low-rank initialization),它捕捉了任务的通用本质,就像一张勾勒出场景主要特征的草图。这个初始引导被应用于每张图像,确保模型有一个坚实的基础。创新之处在于接下来的步骤。该系统并没有依赖于一个单独的、沉重的网络来为每张图片定制引导,而是使用了一个被称为“能量函数”的数学概念。在这种情况下,能量函数充当了一个敏感的检测器,衡量当前图像与模型预期之间的契合程度。如果图像令人困惑或不同寻常,能量得分就高;如果图像清晰且易于识别,得分就低。
随后,系统利用这一得分来自动且即时地调整针对特定图像的视觉引导。这是一个动态的过程:模型观察图像,通过能量得分感知其独特的特征,并微妙地移动提示词,以更好地突出相关细节。这种调整不需要任何额外的参数或辅助网络,这意味着系统保持了极高的轻量化。研究人员在十五个不同的数据集和五种不同的模型架构上测试了这种方法,涵盖了从标准图像分类器到先进的视觉语言模型。结果一致且令人瞩目。在利用名为 CLIP 的流行模型进行的测试中,该方法比现有的最复杂的方案平均准确率提高了 2.6%,而使用的可调参数却减少了 590 倍。
除了更准确之外,这种新方法在面对陌生数据时也表现出了更强的鲁棒性。当测试图像看起来与模型原始训练数据不同(例如素描或带有艺术滤镜的照片)时,该系统比以往的方法能更好地维持性能。这表明,基于能量的调整有助于模型理解图像的底层结构,而非仅仅记忆表面模式。研究人员还发现,该系统的训练收敛速度更快,达到巅峰性能所需的步骤比竞争对手更少。通过将简单的通用起点与智能的自动调整机制相结合,这项工作证明了实现高水平适应性而不必承担沉重计算成本是完全可能的。这些发现为如何让强大的人工智能模型变得更加灵活和高效开辟了新路径,证明了有时引导机器最有效的方式不是构建一个更大的大脑,而是教它如何观察得更仔细。
技术摘要:ES-VP(能量塑造动态视觉提示)
1. 问题陈述
视觉提示(Visual Prompting, VP)已成为一种参数高效的策略,通过修改输入而非微调内部权重,使预训练视觉模型能够适应下游任务。然而,现有方法面临着灵活性与效率之间的关键权衡:
- 单一提示(Single-VP)方法: 对所有图像应用固定的、通用的提示。虽然参数高效,但无法捕捉单个图像的独特特征,限制了判别能力。
- 多样化提示(Diverse-VP)方法: 使用辅助网络或多种初始化方式生成特定于图像的提示。虽然更具针对性,但这些方法显著增加了参数量,增加了在小数据集上过拟合的风险,并由于复杂的辅助架构引入了可扩展性瓶颈。
本文提出的问题是:是否存在一种有效的视觉提示方法,能够在保持参数效率的同时生成特定于图像的提示?
2. 方法论:ES-VP
作者提出了能量塑造视觉提示(ES-VP),这是一种无需辅助网络或显著增加参数的新颖方法,能够生成特定于图像的提示。该方法由通过元学习框架优化的两个主要部分组成:
A. 低秩提示初始化
ES-VP 并非学习一个全秩提示矩阵,而是使用两个低秩矩阵 B∈Rc×L×r 和 A∈Rc×r×L(其中 r≪L)来初始化一个通用提示。
- 乘积 δ=B⋅A 作为捕获全局任务特征的通用先验。
- 这种初始化灵感来源于深度神经网络的内在低秩结构,确保以极少的参数(例如,秩 r=4)实现表达能力。
- 该提示统一应用于所有调整大小后的图像,通过一个固定掩码影响整个图像。
B. 能量塑造动态适配
为了在不使用辅助网络的情况下实现图像特异性,ES-VP 利用直接源自预训练模型逻辑值(logits)的能量函数。
- 能量定义: 能量得分 E(x) 定义为分类器输出逻辑值的负 LogSumExp。较低的能量得分对应于观测数据的更高概率密度。
- 动态调整: 图像特有的适配项 μδ(x) 计算为能量函数对提示参数的梯度:
μδ(x)=−α∂δ∂Eθ,δ(x)
其中 α 是一个可学习的强度系数。
- 机制: 这种基于梯度的调整自动为每个特定图像塑造能量景观,在不需要标签或额外可训练模块的情况下,增强了对分布外(OOD)样本的判别能力。
C. 元学习优化
ES-VP 采用嵌套优化策略:
- 内循环: 对于批次中的每张图像,利用当前的全局先验 δ 瞬时计算动态适配项 μδ(x)。
- 外循环: 通过梯度下降更新全局低秩先验 δ、强度系数 α 以及输出变换 M,以最小化下游任务损失。
3. 核心贡献
- 新型自适应方法: 引入了 ES-VP,它利用低秩先验和能量引导的动态适配生成具有判别力的图像特定视觉提示,其参数量显著低于现有的多样化提示(Diverse-VP)方法。
- 参数效率: 该方法消除了对辅助网络(如 SMM)或复杂聚类(如 DAM-VP)的需求,降低了过拟合风险并提高了可扩展性。
- 全面评估: 在五种架构(ResNet-18/50, ViT-B/32, Swin-B, CLIP)和十五个数据集上的广泛实验证明了其卓越性能。
- 深入分析: 消融实验证实,基于能量的动态适配与低秩初始化是正交且相互增强的,其中能量组件提供了最显著的性能提升。
4. 实验结果
论文报告了在分布内(In-Distribution)和分布外(OOD)任务上的结果:
分布内性能:
- 在十个数据集上使用 ResNet-18 时,ES-VP 的平均准确率比 SOTA 单一提示方法(AutoVP)高出 4.5%,同时使用的 VP 参数量减少了 12 倍。
- 与 SOTA 多样化提示方法(DAM-VP)相比,ES-VP 的准确率高出 1.6%,而参数量减少了 340 倍。
- 在四个数据集上使用 CLIP 时,ES-VP 的准确率比 DAM-VP 高出 2.6%,同时利用的 VP 参数量减少了 590 倍。
- ES-VP 展示了更快的收敛速度,在更少的训练轮数内达到峰值性能(例如,20 轮对比基准方法的 50–200 轮)。
分布外(OOD)鲁棒性:
- 在使用 ImageNet-1K 预训练的 Swin-B 测试于 ImageNet-R, ImageNet-Sketch, ImageNet-A 和 ImageNet-V2 的情况下进行评估。
- ES-VP 在 ImageNet-1K 源数据集上取得了所有基准方法中的最高性能。
- 在四个 OOD 数据集中,ES-VP 的平均准确率比 AutoVP 高出 11.4%,比 DAM-VP 高出 1.1%。
效率:
- ES-VP 需要最少的训练轮数和最短的训练时间。
- 它仅使用了约 5K 个可训练参数(秩为 4),而 DAM-VP 等方法则需要数百万个参数。
- 尽管获得了显著的准确率提升,其推理延迟和峰值内存使用量与 DAM-VP 相当。
5. 重要性与主张
论文声称 ES-VP 为高效且泛化性强的模型适配建立了新的基准。其重要性在于解决了视觉提示中固有的灵活性与效率之间的权衡:
- 泛化性: 通过利用能量函数,该方法有效地塑造了模型针对 OOD 样本的决策边界,在不增加额外参数的情况下提高了鲁棒性。
- 可扩展性: 消除辅助网络和复杂的超参数微调,使得该方法与现有的多样化提示方法相比,具有更高的可扩展性,且更容易部署在实际应用中。
- 简洁性: 该方法将全局任务适配(通过低秩先验)与局部图像特异性(通过能量梯度)统一到一个流线型的框架中。
作者总结道,ES-VP 为适配大型预训练模型提供了一种实用的解决方案,能够以极低的计算和参数开销实现最先进的性能。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。