← 最新论文
💻 computer science

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

本文提出了一种可微架构搜索方法,用于为视觉 Transformer 发现最优的特定层提示融合方案,证明了结合拼接、相加、仿射变换和交叉注意力的混合融合方法在多种数据集上较现有的提示微调基准显著提升了性能与效率。

原作者: Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人,它已经学会了识别成千上万种事物(一个“视觉 Transformer”或 ViT)。现在你想教它一项新的、特定的工作,比如识别稀有鸟类或发现特定类型的云朵。

通常,要教这个机器人一项新工作,你有两个糟糕的选择:

  1. 全量重训(Full Retraining): 你从头开始重新教机器人所有知识。这就像是为每一门学科都专门聘请一位新老师;既昂贵又缓慢,而且你可能会忘掉旧的知识。
  2. 标准“提示词微调”(Standard "Prompt Tuning"): 你给机器人几张便利贴(称为“提示词”),上面写着关于如何观察新图像的指令。机器人阅读这些笔记,并尝试进行适应。然而,在目前的方法中,只有一种将这些笔记贴到机器人大脑上的方式:要么你把它们直接贴在图像旁边(拼接/concatenation),要么你直接把指令写在图像上面(相加/addition)。

这篇论文的作者提出了一个简单的问题:“是否只有一种正确的方式来把这些笔记贴在上面,还是说机器人的不同思考层级会更偏好不同的阅读方式?”

核心理念:“自动提示”(Auto-Prompting)

研究人员构建了一个名为 Auto-Prompting 的系统。他们没有强迫机器人只能用一种方式来阅读指令,而是让机器人为每一个思考步骤选择最合适的阅读方式。

把机器人的大脑想象成一座 12 层高的建筑,信息从底层(看到简单的形状)向顶层(理解复杂的概念)流动。

  • 在底层(早期层级): 机器人可能更喜欢一种简单的“相加(Add)”笔记,即仅仅添加一个微小的提示而不改变视图。
  • 在顶层(深层层级): 机器人可能更喜欢一种“交叉注意力(Cross-Attention)”笔记,这就像一个聪明的图书管理员,能够主动在指令中搜索,以找到完成最终答案所需的特定线索。

他们是如何做到的:“可微搜索”(Differentiable Search)

你如何教机器人选择自己的阅读风格?你不能只是问它,你必须让它尝试一切并从中学习。

作者使用了一种名为**可微架构搜索(Differentiable Architecture Search)**的技术。想象一位厨师试图寻找完美的食谱。他不是做一道菜、尝一下、然后再做另一道,而是创造一种“超级汤”,其中每种成分(每种融合方法)都稍微混合在一起。随着厨师品尝这道汤,他们会慢慢增加美味成分的热度,并降低不好吃成分的热度。最终,这道汤变成了一道完美的、仅由最优质成分组成的单一佳肴。

在他们的案例中:

  1. 他们创建了一锅包含四种混合指令方式的“汤”:拼接(Concatenation)(贴便签)、相加(Addition)(写在上面)、仿射变换(Affine Transformation)(调整笔记的音量/亮度)以及交叉注意力(Cross-Attention)(智能搜索笔记)。
  2. 他们让机器人在训练过程中运行这个“汤”的过程。
  3. 机器人学会了对于哪一层楼使用哪种方法效果最好。
  4. 最后,他们“冻结”了这个选择。现在,机器人使用这种方法的完美组合,而无需承担额外的“汤”带来的成本。

结果:为什么这很重要

论文在 34 个不同的数据集(从识别花朵到发现汽车和医学图像)上测试了该方法。

  • 更高的准确率: 与使用旧有的“一刀切”方法的机器人相比,机器人能更好地学习新工作。它在处理计数物体或理解 3D 形状等棘手任务时表现得显著更好。
  • 高效性: 尽管机器人在训练期间需要“尝试”不同的方法,但最终的机器人与旧的机器人一样快。这就像一个学生通过尝试不同的学习技巧来找到最适合自己的方法,但一旦毕业,他只需使用那一个最好的技巧即可。
  • “混合型”发现: 最重要的发现是,没有任何单一的方法是最好的。 最好的解决方案是一个混合体:在早期思考阶段使用简单的方法,在深度思考阶段使用复杂的方法。

总结

这篇论文证明了,当我们教 AI 执行新的视觉任务时,我们不应该强迫它使用单一、僵化的方式来阅读我们的指令。相反,我们应该让它去发现,大脑的不同部分需要不同种类的帮助。 通过让 AI “搜索”将指令与所见事物结合的最佳方式,我们得到了一个更聪明、更具适应性且依然非常高效的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →