← 最新论文
💻 computer science

Prompt-based Adaptation in Large-scale Vision Models: A Survey

本文首次系统性地提出了“基于提示的适应”(PA)统一框架,从注入粒度和生成机制两个维度厘清了视觉提示(VP)与视觉提示微调(VPT)的概念边界,并全面综述了其在多领域应用、基准测试及未来挑战等方面的研究现状。

原作者: Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

发布于 2026-03-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份**“给巨型 AI 大脑的‘微调指南’"**。

想象一下,现在的计算机视觉模型(比如能识别猫狗、分析医疗片子的 AI)就像是一个已经读完了万卷书、见过无数世界的“超级学霸”。这个学霸是在海量数据(比如 ImageNet)上训练出来的,知识渊博,但如果你直接让他去干一件他没见过的新工作(比如识别某种特定的罕见病,或者在浓雾中开车),让他从头重新学习(全量微调)既费钱又费时,还容易让他把以前学好的东西给忘了。

这篇论文就是为了解决这个问题,它介绍了一种叫**“基于提示的适应”(Prompt-based Adaptation, PA)**的聪明办法。

核心概念:两个“外挂”策略

论文把现有的方法分成了两大类,我们可以用两个生动的比喻来理解:

1. 视觉提示 (Visual Prompting, VP) —— “给题目加个便签”

  • 比喻:想象这个“超级学霸”正在做题,但他对某些新题目有点懵。你不需要教他新知识,你只需要在题目旁边贴一张便签,或者在图片上画个圈、打个点,告诉他:“嘿,看这里!重点是这个!”
  • 怎么做:这种方法是在输入端(也就是图片本身)做手脚。
    • 固定便签:比如医生在 X 光片上画个圈,告诉 AI“看这里有个肿瘤”。
    • 智能便签:用一个小程序自动在图片上加一些人类看不见的“隐形标记”或颜色滤镜,让 AI 更容易看懂。
  • 优点:不需要改动学霸的大脑(模型参数),只要改改题目(输入图片)就行。特别适合那些不能直接修改模型内部的情况(比如你只能调用别人的 API)。

2. 视觉提示微调 (Visual Prompt Tuning, VPT) —— “给大脑装个‘思维插件’"

  • 比喻:这次你没法改题目了,但你可以在学霸的大脑里塞进几个**“思维插件”(或者叫“提示词”)。这些插件就像是大脑里的几个“小助手”**,它们专门负责把新任务的信息传递给学霸。
  • 怎么做:这种方法是在模型内部(也就是 AI 处理数据的中间层)插入一些可学习的“提示向量”。
    • 浅层插件:只在第一层加几个小助手。
    • 深层插件:在每一层都加小助手,层层递进地引导。
  • 优点:这些“小助手”非常轻量,只占极少的内存,但能极大地改变学霸的思考方式,让他迅速适应新任务,同时保留他原本的知识。

论文主要讲了什么?

这篇论文就像是一个**“导航地图”**,把目前所有乱七八糟的“提示”方法整理得井井有条:

  1. 分类清晰:它把方法分成了“贴便签的(VP)”和“装插件的(VPT)”,并进一步细分为是“固定的”、“可学习的”还是“自动生成的”。
  2. 应用场景广
    • 医疗:帮医生在 CT 片上快速定位病灶。
    • 遥感:从卫星图里数清楚有多少辆车或树木。
    • 工业:在流水线上自动发现产品上的微小瑕疵。
    • 自动驾驶:让车在暴雨或大雾天也能看清路。
    • 3D 世界:让 AI 理解点云数据(比如激光雷达扫描的 3D 模型)。
  3. 解决难题
    • 数据少:只有几张图也能学会新任务(少样本学习)。
    • 环境变:今天晴天,明天雨天,模型能自动适应(测试时适应)。
    • 隐私保护:数据不能离开本地,模型也能通过“提示”来学习(联邦学习)。
  4. 信任与安全:讨论了怎么防止这些“提示”被坏人利用(比如注入恶意提示让 AI 犯错),以及如何保证 AI 的公平性。

为什么这篇论文很重要?

以前大家觉得,要适应新任务就得“大动干戈”地重新训练整个模型,既烧钱又烧显卡。这篇论文告诉我们:其实不需要!

就像给一个经验丰富的老员工发一本**“新业务操作手册”**(提示),他就能立刻上手新工作,而不需要把他送回学校重新读四年书(全量微调)。

  • 对于开发者:这是一本“避坑指南”,告诉你什么时候该用“贴便签”(VP),什么时候该用“装插件”(VPT)。
  • 对于普通人:这意味着未来的 AI 应用会更便宜、更灵活、更智能。你的手机、汽车、医疗设备里的 AI,都能用很少的资源就学会处理各种新情况。

一句话总结
这篇论文告诉我们,与其费力地重新训练一个巨大的 AI 大脑,不如给它一些聪明的“提示”和“小工具”,让它用最小的代价,瞬间变身成解决各种新问题的专家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →