← 最新论文
💻 computer science

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

ZOMP 是一种查询高效、全前向的方法,它通过同时扰动随机逼近,利用跨模态低秩重参数化、梯度修正动量和动态秩调度,优化冻结 CLIP 模型中视觉和文本分支的深度提示,在多个基准测试中超越了现有的零阶方法。

原作者: Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人,它读遍了整个互联网,并学会了理解图片和文字。它就像一位天才图书管理员,仅凭观察就能立刻告诉你一张照片的主题,或者用完美的句子来描述一个场景。这个机器人被称为“视觉-语言模型”(Vision-Language Model),它功能极其强大。但问题在于:通常情况下,为了教这个机器人一项新技能——比如识别某种稀有的特定花卉或奇怪的医学扫描图——你必须让它“重构”自己的大脑。这个过程非常繁重,就像是在图书馆还对公众开放时,试图重新组织整个庞大的藏书一样,需要消耗大量的计算能力和内存。

有时,你无法做到这一点。也许这个机器人生活在你口袋里一个微小的、由电池供电的设备中;或者它是一个你只能通过聊天窗口与之交流的秘密服务机构,而那个窗口并不允许你查看它的思考过程。在这种情况下,你不能重构机器人的大脑,你只能向它传递新的指令。这被称为“提示词微调”(Prompt Tuning)。与其改变机器人的大脑,不如给它一组特殊的提示或“提示词”来帮助它解决新的谜题。问题在于,寻找完美的提示通常需要大量的尝试与错误,如果你看不见机器人的内部想法(梯度),那就如同在蒙着眼睛于草堆中寻针,效率极低。你可能需要成千上万次的尝试才能找对方向,这对于现实生活来说太慢也太昂贵了。

这就是名为 ZOMP 的新方法大显身手的地方。把 ZOMP 想象成一位聪明的侦探,它通过改变“搜索方式”来解决这个“盲目寻针”的问题。它不是试图一次性猜出所有细节,而是采用一种聪明的策略:先猜出最重要的部分,然后再慢慢填补剩余的部分。

以下是它的工作原理,我们使用一些有趣的隐喻:

“共享蓝图”技巧 (The "Shared Blueprint" Trick)
通常,当你试图教机器人新事物时,你必须分别为它的“眼睛”(视觉)和“声音”(文本)编写单独的提示。如果你试图同时为两者编写深奥复杂的提示,可能性就会变得极其巨大,导致盲目的搜索迷失方向。ZOMM 改变了游戏规则,它提出:“让我们使用一个共享蓝图。”想象一下,眼睛和声音的提示都是由同一套小型的乐高积木搭建而成的。你只需要搞清楚如何排列这几块积木,它们就会自动构建出适用于眼睛和声音的正确提示。这让搜索空间保持在小巧且可控的范围内,尽管这些提示本身既深奥又复杂。

“预算索引式”扩张 (The "Budget-Indexed" Expansion)
即使有了共享蓝图,在蒙着眼睛的情况下尝试排列所有的积木仍然非常困难。ZOMP 使用了一个“预算”系统。想象你有一个有限的猜测次数(查询)来找到最佳提示。ZOMP 开始时只允许自己摆弄第一块最重要的积木。它找到那块积木正确的方向后,一旦确定自己走在了正确的轨道上,它就会“解锁”下一块积木,接着是下一块,只有在拥有可靠方向时才缓慢地扩展搜索。这就像学习开车:你从一个空旷的停车场开始(微小的搜索空间),熟悉之后,再慢慢进入社区街道,最后驶向高速公路。你不会在第一天就尝试在高速公路上开车。

“动量”记忆 (The "Momentum" Memory)
因为搜索过程是“盲目”的,它获得的线索往往带有噪声且不稳定,就像在波涛汹涌的船上行走。ZOMP 添加了一个“动量”记忆。把这想象成一名冲浪者,他不仅仅是对每一波浪潮做出反应,而是能记住海洋推挤的总体方向。即使一波浪把他撞向侧面,他仍能继续朝着正确的方向前进,因为他记得自己原本要去哪里。这有助于机器人忽略噪声,并坚持在正确的路径上行驶。

结果
研究人员在 13 个不同的挑战任务中测试了这种方法,从识别花卉到识别卫星图像中的车辆。他们给了 ZOMP 和其他方法完全相同的猜测次数(5,000 次查询)。结果显示,ZOMP 始终能比其他方法找到更好的提示。它不仅仅是做得稍好一点,在机器人通常难以应对的棘手任务上,它的准确率往往显著更高。

真正酷的一点是,ZOMP 不仅仅在它训练的特定任务上表现出色。它在处理从未见过的奇怪情况(比如识别物体的素描稿而非照片)时也变得更强了。这表明,通过仔细且高效地搜索,ZOMP 学会了如何更聪明地利用现有的知识,而不是仅仅死记硬背训练样本。

简而言之,ZOMP 证明了你不需要重构机器人的大脑也能让它变得更聪明。通过使用共享蓝图、缓慢扩张搜索以及保持稳定的方向记忆,即使你只能通过“耳语”进行交流且尝试次数有限,你也能教会强大的 AI 新的技能。这是一种实用且高效的方法,能让你在不依赖超级计算机的情况下,充分发挥这些庞大模型的潜力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →