← 最新论文
💻 computer science

U-shaped Multi-granularity Learning for Vision-Language Models

为了解决视觉-语言提示学习中的粒度困境,本文提出了 UPrompt,这是一个 U 型多粒度框架,它通过整合由粗到精的上下文传播以及由细到粗的分层监督,以极低的计算开销在 17 个基准测试中实现了最先进的性能。

原作者: Biao Chen, Yunqian Yu, Xiangxu Zhao, Zhongshu Chen, Mengmeng Jing, Lin Zuo

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Biao Chen, Yunqian Yu, Xiangxu Zhao, Zhongshu Chen, Mengmeng Jing, Lin Zuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向一个机器人展示图片并读给它听故事,来教它理解这个世界。这就是视觉-语言模型(Vision-Language Models, VLMs)这一令人兴奋的领域。把这些模型想象成超级聪明的学生,他们读过每一本书,看过每一张照片,但他们需要一点小小的引导来让他们专注于正确的事物。这种引导被称为提示学习(prompt learning)。我们不需要重写机器人的整个大脑(那太慢了),我们只需要微调一些特殊的“指令词”(提示词),来告诉它如何观察一张图片或阅读一个句子。

然而,这些指令存在一个棘手的问题。如果你给机器人一个宽泛、笼统的指令,比如“看整张图片”,它能看到大局,但会错过微小的、重要的细节(比如鸟喙的颜色)。但如果你给它一个超级具体的指令,比如“看鸟喙”,它可能会忽略掉这只鸟正停在树枝上的事实。这就是“粒度困境”(granularity dilemma):要么太宽泛,要么太狭窄。你即将阅读的这篇论文正是针对这一问题展开研究,试图教机器人如何同时看到“森林”与“树木”。


U型解决方案:教机器人进行分层观察

认识一下 UPrompt,这是一个由研究员 Biao Chen 及其团队创造的新方法。他们借鉴了一个用于医学成像的著名工具——U-Net,它就像一位大师级的厨师,既能将蔬菜切成极小的碎块,又能立即将它们重新混合进一锅大汤中,以保持口味的平衡。研究人员问道:“为什么我们不能利用这种‘U型’的思想来帮助我们的视觉-语言机器人呢?”

在过去,大多数机器人尝试只用一种类型的指令进行学习:要么是“全局”指令(大局),要么是“局部”指令(微小细节)。研究人员发现,这种单一的方法限制了机器人的发展。这就像试图通过只说“这是一部动作片”(太模糊)或者只描述英雄跳跃的那一帧画面(太具体)来描述一部电影。你需要两者才能理解整个故事。

核心理念:双向通道
UPrompt 构建了一条特殊的“U型”学习路径。想象一下一个先向下走再向上爬的游乐场滑梯。

  1. 向下走(从粗糙到精细): 机器人首先观察整幅图像和宏观的故事。然后,它顺着滑梯向下移动,观察得越来越仔细,利用这种宏观理解来强化微小的细节。这就像一名侦探,先观察整个犯罪现场,然后利用这些背景信息去锁定一个特定的指纹。
  2. 向上走(从精细到粗糙): 但等等,它并没有到此为止!机器人还会向上传递信息。它提取那些极其清晰、微小的细节,并利用这些细节来确保宏观图景不会产生混乱或“偏离”真相。这就像老师检查学生的作文:学生写出了精彩的段落(细节),而老师利用这些段落来确保整个章节(宏观图景)依然逻辑通顺。

这种双向交通确保了机器人在观察树木时不会迷失森林,在欣赏森林时也不会错过树木。

他们是如何实现的
团队并非凭空猜测;他们构建了这个系统,并在 17 个不同的基准测试(一种高级说法,指 17 个不同的测试集)上进行了测试。

  • 视觉方面: 他们将图像分解成不同的尺寸,从一个极小的 1x1 点(非常模糊,代表宏观图景)到清晰的 14x14 网格(超精细细节)。
  • 文本方面: 他们使用了一个智能语言模型(类似于非常先进的聊天机器人)将同一个句子以不同的精细程度进行改写。一个版本可能说“一个男人在擦窗户”,而一个更精细的版本则会说“一个穿着蓝色衬衫的男人站在梯子上,正在擦拭一栋高楼的窗户”。
  • 连接方式: 他们使用一种特殊的“注意力(attention)”机制将这些不同的层次连接起来。这就像一个聚光灯,帮助机器人在每一个细节层级上,根据文本来聚焦图像的正确部分,反之亦然。

他们的发现
结果令人印象深刻。UPrompt 不仅仅表现尚可,它在多个领域都击败了现有的最优方法:

  • 检索(为句子找到正确的图片): 在 MSCOCO 数据集上,UPrompt 在名为 “rSum” 的评分指标上比之前的最优方法 (MAMET) 高出 4.1 分,比另一顶尖方法 (VPKE) 高出 7.3 分
  • 泛化能力(学习新事物): 在测试新类别(从基础到新颖的泛化)时,UPrompt 比 CoCoA-Mix 提升了 5.09% 的性能。
  • 效率: 最酷的部分之一是,机器人如果愿意,可以变得很“懒”。因为该系统理解不同的细节层次,它可以选择提前停止,如果答案已经显而易见的话,从而节省能量。研究人员发现,他们模型的“中等”版本在达到其他顶尖模型性能的同时,仅使用了 1/3 的计算成本

为什么这很重要
这篇论文表明,那种在“大局”或“小细节”之间做单选题的旧思维方式是一个死胡同。通过创建一个信息双向流动的系统,UPrompt 展示了机器人可以变得更加聪明和灵活。这不仅仅关乎看得更多,更关乎理解微小的部分是如何融入宏大的故事之中的。

研究人员谨慎地指出,尽管这是一个巨大的进步,但该系统仍有局限性。他们目前还无法模拟无限层级的细节,且其“U型”结构的深度目前也是有限的。但就目前而言,UPrompt 为如何帮助我们的数字伙伴睁大双眼观察世界提供了一种清晰且有原则性的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →