← 最新论文
🤖 AI

Show or Tell? Effectively prompting Vision-Language Models for semantic segmentation

本文研究了视觉语言模型中文本提示与视觉提示在语义分割任务中的有效性,揭示了它们与专家模型之间显著的性能差距以及两种模态之间的互补特性,从而启发了 PromptMatcher 的提出,这是一种无需训练的方法,通过结合两种提示来实现最先进的效果。

原作者: Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人助手,它读过互联网上几乎所有的书,也看过数十亿张图片。你想让这个机器人给新照片中的特定物体画出轮廓,比如“找出所有的飞机”或“高亮显示所有的猫”。这被称为语义分割(semantic segmentation)

这篇论文提出了一个简单但棘手的问题:如何才能最好地告诉这个机器人该做什么? 是给它一个书面指令(文本提示词),还是给它一张图片来展示你想要的东西(视觉提示词)?

以下是他们发现过程的简单解释:

1. “展示”与“讲述”的抉择

研究人员测试了与这些巨型 AI 模型沟通的两种方式:

  • “讲述”法(文本提示词): 你输入“分割所有的猫”。这就像是在下达口头命令。
  • “展示”法(视觉提示词): 你向机器人展示一张用红圈圈出猫的图片,并说,“像这样。”这就像是指着某个东西说,“就像这个。”

他们发现这两种方法都有缺陷

  • 语言很微妙,所以“讲述”法很棘手。 词汇可能会引起混淆。如果你要求机器人寻找“fjord”(一种深海峡湾),它可能会感到困惑,因为这个词很罕见。如果你要求寻找“上装”,它可能不知道你指的是衬衫、夹克还是帽子。机器人有时会猜错或者产生“幻觉”(凭空捏造),因为词语不够清晰。
  • 视觉很具体,所以“展示”法也很棘手。 如果你展示一张特定猫的照片,机器人可能会过于关注那只猫特定的毛发纹理,从而忽略了其他看起来略有不同的猫。

2. 大惊喜:机器人还不完美

作者将这些“通用型”机器人(试图做所有事情的模型)与“专家型”机器人(仅被训练用于寻找猫或寻找飞机的模型)进行了对比。

结果是: 通用型机器人仍然比专家型机器人差了大约 30%。尽管这些巨型模型以聪明闻名,但在处理新颖、奇特的场景并绘制精确物体轮廓时,它们还不足以取代专家。

3. “神谕”的秘密

研究人员注意到一个迷人的现象:文本提示词和视觉提示词是最好的朋友。

  • 当文本提示词失效时(例如,机器人被“fjord”这个词搞糊涂了),视觉提示词往往能成功。
  • 当视觉提示词失效时(例如,机器人被奇怪的角度搞糊涂了),文本提示词往往能成功。

他们想象了一个“神奇的神谕(Magic Oracle)”,它能观察每一张照片并瞬间判断出:“对于这张特定的照片,我应该使用文本指令。对于那张,我应该使用图片。”

如果这个神奇的神谕能够完美地在两种方法之间切换,机器人的表现将会提升 11%。这证明了这两种方法是完美的互补关系;它们弥补了彼此的盲点。

4. 解决方案:PromptMatcher

既然我们无法拥有“神奇的神谕”,作者构建了一个简单的、免费的工具,叫做 PromptMatcher

你可以把它想象成一个互相检查工作的两人小组

  1. 文本专家 (LISA): 阅读指令并绘制掩码(mask)。
  2. 视觉专家 (SoftMatcher+): 查看示例图片并绘制掩码。
  3. 裁判 (The Verifier): 这是最聪明的部分。视觉专家充当文本专家的“评论家”。如果文本专家画出的掩码看起来很奇怪,或者与示例图片不符,裁判就会说:“不对,这个错了,”然后将其丢弃。
  4. 最终结果: 他们将两位专家“批准”的掩码合并成一个完美的绘图。

核心结论

通过结合“展示”与“讲述”,并让其中一方检查另一方的工作,他们创造出了一个比最好的纯文本机器人更强、也比最好的纯视觉机器人更强的系统。

他们不需要重新训练机器人或教它新知识;他们只是找到了以正确的方式向它提问的方法。这提醒我们,有时让聪明的 AI 完成工作的最佳方式不仅仅是与它交谈,而是向它展示你的意思,然后让它反复检查自己的工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →