← 最新论文
⚡ electrical engineering

Attributes Should Come from Images, Not Class Names: Distribution-Conditioned Attribute Selection for Vision-Language Models

本文提出了一种分布条件的属性选择方法,该方法直接从目标图像中提取视觉描述符,而非依赖于类名条件的语言大模型(LLM)描述,从而在显著提高零样本分类在分布偏移下的鲁棒性的同时,提供关于数据集特征的可解释性摘要。

原作者: Gautam Rajendrakumar Gare, Jia Shi, Zhiqiu Lin, Deepak Pathak, John Galeotti, Deva Ramanan

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Gautam Rajendrakumar Gare, Jia Shi, Zhiqiu Lin, Deepak Pathak, John Galeotti, Deva Ramanan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

侦探、描述与素描

想象你是一名正在从照片队列中识别嫌疑人的侦探。你有一个强大的助手——一个人工智能(AI),它非常擅长将文字与图片进行匹配。这个 AI 看过数百万张照片,它知道“狗”通常有毛发,而“草莓”通常是红色的。这就是**视觉-语言模型(Vision-Language Models)**的世界:计算机可以观察一张图像并理解描述它的文字,或者根据一个词找到匹配的图像。

但棘手的地方在于:有时你拥有的照片并不是那种常见的、高清晰度且色彩丰富的快照。也许它们是黑白的素描、绘画,或者是光影奇特的照片。如果你的 AI 助手仅依赖于对“草莓”的教科书式定义(红色、圆形、带有种子),那么当它看到一张用灰色线条画在纸上的草莓时,它可能会感到困惑。它可能会想:“这不对,它不是红色的,所以它不可能是草莓!”

有一段时间,研究人员认为帮助 AI 的最佳方法是让一个超级聪明的语言机器人(比如一个非常先进的聊天机器人)为每个物体写一段详细的描述。他们认为:“如果我们告诉 AI 草莓是红色的并且有种子,它就会做得很好。”但本论文提出了一个简单的、令人不安的问题:AI 究竟是在通过观察图片来做决定,还是仅仅在盲目地信任我们给出的描述?这项研究的作者决定测试这一想法,而他们的发现改变了我们教导这些“数字侦探”的方式。


伟大的“红草莓”错误

故事始于科学家使用的一个流行技巧。为了让 AI 在没有看到成千上万个示例的情况下也能更好地识别物体(这个过程被称为“零样本学习”,zero-shot learning),他们会让语言模型描述一类物体。对于“草莓”,模型可能会说:“它是红色的,有绿色的叶子,表面布满了种子。”然后,他们将这段描述连同类别名称一起输入给视觉 AI。

论文揭示了这种方法中一个惊人的缺陷。当 AI 看到一张正常的草莓照片时,它的正确率约为 60%。但作者意识到,AI 实际上并没有在观察草莓“红色”这一视觉证据;它只是在依靠“草莓”这个词来完成大部分工作。为了证明这一点,他们玩了一个“移除名称”的游戏。他们拿走了描述(“红色,有种子”),并在没有告诉 AI “草莓”这个词的情况下将其喂给 AI。

结果是一场灾难。准确率不仅是略微下降,而是直接崩塌了——从 59.5% 骤降至 15.5%。就好像一旦你停止说出那个词,AI 突然就忘记了草莓长什么样。描述本身是毫无用处的。

为什么会这样?因为编写描述的语言模型从未见过 AI 所观察到的那些特定照片。它描述的是其训练数据中“完美”的草莓。但在现实世界中,特别是在一个名为 ImageNet-Sketch 的数据集中,草莓全是黑白的线条画。语言模型坚持认为:“草莓是红色的!”而 AI 看着一张灰色的素描图想道:“这并不是红色的,所以它不是草莓。”描述在与图像对抗,而不是在提供帮助。

解决方案:让图像说话

作者的诊断非常简单:属性(描述)的选择是基于物体的名称,而不是物体的图像。他们认为,如果你想描述一组图片,你不应该去问一本书草莓看起来像什么;你应该问这些图片本身。

因此,他们构建了一种新方法。他们不再要求语言机器人去猜测特征,而是让 AI 观察目标组中的一些实际图像(比如那些素描风格的草莓),并询问:“我们庞大的潜在描述列表中的哪些词能匹配这些特定的图片?”

他们选取了一个巨大的潜在词库(如“红色”、“圆形”、“素描感”、“无色”、“点状”),并针对实际图像对这些词进行评分。对于素描风格的草莓,“红色”和“成熟”得分很低,因为图片并不红。但像“心形”、“点状”和“无色”这样的词得分很高,因为它们确实符合这些绘画。

结果:一种新型侦探

当他们使用这些“图像选择词”来帮助 AI 时,结果要令人印象深刻得多,尤其是在移除类别名称的情况下。

  • 旧方法(LLM 描述符): 在没有类别名称的情况下,准确率为 15.5%
  • 新方法(图像选择): 在没有类别名称的情况下,使用相同的词库,准确率跃升至 23.8%

这证明了选择方法才是英雄,而不仅仅是词汇量。通过让图像来选择词汇,AI 可以更好地处理奇特的情况。

论文还显示,这种方法极其快速且高效。

  • 速度: 设置这个新系统耗时不到 一分钟
  • 对比: 一个名为 CoOp 的竞争方法,试图通过调整不可见的参数来“微调”AI,它需要 14 小时 进行训练,且在每个类别只有一个图像时表现仍然较差(60.13% 对比 57.15%)。
  • 少样本学习(Few-Shot Learning): 仅凭一个类别中的一张图像,新方法就击败了那个需要 14 小时训练的方法。这非常了不起,因为这意味着你不需要超级计算机或等待数天,就能获得一个聪明且可解释的系统。

为什么这很重要:读取数据的思想

这一发现最酷的部分在于,被选中的词汇就像是数据本身的总结。因为这些词是根据图像实际的样子来选择的,所以你可以利用它们来描述一个数据集发生了怎样的变化。

例如,如果你对比普通照片所选的词与素描照片所选的词,其中的差异就能讲述一个故事。普通照片可能会强调“红色”和“绿色”,而素步照片则会强调“无色”、“灰色”和“卡通”。你完全可以从一个词单中减去另一个词单,从而得到一句解释两组图像之间差异的话。

作者还展示了这对于难以命名的事物同样有效。如果你有一张带有科学名称但 AI 不认识的奇怪水果(如 Cristidiscoidea)的照片,AI 通常会失败。但如果你向它展示几张图片,并让它挑选视觉词汇(如“多刺”、“黄色”、“细小”),即使不知道那个高大上的名字,它也能识别出该物体。

核心结论

这篇论文建议我们构建 AI 的方式发生重大转变。我们不应该仅仅根据名称让语言模型来描述事物;我们应该让图像来教会我们哪些词是重要的。

  • 他们排除了什么: 他们证明了仅仅在提示词中加入由语言生成的描述,并不能真正帮助 AI 更好地“看见”图像;AI 只是根据类别名称在进行猜测。
  • 他们发现了什么: 直接从图像中选择属性使 AI 更加稳健、快速且具有可解释性。
  • 代价/限制: 虽然这种方法在处理奇特或偏移的数据时表现出色,但它并不能完全取代标准情况下对类别名称的需求。最好的结果仍然来自于将类别名称与图像选择的词汇结合使用。但对于理解 AI 为什么犯错,或者处理与训练集截然不同的数据,让图像选择词汇才是制胜策略。

简而言之,如果你想让你的 AI 理解世界,不要只告诉它事物应该是什么样子。展示给它看它们实际是什么样子,并让它讲述其中的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →