← 最新论文
🤖 AI

Never Seen Before: Benchmarking Genuine Zero-Shot Composed Image Retrieval with Consistent Video-Sourced Datasets

本文介绍了 ZeroSight,这是一个针对真正的零样本组合图像检索(Zero-Shot Composed Image Retrieval)的新型基准测试,它利用 post-CLIP 训练视频数据来确保真实的零样本条件和一致的参考-目标对,并结合了一种即插即用的 SC4CIR 方法,揭示了现有数据集和模型中被夸大的性能。

原作者: Zhenyu Yang, Zemin Du, Shengsheng Qian, Changsheng Xu

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenyu Yang, Zemin Du, Shengsheng Qian, Changsheng Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一个庞大的数字图书馆中寻找一张特定的照片。你不仅仅是用像“狗”这样的关键词进行搜索。相反,你向管理员展示了一张棕色的狗的照片,并说:“帮我找一张白色的狗的照片。”这被称为组合图像检索(Composed Image Retrieval, CIR)

多年来,研究人员一直试图构建能够实现这一功能的计算机程序。但根据这篇论文,他们用来给这些程序评分的“测试考试”是存在缺陷的。作者 Zhenyu Yang 及其团队构建了一个全新的、难度更高的测试,名为 ZeroSight,并开发了一个新的“学习指南” SC4CIR,以帮助计算机通过这项测试。

以下是他们工作的简要说明:

1. 问题所在:旧的测试在“作弊”

作者认为,以往针对这些图像搜索程序的测试在两个主要方面存在缺陷:

  • “假朋友”问题: 在旧的数据集中,“参考”照片(棕色的狗)和“目标”照片(白色的狗)通常只是从互联网上抓取的随机照片,它们之间并没有实际的关联。这就像是要求一名学生根据一张“蓝色的车”的照片去寻找一张“红色的车”的照片,但这两辆车可能来自完全不同的制造商,处于不同的国家,除了都是“车”之外没有任何联系。计算机可以通过仅仅知道“白色的狗”长什么样来猜出答案,而不需要真正理解第一张图片发生了什么样的变化。
  • “为考试而学习”问题: 计算机(特别是像 CLIP 这样的模型)在初始训练阶段已经见过这些测试中使用的照片了。这就像是给一名学生做数学测试,而题目与他上周做的家庭作业完全一样。学生拿到了满分,但他并没有学会如何解决的问题。

2. 解决方案:ZeroSight(新的测试)

为了解决这个问题,团队构建了 ZeroSight,这是一个全新的基准测试,充当了一个公平且严苛的考试。

  • 视频技巧: 他们没有从互联网上抓取随机照片,而是抓取了视频帧。想象一下一个人的行走视频。一帧显示他穿着红衬衫;下一帧(几秒钟后)显示他穿着蓝衬衫。因为这些图像来自同一个视频,它们保证是“朋友”——它们共享相同的背景、光照和人物。唯一的变量是标题所要求的变化。这确保了计算机必须理解特定的变化,而不仅仅是基于通用知识进行猜测。
  • “新鲜数据”规则: 他们确保使用在 2022 年 3 月 31 日之后发布的视频。为什么要这样做?因为流行的 AI 模型 CLIP 在那个时间点左右停止了从互联网学习。通过使用那个日期之后的数据,他们保证了计算机从未见过这些图片。这是一个真正的“零样本(Zero-Shot)”测试:计算机必须在没有任何预先学习的情况下,现场解决问题。
  • “难负样本”陷阱: 在他们的测试中,他们还加入了“诱饵”。这些图像看起来非常接近正确答案,但并不完全正确。这就像是展示一张看起来像白狗但实际上是狼的照片。计算机必须足够聪明,才能分辨出其中的区别。

3. 新工具:SC4CIR(聪明的学习指南)

即使有了公平的测试,计算机仍然表现挣扎。因此,作者创建了一种名为 SC4CIR(用于 CIR 的对称一致性)的新方法。

可以将其视为一个双重检查系统

  1. 正向搜索: 计算机观察“棕色的狗”和指令“把它变成白色”,然后挑选出一个“白色的狗”候选对象。
  2. 反向检查 1: 计算机拿起这个“白色的狗”候选对象并询问:“如果我把它变回原来的样子,我会得到最初那只‘棕色的狗’吗?”
  3. 反向检查 2: 计算机询问:“如果我观察‘棕色的狗’和‘白色的狗’候选对象,它们之间的差异是否符合‘把它变成白色’的指令?”

如果计算机无法在两个方向上都解释清楚这种变化,它就知道自己选错了答案。这种方法是“即插即用”的,这意味着它可以附加到几乎任何现有的图像搜索程序上,使其变得更聪明,而无需从头开始重新训练整个系统。

4. 结果:真相大白

当他们在新的 ZeroSight 测试上运行 27 种不同的计算机程序时:

  • 分数下降: 许多在旧的、有缺陷的测试中看起来像天才的程序,在 ZeroSight 上的得分大幅下降。这证明了旧的测试夸大了它们的能力。
  • “难负样本”至关重要: 新的指标(PNR-mAP)表明,许多程序被“诱饵”图像迷惑了。它们选了“狼”而不是“白色的狗”。
  • SC4CIR 起到了作用: 当加入 SC4CIR 双重检查系统后,得分显著上升,尤其是在那些不需要额外训练的程序上。

总结

该论文声称,“组合图像检索”领域一直在使用有缺陷的测试,使得 AI 看起来比实际能力更强。他们构建了一个新的、诚实的测试(ZeroSight),利用新鲜的视频数据来确保 AI 正在进行真正的学习,并提供了一个新的工具(SC4CIR),帮助 AI 验证自己的答案以避免错误。他们的目标是停止这种“作弊”行为,并构建能够处理现实世界图像变化的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →