← 最新论文
💬 NLP

Do Composed Image Retrieval Benchmarks Require Multimodal Composition?

本文揭示,当前的组合图像检索(CIR)基准测试高估了多模态组合能力,因为相当一部分查询可通过单模态捷径解决或本身构建不当,因此需要经验证的子集以确保模型真正融合图像与文本输入。

原作者: Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema, Rohit Saxena, Monica Sekoyan, Wai-Chung Kwan, Claudio Pomo, Alessandro Suglia, Dietmar Jannach, Tommaso Di Noia, Pasquale Minervini

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema, Rohit Saxena, Monica Sekoyan, Wai-Chung Kwan, Claudio Pomo, Alessandro Suglia, Dietmar Jannach, Tommaso Di Noia, Pasquale Minervini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在玩一个“猜图片”的游戏。

在这个游戏中,你获得两条线索,以便在包含数百万张图片的庞大图库中找到一张特定的照片:

  1. 一张起始照片(例如,一张红色连衣裙的照片)。
  2. 一条文字指令(例如,“把它变成蓝色,并加上长袖”)。

目标是找到目标照片(那件带长袖的蓝色连衣裙)。这被称为组合图像检索(CIR)。其核心思想是,一台智能计算机需要结合视觉线索(红色连衣裙)和文字线索(指令)来解决这个谜题。如果它做不到这一点,就说明它并没有真正“理解”如何混合图像与文字。

问题一:作弊代码

这篇论文的作者调查了四种流行的“猜图片”游戏(基准测试),用于评估 AI 模型完成此任务的能力。他们怀疑这些游戏被植入了作弊代码

他们发现,对于大量谜题,AI 实际上并不需要结合图片和文字。它只需利用一条线索就能获胜:

  • 文字作弊:有时,文字指令过于具体(“找一张带长袖的蓝色连衣裙的图片”),以至于 AI 可以完全忽略起始照片,仅根据文字描述进行搜索。它甚至从未看过图片就找到了答案。
  • 图像作弊:有时,文字指令过于模糊或毫无帮助(“让它变得更好”),以至于 AI 可以忽略文字,仅根据起始照片进行猜测。

比喻:
想象一位老师给学生出一道数学题:“从数字 5 开始,然后加 3。”

  • 真正的学习:学生计算出 5+3=85 + 3 = 8
  • 作弊:学生忽略了“从 5 开始”的部分,只是死记硬背“加 3"的答案永远是 8;或者完全忽略数学运算,只是猜测,因为老师总是选 8。

该论文发现,在这些 AI 基准测试中,32% 到 83% 的问题实际上只需利用一条线索(即作弊)就能解决,而不需要学生进行真正的数学运算(即结合图像和文字)。这意味着 AI 模型获得的高分往往是虚假的——它们在作弊,而非学习。

问题二:破损的谜题

随后,作者问道:“好吧,让我们移除所有作弊题目。现在只剩下那些必须同时依赖两条线索的难题了。这些题目公平吗?”

他们请人类审视剩余的“难题”。他们发现其中许多题目本身就是破损的:

  • 过于模糊:指令是“把它调暗”,但图库中有 50 种不同深浅的连衣裙版本。哪一个是“正确”答案?这个谜题没有唯一正确答案。
  • 不匹配:指令说“加一顶帽子”,但所谓的“正确”答案照片中甚至没有帽子。这个谜题从一开始就是错的。

比喻:
这就像老师给学生出一个谜语:“什么东西是圆的且是红色的?”

  • 破损的谜题:老师说答案是“苹果”,但学生也可以正确回答“西红柿”或“球”。由于存在多个正确答案,这项测试是不公平的。
  • 不匹配:老师说答案是“正方形”,但谜语问的是圆形的东西。这项测试毫无意义。

解决方案:CIRCUS

为了解决这个问题,作者创建了一个经过清理的新版测试,称为CIRCUS

  1. 他们移除了所有 AI 仅凭一条线索就能获胜的“作弊”题目。
  2. 他们移除了所有答案模糊或错误的“破损”题目。

最终,他们剩下了一组规模小得多的、真正困难的1,689道谜题。

结果:AI 的表现大幅下滑(但这其实是好事)

当他们在这一套新的、干净的谜题上重新测试 AI 模型时:

  • 分数急剧下降。例如,某个模型在某项测试中的得分从70% 跌至 24%
  • 为什么这是好事? 这证明该模型之前并非真正擅长结合图像与文字;它只是擅长识别作弊代码。
  • 在新的干净测试中,模型必须真正同时使用图片和文字才能答对。仅使用文字、仅使用图像以及同时使用两者之间的“差距”变得更加清晰。

核心结论

该论文得出结论:当前用于“混合图像与文字”的 AI 测试存在缺陷。它们就像一场驾驶考试,汽车只需踩下油门而无需转动方向盘就能通过。作者构建了一个更严格的新驾驶测试(CIRCUS),迫使汽车真正转动方向盘。在我们使用此类测试之前,我们可能会高估 AI 真正的智能水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →