← 最新论文
💻 computer science

Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods

该论文提出了首个面向少样本图文检索的基准数据集 FSIR-BD,并设计了两种兼容现有预训练编码器的优化方法,以解决传统视觉语言模型在组合式查询和分布外数据上的检索短板。

原作者: Ofer Idan, Vladi Vexler, Gil Lederman, Dima Sivov, Aviad Cohen Zada, Shir Niego Komforti

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Ofer Idan, Vladi Vexler, Gil Lederman, Dima Sivov, Aviad Cohen Zada, Shir Niego Komforti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“如何教电脑更聪明地找图片”**的故事。

想象一下,你正在一个巨大的、由数十亿张照片组成的图书馆里找一张特定的照片。

1. 现有的问题:电脑有点“死脑筋”

以前,我们用的电脑(基于预训练的视觉语言模型,VLM)就像是一个读过很多书但没怎么见过世面的图书管理员

  • 它的强项:如果你说“找一张猫的照片”,它能很快找到。因为它在训练时见过无数张猫。
  • 它的弱项:如果你说“找一张穿着红色毛衣、正在打哈欠的橘猫,而且背景里没有狗”,它就晕了。
    • 它很难理解这种复杂的组合(既要红毛衣,又要打哈欠,还要排除狗)。
    • 如果它没见过这种特定的场景(比如“某种罕见的卫星图像”),它就完全找不到。

这时候,人类会怎么做?我们会说:“哎呀,刚才那张不对,你看这张才对!或者,你看这张也不对,但比刚才那张好一点点。”我们会通过举几个例子来纠正管理员的搜索。

2. 这篇论文做了什么?

作者们受此启发,提出了一个**“少样本图文检索”(FSIR)的新任务。简单来说,就是允许用户在搜索时,提供几张“参考图”作为提示**,让电脑结合文字和这些例子,更精准地找到目标。

为了证明这个方法有效,他们做了三件大事:

第一件事:造了一个“超级难”的考试卷(FSIR-BD 数据集)

以前的考试卷(数据集)太简单了,往往只有一张图对应一句话。作者们造了一个新试卷,叫 FSIR-BD

  • 特点:这道题很难。比如题目是“找一只在树上睡觉的猴子”,答案里可能有37 张符合要求的猴子照片(正样本),还有100 多张长得像但不对的猴子照片(硬负样本,用来迷惑电脑)。
  • 覆盖范围广:既有城市里的复杂场景(比如“被挖开的井盖”),也有自然界罕见的物种,甚至还有电脑从未见过的“外星”场景(分布外数据)。
  • 意义:这是第一个专门用来测试“文字 + 参考图”搜索能力的公开数据集。

第二件事:发明了两种“超级搜索法”

为了在这个难卷上拿高分,他们提出了两种新方法:

  • 方法一:FSIR-PL(像“定制提示词”)

    • 比喻:想象图书管理员手里有一块可擦写的白板。当你给他看几张参考图时,他会在白板上快速写下一些特殊的“提示词”(Prompt),比如“注意红色”、“注意打哈欠”。
    • 作用:这些提示词不需要重新训练整个大脑,只是临时调整一下搜索的“滤镜”,让电脑瞬间明白你真正想要什么。这就像给电脑戴了一副特制的**“找茬眼镜”**。
  • 方法二:FSIR-CTR(像“全能翻译官”)

    • 比喻:这是一个更聪明的**“翻译官”(多模态大模型 MLLM)**。你给它看一张参考图,再给它一段文字描述。它不仅能看懂图,还能把图和文字“融合”在一起,变成一种新的、更精准的“搜索指令”,直接发给底层的图库。
    • 作用:它能把“文字描述”和“参考图片”合二为一,生成一个完美的搜索信号。哪怕你给它的参考图是它以前没见过的,它也能通过类比学会怎么找。

3. 结果怎么样?

实验证明,这两种方法都比传统的“死记硬背”式搜索要厉害得多:

  • 更准:在复杂的组合搜索(比如“红衣服 + 打哈欠”)和罕见场景搜索中,准确率大幅提升。
  • 更灵活:不需要重新训练整个庞大的电脑大脑,只需要利用那几张参考图就能快速优化。
  • 实用:这种方法已经在华为的实际云服务和视频管理中开始使用了,能帮用户快速从海量监控或视频中找到特定目标。

总结

这就好比以前的搜索是**“盲人摸象”(只靠文字猜),现在的搜索变成了“看图说话 + 指路”**(文字 + 参考图)。

这篇论文的核心贡献就是:

  1. 造了个新考场(FSIR-BD),专门测试这种“看图 + 指路”的能力。
  2. 教了电脑两招(FSIR-PL 和 FSIR-CTR),让它学会利用用户给的少量例子,瞬间提升找图水平。
  3. 证明了:让电脑像人类一样,通过“看几个例子”来学习新任务,是缩小机器与人类理解差距的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →