← 最新论文
💻 computer science

FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

该论文提出了 FiRE,这是一个通过引入自动化细粒度数据集构建流水线以及一种将上下文推理与检索对齐解耦的两阶段微调策略,从而增强多模态大语言模型在复杂图像检索任务中表现的创新框架,旨在实现卓越的零样本性能。

原作者: Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen, Meng Liu, Yupeng Hu, Xiangyu Zhao

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen, Meng Liu, Yupeng Hu, Xiangyu Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一个庞大且混乱的数字图书馆中寻找一张特定的照片。通常情况下,你可能会输入像“狗”或“日落”这样简单的词汇,然后计算机就会找到匹配这些简单词语的图片。但如果你的搜索变得复杂得多呢?比如,你想找一张金毛寻回犬的照片,但它必须特别是在戴着一顶红帽子、站在雨中、看起来很忧伤、同时还拿着一把蓝色雨伞的状态?或者,如果你想根据刚才进行的一段关于你所寻找目标的漫长对话来寻找图像呢?这就是“细粒度图像检索”的世界。

为了解决这些棘手的谜题,科学家们一直在构建“多模态大语言模型”(MLLMs)。把这些模型想象成能够同时阅读文本和观察图片的超级智能机器人。它们就像一位图书管理员,既能理解你讲述的长篇且详细的故事,又能瞬间从书架上抽出那本(或那张)完全符合每一个细节要求的书(或照片)。然而,直到目前为止,这些机器人在面对过长的故事或过于具体的细节时,表现得还有些笨拙。它们经常会忽略掉微小的关键点,比如帽子的颜色或狗狗的情绪,因为它们还没有被教会如何去关注故事中那些细微且重要的部分。这篇论文提出了一个问题:我们该如何教这些机器人成为能够注意到每一个细节的侦探大师?

由 Bohan Hou 及其同事领导的研究团队决定给这些图像搜索机器人进行一次全面的升级。他们意识到,以往的方法就像是试图通过只展示单个句子来教学生写小说。学生们(AI 模型)虽然掌握了大致思路,却丢失了丰富的细节语境。为了解决这个问题,团队创建了一个全新的训练系统,名为 FiRE(细粒度多模态微调)。

首先,他们构建了一个庞大的全新训练库,名为 FiGMaQ。想象一下,他们拿到了数千张照片,并且并没有仅仅为它们贴上像“猫”这样简单的标签。相反,他们使用了一种强大的 AI 为每一张照片编写了极其冗长且详细的描述——这些描述超过 100 个单词,讨论了猫的毛发质感、房间的颜色、光线照射在地板上的方式,甚至连猫的神情也涵盖在内。他们还创建了非常拟人化的“修改”指令。与其说“把猫变成狗”这种过于机械的说法,不如说指令是像“让动物看起来稍微小一点”或“在背景中多加几个人”这样。这给了机器人一个包含 8 7,000 个复杂案例的庞大集合来学习,从而教会它们理解图像之间的微妙差异。

接下来,他们通过一种特殊的两步走策略来训练这些机器人,这就像是一个有两个学期的课程。在第一个学期,机器人练习“上下文推理”。它们会被展示一张图片和一组指令(例如“移除猎物并从更近的角度拍摄”),然后必须描述出新图片看起来会是什么样子。这迫使它们真正理解图像背后的故事。在第二个学期,它们练习“检索”。既然它们已经擅长理解故事了,现在它们要学习将这些故事与图书馆中的正确图片进行匹配。通过将这两项技能分开练习,机器人比同时尝试这两项技能的效果要好得多。

结果令人印象深刻。当研究人员用这个升级后的新机器人与其他顶尖模型进行对比测试时,它在几乎所有类别中都胜出了。它在处理最困难的任务时表现尤为出色,比如根据长篇、详细的描述或对话来寻找图像。尽管他们的机器人比一些正在竞争的巨头模型更小、更轻量化,但它找到正确图片的频率更高。例如,在用户要求对图像进行特定修改的测试中,这种新方法比之前的最佳模型更能精准找到目标图像。论文指出,通过专注于细粒度细节并以两个清晰的阶段进行教学,我们可以让图像搜索变得更加聪明,并更好地满足现实世界的需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →