← 最新论文
💻 computer science

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

本文介绍了 UniME-R1,这是一个统一的多模态检索框架,它利用难负样本来训练一个顾问模型,从而根据初始检索失败的情况生成以检索为中心的思维链(RC-CoT)推理过程,进而优化查询表示,并显著提升了相对于现有基准模型的检索性能。

原作者: Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一大堆混乱的干草堆中寻找一根特定的针。但这不仅仅是一个普通的干草堆;这是一个充满了数十亿张照片、视频和文档的数字图书馆,所有这些媒介都混杂在一起。这就是**多模态检索(multimodal retrieval)**的世界——这是人工智能的一个分支,计算机试图同时理解并搜索不同类型的媒体。为了实现这一目标,AI 使用“嵌入器”(embedders),它们就像超级聪明的图书管理员,将每一张图像和每一句文本转化为独特的数学指纹。当你提出问题时,图书管理员会将你的问题指纹与图书馆中的指纹进行对比,以找到最佳匹配。

然而,图书管理员有时也会感到困惑。如果你要求找一辆“红色的火车”,图书管理员可能会抓取一辆“蓝色的火车”,因为它们看起来都是火车;或者抓取一辆“银色的火车”,因为它们的颜色很接近。图书管理员看到了大局,却忽略了让你的请求变得独一无二的微小、关键的细节。一段时间以来,科学家们试图通过教 AI 在搜索之前“大声思考”(即生成一段关于为何进行搜索的长篇理由)来修复这个问题。但本文指出,在观察之前进行“思考”往往只是在瞎猜。真正的魔力发生在:当你看到你找到了什么,意识到它错了,然后思考它为什么错了。


论文:从错误中学习,寻找正确的“针”

这篇论文介绍了一个名为 UniME-R1 的新系统,由 Glint Lab 的研究人员创建。请不要把 UniME-R1 仅仅看作一个单一的图书管理员,而要把它看作一个由两个角色组成的动态团队:搜索者(Searcher)教练(Coach)

旧方法:观察前的盲目猜测
以前,AI 系统试图通过在开始搜索之前生成“思维链”(Chain of Thought, CoT)来表现得更聪明。想象一下你让朋友找一个特定的电影场景。他们会说:“好的,我需要找一个有红车和狗的场景,”然后才开始搜索。问题在于,他们可能仍然无法达到目标,因为他们在开始之前并不知道搜索引擎实际找到了什么。他们只是在描述查询内容,而不是在修正搜索引擎的错误。

新方法:教练及其反馈
UniME-R1 改变了游戏规则。这个团队是如何运作的:

  1. 第一次搜索: 搜索者(一个“嵌入器”)快速扫描图书馆,并提取出大约 10 个看似符合你要求的搜索结果。
  2. 教练的审查: 这是见证奇迹的时刻。教练(一个“顾问”)查看这些前 10 个结果,并将它们与你的原始请求进行对比。它会问自己:“搜索者为什么要选这些?是什么让他们产生了误解?”
    • 示例: 如果你要求找一辆“正在载客的银色火车”,而搜索者带来的是一辆“车站里的银色火车”,教练会注意到缺失的细节:乘客正在登车
  3. 决策: 教练随后会做出一个明智的选择:
    • 情景 A(修复很容易): 如果正确答案已经在前 10 个结果中,只是排在后面,教练只需重新对列表进行排序即可。无需再次搜索整个图书馆!
    • 情景 B(修复很难): 如果正确答案根本不在其中,教练会写下一条全新的、极具针对性的指令,称为检索中心思维链(Retrieval-Centric Chain-of-Thought, RC-CoT)。这不仅仅是一个描述,而是一个修正。它会说:“忽略那辆通用的火车,专门寻找正在登车动作。”随后,搜索者会使用这条新指令在整个图书馆中重新进行搜索。

为什么这与众不同
论文指出,以往的大多数方法就像是一个只顾着读教科书而从未参加过模拟测试的学生。他们根据自己认为问题所在进行推理。而 UniME-R1 则像是一个参加了模拟测试,看到了自己错在哪,然后专门针对这些错误进行学习的学生。论文明确排除了为图书馆中的每一个项目都生成复杂推理的想法(因为这太慢了)。相反,它专注于仅针对初始搜索的失败情况进行推理。

他们的发现
研究人员在一个名为 MMEB-V2 的大规模基准测试上测试了这个系统,该测试包含数千张图像、视频和文档。他们发现 UniME-R1 始终优于现有的最强方法。

  • 在“小型”模型规模(20 亿参数)下,UniME-R1 得分为 69.9,大幅领先于次优方法。
  • 在“中型”模型规模(40 亿参数)下,其得分为 70.3
  • 该系统还在 Flickr30K 和 COCO 等通用任务上进行了测试,继续表现出色,甚至超越了规模大得多的其他模型。

他们如何训练教练
为了教教练如何识别错误,研究人员并没有仅仅给它正确答案。他们创建了“硬负样本(Hard Negatives)”——即看起来与正确答案非常相似但实际上是错误的干扰项。他们使用了一种名为强化学习(具体为 GRPO)的技术,这就像玩电子游戏一样:教练如果能正确识别错误并写出能让下一次搜索找到正确答案的修正方案,就会获得积分。随着时间的推推移,教练学会了变得非常精准。

核心结论
论文表明,提升 AI 搜索能力的诀窍不仅在于让 AI 变得更聪明或更大,而是在于让它具备自我纠错能力。通过让 AI 观察自己的初始错误并生成针对性的修复方案,UniME-R1 能比那些仅仅在观察前进行猜测的系统更快、更准确地在干草堆中找到那根正确的针。作者们证明,这种方法适用于各种类型的媒体,从短视频到复杂的文档,证明了“从失败中学习”是未来 AI 搜索的一种强大策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →