Reason Before You Retrieve: Agentic Planning for Multi-modal RAG
本文提出了 MM-R2,这是一个多模态智能体框架,通过对检索目标进行显式推理并利用知识图谱(KnowledgeMap)构建结构化的搜索空间,从而改进了检索增强生成,该框架由一个新的轨迹数据集和两阶段后训练策略支持,旨在实现基准数据集上更优的准确性和可解释性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图破解一个谜题,但你手头没有单一的线索,而是一个巨大的、杂乱无章的堆叠:书本、照片和地图都被扔进了一个大箱子里。这就是“多模态检索增强生成”(Multimodal Retrieval-Augmented Generation,简称 mRAG)的世界。这是一种高级说法,意指我们希望计算机能够通过查阅庞大图书馆中的事实来回答关于图片的问题。通常情况下,当计算机尝试这样做时,它的表现有点像是在大型超市里手忙脚乱的购物者:它抓取一个问题,向整个商店大喊,并寄希望于它在货架上找到的前几个物品就是正确的。问题在于,计算机经常抓错东西,因为它并不真正理解自己到底在寻找什么,或者那个东西可能隐藏在商店的哪里。这就像是要求寻找“红色的车”,结果计算机却得到了一张红苹果的照片,因为计算机只看到了“红色”这个词,就抓取了它能看到的第一个红色的东西。
这正是这篇新论文发挥作用的地方。研究人员意识到,在开始搜索之前,你需要停下来思考。他们将这个新系统称为 MM-R2,代表“先推理,后检索”(Reason Before You Retrieve)。MM-R2 不再是盲目地向虚空呐喊,而是扮演一名聪明的侦探。首先,它将图片和问题结合起来观察,以确定具体的“线索”(照片中的特定物体)以及需要什么样的信息。然后,它不再搜索整个混乱的箱子,而是咨询一张特殊的、有组织的图书馆地图,称为“知识图谱”(KnowledgeMap)。它会挑选正确的货架,取出正确的书,阅读它,并决定是否需要去别处寻找。论文指出,通过这种“先思考”的步骤,计算机能够更好地找到正确的答案,甚至可以展示它的解题过程,证明它是如何破解谜题的。
侦探的新策略
这篇论文的核心思想是,目前的计算机过于急于行动了。当你向计算机展示一张照片并问“这张照片里是什么种类的鸟?”时,目前的系统往往只是将文字和图像强行揉合在一起,然后开始同时搜索所有内容。作者认为这是一个错误。他们发现,这些系统之所以会感到困惑,是因为它们不知道图像的哪一部分是重要的,或者需要什么样的具体事实。这就像是试图在图书馆里寻找特定的食谱,却在每一本书中都搜索“蛋糕”这个词,而不是直接去“烘焙”专区。
为了解决这个问题,团队构建了 MM-R2,一个强制要求计算机在搜索前先暂停并计划的系统。他们将过程分解为三个有趣的步骤:
- “什么”与“哪里”的计划: 在搜索之前,系统会创建一个“检索状态”。可以把它想象成写一份完美的购物清单。它识别出信息需求(我需要知道什么?)、定位参照物(我正在谈论照片中的哪个特定物体?)以及约束条件(我需要日期吗?地点吗?科学名称吗?)。这能防止计算机被无关细节分散注意力。
- 有组织的地图(知识图谱): 研究人员意识到,搜索一个扁平且混乱的事实列表是低效的。因此,他们将他们的图书馆组织成了知识图谱。想象一下,图书馆不仅仅是一堆书,而是一组贴有整齐标签的箱子:一个箱子放“鸟类”,一个放“汽车”,一个放“历史”。当计算机有了它的购物清单后,它不会搜索整个图书馆;它首先决定打开哪个箱子。这被称为“路由”(routing)。
- 侦探循环: 一旦计算机选择了正确的箱子(检索单元),它就会在该箱子内部搜索具体的答案。如果找到了答案,太好了!如果没有,它可以决定选择另一个箱子或提出一个更具体的问题。它会不断重复这个过程,直到它拥有足够的证据来破案。
他们如何教会计算机思考
你可能会问:“计算机是如何学习像侦探一样进行计划的?”作者并没有只是告诉计算机“要聪明”。相反,他们创建了一个庞大的训练数据集,称为 MM-R2-Traj。该数据集包含 90 万个“思维过程”的示例。
想象一位老师在教学生如何解开一个谜题。老师不仅给出答案,还会展示步骤:“首先,观察角落里的碎片。然后,按颜色分类。接着,尝试把这两个拼在一起。”研究人员使用了一个“老师”AI 来为“学生”AI 生成这些循序渐进的故事。他们教会学生:
- 分析图片和问题以制定计划。
- 选择正确的“箱子”(知识图谱单元)。
- 在那个箱子里提出一个具体的问题。
- 总结它所发现的内容。
- 决定是结束任务还是需要再次查看。
他们通过两个阶段对计算机进行训练。首先,他们使用了监督式微调(SFT),这就像学生抄写老师的笔记以学习基本规则。然后,他们使用了群体相对策略优化(GRPO),这就像一场游戏,学生尝试不同的策略,如果得到了正确答案,就会获得高分;如果答错了,它就会学习下次尝试不同的路径。这帮助计算机变得非常擅长做出正确的选择。
结果:更聪明、更清晰
当他们在两个重大挑战——InfoSeek(一个包含 130 万个图像-问题对的数据集)和 Encyclopedic VQA(百科全书式知识测试)上测试 MM-R2 时,结果令人印象深刻。
在 InfoSeek 测试中,MM-R2 的整体正确率达到了 54.3%。这是一个巨大的飞跃,因为其他智能系统通常仅在 46-47% 左右徘徊。在测试的特定“未见问题”(Unseen-Question)部分(即计算机必须处理从未见过的问题),MM-R2 得分 56.0%,大幅领先于之前的最佳水平。即使在 Encyclopedic VQA 测试中,它也达到了 39.4%,表明即使在问题非常具体且困难的情况下,它也能表现出色。
但论文暗示,比单纯提高分数更重要的东西是:透明度。因为 MM-R2 会规划它的步骤,所以我们实际上可以看到它是如何解决问题的。
- 更好的路由: 该系统正确选择了正确的“箱子”(知识图谱单元)的概率为 74%,而旧系统仅为 23%。它不再浪费时间在错误的地方寻找。
- 更清晰的解释: 当系统解释其答案时,它的表达更加简洁且聚焦。其“忠实度”(Fidelity)得分(用于检查答案是否真正源自所找到的证据)为 0.90,这意味着答案几乎完全基于它找到的事实,而不是凭空猜测。
这意味着什么
论文表明,仅仅“搜索一切”的旧方法正在撞墙。通过强制计算机在检索之前进行推理,我们可以构建出不仅更聪明而且更值得信赖的系统。它们不只是猜测,而是遵循逻辑路径,检查自己的工作,并能准确展示它们是如何找到答案的。这是在混乱的寻宝游戏与周密的侦探任务之间的区别。虽然研究人员指出,这是一种针对多模态 AI 的特定方法,并不能解决世界上所有的难题,但结果表明,在行动之前停下来思考一下,是未来智能计算机的一种强大策略。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。