MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning
该论文提出了 MCite-RL,一种引用增强型智能体强化学习框架,通过引入用于动态视觉引用的迭代智能体细化模块以及旨在共同优化答案准确性和来源可追溯性的双层奖励机制,提升了多模态 RAG 的可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字时代,人工智能已经学会了以非凡的技巧阅读文本和观察图片。当这些系统被问及复杂问题时,它们通常会转向文档库来寻找正确答案,这一过程被称为检索增强生成。想象一下向图书管理员询问一个特定的事实:图书管理员找到那本书,阅读那一页,然后告诉你答案。多年来,这一系统在仅处理文本时表现良好。然而,随着这些人工智能模型变得越来越先进,它们已开始处理充满图表、图形和照片的文档。现在的挑战不仅在于找到正确的一页,还在于精确地指向那一页上的特定位置——即证明答案属实的图表中的微小部分或照片中的一个小方框。如果没有这种指向证据的能力,该系统就像一名在考试中给出了正确答案却无法展示解题过程的学生,让老师无法验证学生是真的理解了材料,还是仅仅在瞎猜。
来自北京大学和松下连接(Panasonic Connect)的研究小组开发了一种新方法,旨在解决视觉世界中“展示解题过程”的问题。他们将该系统称为 MCite-RL。其核心思想是教导人工智能不仅仅是寻找答案,而是将寻找证据的过程视为一次细致、循序渐进的调查。该系统并非通过一次快速扫视来猜测证据的位置,而是接受训练,使其表现得像一名侦探:通过缩放文档、剪掉无关部分,并不断缩小搜索区域,直到只剩下关键信息为止。这一过程由一种新型学习引导,在这种学习中,人工智能收到的反馈不仅取决于最终答案是否正确,还取决于它在寻找视觉证据的过程中表现如何。
研究人员发现,以往的方法通常会在两个特定方面失败。有时,人工智能指向的图片范围过大,例如覆盖了整个图表而非所需的单个数字,导致引用失去验证意义。另一些时候,人工智能给出了正确的答案,但指向了图像中完全不同的部分,仿佛答案与证据之间是脱节的。为了解决这个问题,该团队创建了一个结合了“冷启动”阶段和强化学习阶段的训练过程;在冷启动阶段,人工智能学习搜索和裁剪图像的基本步骤;在第二个阶段,人工智能在许多不同的场景中进行演练,尝试寻找答案及其证据。如果它成功地将图像缩小到正确的地点并得到了正确答案,它就会获得奖励。如果它迷失了方向或指向了错误的区域,它就会从错误中学习。
该方法的成果在包括财务报告和长篇维基百科页面在内的三组不同挑战性文档上进行了测试。新系统显著优于现有方法。在一项主要测试中,与标准方法相比,它在指向正确视觉证据的精确度上提升了 26% 以上。或许更令人惊讶的是,通过强制人工智能精确指出其获取信息的来源,该系统在获取正确答案的能力上也得到了提升,准确率平均上升了近 6%。研究表明,当人工智能接受关于其来源严谨性的训练时,它整体上会变得更加可靠。研究人员指出,虽然该系统是一个重要的进步,但在高风险情况下仍需要人类的仔细监督,且目前最适用于单张图像而非复杂的、多页的文档。最终,这项工作证明了教导人工智能指向其证据,不仅是一种验证其工作的方式,也是一种帮助其更清晰思考的强大工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。