MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A
MM-BizRAG 引入了一种多模态检索增强生成框架,该框架通过将企业文档动态路由至特定方向的解析流水线,以显式捕获结构化信息,在问答准确率上显著优于现有的以视觉为中心的基准模型,同时提供了一种名为 FastRAGEval 的具有成本效益的评估指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你在一个巨大的、混乱的图书馆里工作,这里的书有两种截然不同的形状:高而窄的报告(比如财务报表)和宽而扁的幻灯片(比如 PowerPoint 演示文稿)。
长期以来,试图回答这些书相关问题的“机器人”(AI 系统)一直采取一种偷懒的方法。它们被告知只需给每一页拍张照片,然后把这些照片喂给机器人的大脑。它们希望机器人仅通过观察图片就能“猜出”页面的结构。
问题所在:
这种“仅靠照片”的方法在处理简单的幻灯片时表现尚可,但在面对复杂的报告时却彻底失败了。这就像是试图通过一张模糊的照片来理解一份详细的蓝图。机器人会错过表格中的具体数字、文本的流向,以及图表与旁边段落之间的关系。它太忙于观察“全貌”,以至于忽略了重要的细节。
解决方案:MM-BizRAG
作者们构建了一个名为 MM-BizRAG 的新系统。与其将所有文档一视同仁,这个系统更像是一位知道如何处理不同类型书籍的聪明图书管理员。
它是这样运作的,这里使用了一些简单的类比:
1. “智能分类器”(文档结构感知切分)
当一份文档到达时,系统首先会询问:“这是一份高窄的报告还是一份宽扁的幻灯片?”
- 如果是报告(纵向): 系统不仅仅是拍张照。它会仔细地将文档切分成碎片,读取文本、提取表格并描述图像。它会记录下每样东西在页面上的“位置”,就像一位拼图高手在按顺序整理拼图块一样。
- 如果是幻灯片(横向): 系统意识到,在幻灯片上,文本、图像和图表是混合在一起来讲述一个完整故事的。因此,它将整个幻灯片视为一个单一单元,一次性描述整个场景。
2. “双背包策略”(检索与生成的解耦)
这是该系统的核心秘诀。大多数其他系统试图把所有东西都塞进一个背包里去寻找答案。而 MM-BizRAG 使用了两个不同的背包:
- 背包 A(用于搜索): 它包含简化的、以文本为主的摘要和描述。它很轻量且快速,使得在成千上万的文档中搜索并找到正确的文档变得非常容易。
- 背包 B(用于回答): 一旦找到了正确的文档,系统就会取出那些完整的、丰富的版本(包括实际的图像和表格),并完美地组装起来,以生成最终答案。
为什么这很重要: 这就像是使用一张廉价、快速的地图来寻找一座城市(背包 A),一旦抵达,再使用高清的 3D 模型来为你的导游提供最好的路线指引(背包 B)。你既拥有了搜索引擎的速度,又拥有了人类专家的深度。
3. “一瞥即判”的评委(FastRAGEval)
为了测试他们的系统是否真的优秀,他们需要一种能够为答案评分的方法。现有的评分工具就像一位老师,必须阅读答案,将其拆解成一个个微小的句子,逐一检查,然后再写出一份报告。这既费时又费钱。
作者发明了 FastRAGEval,它就像一位超级快速的老师,只需扫一眼就能读完整个答案,检查事实并给出评分。它比旧方法快了两倍,并且与人类评委的判断一致性更高。
结果
当他们用这个新系统与“仅靠照片”的机器人进行对比测试时:
- 对于报告: 这是一个巨大的胜利,准确率提升了高达 32%。系统终于理解了那些其他系统会错过的复杂表格和图表。
- 对于幻灯片: 它的表现与最好的基于照片的系统一样出色,证明了在处理幻灯片时并不需要忽略文本。
- 速度: 他们找到了一个“甜点位”配置,其准确度几乎与最复杂的版本相当,但运行速度快了约 两倍。
总结
本文认为,我们不应该仅仅依赖 AI 通过观察图片来“猜”文档的结构。相反,我们应该根据文档的形状对其进行主动解析(拆解),使用快速的方法找到正确信息,并在需要编写最终答案时,才组装起丰富的细节。这种方法让 AI 变得更加聪明,尤其是在处理企业日常使用的复杂文档时。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。