When Does Layout Matter? A Comparative Study of Retrieval Strategies for Reliable Business Document Question Answering
本文研究了各种检索策略在商业文档问答中的有效性,揭示了最优方法取决于文档的复杂度:布局感知方法在多页上下文中表现出色,而视觉页面嵌入在单页表格中表现更好,最终强调了证据检索与答案生成之间存在的关键差距。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一座巨大的图书馆里寻找一个特定的事实。如果这座图书馆里只有简单的故事书,你只需要扫描文本,将页面剪成小条,然后把正确的条目交给一个超级聪明的机器人去阅读即可。这便是目前大多数计算机系统处理文档问题的方式:它们将文本切碎,并寻找最佳匹配。但当图书馆里装满了复杂的商业表格、财务报告或多页工业手册时,情况会发生什么变化呢?这些文档不仅仅是行行文字;它们就像复杂的地图,页面的“形状”至关重要。一个数字位于特定标题下的特定方框内,其含义与该数字在段落中漂浮的含义完全不同。如果你将这些文档压平为简单的文本条,你可能会丢失整个“地图”,导致机器人对在哪里寻找或这些数字究竟意味着什么感到困惑。这正是研究人员试图解决的谜题:弄清楚究竟在什么时候,文档的物理布局是解锁答案的关键,而在什么时候它仅仅是多余的噪音。
在这项研究中,研究员徐张锦(Zhangjin Xu)着手测试了多种搜索这些复杂文档的方法,以观察哪种方法能让计算机最可靠地回答问题。团队对比了五种不同的策略,从简单的文本块到能够像人类一样“看见”整个页面的先进方法。他们在两种截然不同的文档挑战上测试了这些方法:MP-DocVQA,涉及需要从许多页面中找到正确页面的多页工业文档;以及 TAT-DQA,侧重于充满表格和数字的单页财务报告。
结果揭示了一个令人惊讶的转折,就像一场“角色互换”的游戏,最好的工具完全取决于具体的工作。对于多页工业文档(MP-DQA),关注布局(通过位置和形状对文本进行分组)的方法成为了明显的赢家。它在 26.1% 的时间内将正确页面作为首选结果(Recall@1),这几乎是仅观察页面视觉图像的方法(13.4%)成功率的两倍。看来,当你面对一叠许多页面时,知道文本的“地址”比仅仅识别图片更重要。
然而,对于单页财务报告(TAT-DQA),故事发生了完全的反转。在这里,将页面视为图像的视觉方法成为了冠军,它找到了 92.3% 的正确页面。而侧重于布局的方法则落后于它,仅为 84.9%。这表明,对于整洁的单页表格,整体视觉结构非常独特,计算机几乎可以仅通过“看见”它就瞬间识别出正确的页面。
研究人员还尝试了一种名为 LaMM-RAG 的“混合”方法,它结合了布局搜索和视觉搜索的优势。在多页文档中,这种融合帮助系统在排名前五的结果中找到了更多正确的页面(从 62.7% 提升到 67.2%),但它并没有真正帮助系统选出排名第 1 的最佳页面。这就像是在一个黑暗的房间里增加更多的探照灯;你能看到更多的房间,但不一定会更快地找到丢失的钥匙。
尽管在寻找正确页面方面有所改进,但研究发现,一旦找到了证据,计算机在给出正确答案方面仍然感到吃力。在财务报告上,即使系统找到了正确的页面,它也经常无法完成数学计算或选对表格中的单元格,导致数值类问题的得分较低。在多页文档上,主要问题在于根本找不到正确的页面。研究得出结论,不存在“一劳永逸”的解决方案。相反,最好的策略取决于文档本身:如果你处理的是一叠页面,请专注于布局;如果你处理的是单个复杂的表格,请专注于视觉图像。核心启示是,我们需要聪明地对文档进行切割,使我们的搜索工具与问题的形态相匹配。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。