← 最新论文
💻 computer science

Visual, OCR-Text, and Hybrid Evidence Retrieval for Document Visual Question Answering: A Controlled Failure Analysis

本研究表明,尽管与基于词法的方法相比,基于视觉的页面检索显著提高了文档视觉问答中的证据选择和下游回答质量,但由于即使在提供正确页面的情况下仍存在生成答案的局限性,性能差距依然显著,且混合融合相较于仅使用强大的视觉检索器并无额外收益。

原作者: Richmond Ampah-Mensah, Muhammad Munsarif, Muhammad Sam`an

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Richmond Ampah-Mensah, Muhammad Munsarif, Muhammad Sam`an

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图回答一个关于复杂文档(如医疗报告或财务账本)的问题,但你无法亲自阅读这些文字。相反,你必须依赖计算机系统,先从海量的纸堆中找到正确的那一页,然后再阅读那一页以给出答案。这就是文档视觉问答(Document Visual Question Answering)所面临的挑战。该系统面临两个截然不同的障碍:它必须在数千页文档中定位到正确的证据,然后必须正确解读那一页上的文本、图表和表格以形成答案。如果系统选错了页面,无论它多么聪明都会失败。如果它选对了页面,但读错了一个数字或遗漏了一个关键细节,它同样会失败。了解系统的崩溃点对于构建能够真正协助处理复杂文书工作的工具至关重要。

一组研究人员致力于调查这些故障究竟发生在何处。他们设计了一个受控实验,将“寻找页面”的任务与“回答问题”的任务分离开来。他们测试了计算机“观察”文档的不同方式。一种方法依赖于将页面上的文本转换为单词列表,本质上是将文档视为一个简单的文本文件。另一种方法则允许计算机直接观察页面的实际图像,识别布局、表格的位置以及视觉结构,而无需预先阅读每一个单词。他们还尝试将这两种方法结合起来,希望通过将基于文本的搜索与基于图像的搜索相结合,创造出一个永不遗漏线索的完美系统。

研究人员使用大量的文档问题进行了数千次测试。他们发现,采用视觉方法(即计算机直接观察页面图像)的方法在寻找正确页面方面明显优于基于文本的方法。当系统使用视觉方法时,它找到正确页面的概率超过一半。相比之下,基于文本的方法找到正确页面的概率仅为三分之一左右。这种差异对最终答案产生了重大影响。当系统获得由视觉方法找到的页面时,答案的质量有了显著提升。然而,研究人员发现,仅仅找到正确的页面并不足以保证得到正确的答案。即使他们强迫系统使用那个完美的页面——即人类已知包含答案的那一页——计算机仍然难以生成正确的响应。在这些情况下,系统失败(未能正确回答)的概率超过一半,通常是由于在处理数字、格式或解读复杂图表时遇到了困难。

团队还测试了结合文本和视觉方法是否能解决问题。他们创建了一个混合系统,该系统获取来自文本搜索和图像搜索的结果,并尝试将它们合并为一个更优的列表。令人惊讶的是,这种结合并没有改善结果。由于视觉方法本身已经比文本方法强大得多,文本搜索往往会拖累合并后的结果,导致系统错失那些它原本可以靠自身能力找到的页面。研究人员得出结论:虽然观察页面图像是寻找证据的一种更优方式,但目前最大的障碍不在于寻找页面,而在于理解页面。计算机仍然需要更好地阅读它所发现的内容,尤其是当这些内容涉及数字、表格或特定的视觉布局时。这项研究表明,仅仅改进搜索工具并不能解决问题;系统还必须成为一个更加细致且准确的阅读者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →