HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering
HierDoc 引入了一种层级化的两阶段证据路由框架,该框架通过使用具有结构化集合奖励的阶段性 GRPO,顺序优化页面选择与区域提取,通过有效地弥合粗粒度页面获取与细粒度区域定位之间的差距,在长文档视觉问答领域实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解开一个谜题,但你拿到的不是单一的线索,而是一叠一百本厚厚的、带有插图的书。答案就隐藏在其中——也许是第42页上的一个小图表,或者是第89页表格中的某句特定文字。这就是*文档视觉问答(Document Visual Question Answering)*的世界。这是人工智能的一个分支,计算机试图阅读并理解那些充满了图片、图表和混合文本的文档。长期以来,这些计算机“读者”就像只能一次看一页书的学生,或者它们会试图一次性阅读整叠书,结果被信息淹没并错失了微小的细节。巨大的挑战在于,如何找到那份准确*的页面,然后精准地缩放到那个准确*的位置,而不至于在噪音中迷失方向。
现在,来认识一下 HierDoc,一种像超级聪明的两步走侦探一样处理这些庞大文档堆的新方法。以前,大多数计算机系统要么像是一个抓起整本书并寄希望于答案就在其中的人,要么是像一个被递给特定页面并被要求在草堆里找针的人。它们很少能同时做好这两个步骤。HierDoc 通过将工作拆分为两个截然不同的、专业化的任务,改变了游戏规则。首先,一个“页面策略(Page Policy)”充当侦察兵,快速扫描整个文档,挑选出那些极有可能包含答案的页面。这就像一位知道该从书架上抽取出哪三本书的图书管理员,从而忽略掉其他的九十七本。
一旦选定了正确的页面,第二个“区域策略(Region Policy)”就会接管。这个部分就像是一个手持放大镜的侦探,观察这些特定的页面,并找到包含线索的具体段落、图表或表格单元格。它会忽略页面的其余部分,只专注于相关的“区域”。论文表明,通过将这些视为两个独立的、经过优化的步骤,系统在寻找答案方面变得更加出色。在针对困难的长文档谜题测试中,这种两步走的方法显著提高了准确率——具体来说,与之前表现最好的开源系统相比,它在某项主要测试中提升了 16.87% 的性能。更有趣的是,研究人员发现,在仅仅选择页面的基础上增加这种细粒度的“区域”搜索,使系统的准确率提升了 5.51%,并在寻找正确线索的能力(以 F1 分数衡量)上提升了 4.82%。
其秘诀不仅在于它观察得更多,更在于它如何学会忽略错误的东西。该系统使用了一种名为 GRPO(组相对策略优化,Group Relative Policy Optimization)的训练方法,这就像一位给团队提供反馈的教练。教练不仅仅是说“做得好”或“做得不好”,而是将不同的尝试进行并排对比。如果系统选择了过多的页面,它会受到惩罚;如果它错过了正确的线索,它也会受到惩罚。它学会了在彻底性与精确性之间取得平衡。论文明确反对那种认为你需要把整个文档喂给计算机,或者可以仅仅依靠一个大型模型来完成所有工作的观点。相反,他们证明了将问题分解为“寻找页面”然后“寻找位置”的效果要好得多。
然而,作者也谨慎地指出,这并不是解决一切问题的万灵药。由于该系统是分步工作的,如果第一步(页面策略)完全漏掉了正确的页面,那么第二步就无法挽救,证据将永远丢失。此外,该系统依赖于一个解析器(名为 MinerU 的工具)将页面分解为区域,因此如果该解析器出错或文本非常混乱,系统的选择空间就会受到限制。但就目前而言,HierDoc 展示了将计算机的搜索过程组织成一个清晰的层级路径——从宏观全景到微观细节——是帮助机器阅读长篇、复杂文档的一种强大方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。