ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval
ConceptFormer 是一个用于视觉文档检索的新颖框架,它通过学习自适应的、由查询条件的潜在概念,来有效地弥合查询与复杂文档结构之间的语义鸿沟,在不依赖中间文本描述或原始视觉标注的情况下,实现了相对于现有基准模型的显著性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字时代,海量的文档库并非以整齐的文本行形式存在,而是呈现为复杂的视觉景观。这些页面充满了图表、地图、表格和复杂的布局,问题的答案可能隐藏在一个图表上的微小数字,或是两个彩色区域之间的空间关系之中。在成千上万的文档中寻找正确的一页,这项任务所要求的不仅仅是阅读文字,更需要理解文本、图像与结构是如何协同工作的。多年来,试图寻找这些文档的计算机系统一直难以应对这种复杂性。它们通常将整个页面视为一张模糊的单一图像,或者试图将整个视觉场景转换为纯文本,而这个过程往往会丢失那些使文档发挥作用的关键细节。当系统无法看到图表中包含答案的具体部分,或者当它忽略了连接标题与数据点的布局时,它就会无法检索到正确的信息,导致用户面对的是一堆无关的页面。
东北大学和清华大学的研究人员开发了一种名为 ConceptFormer 的新方法来解决这个问题。与其强迫计算机在“看图片”或“读文字”之间做出选择,该系统学会了在两者之间建立一座灵活且无形的桥梁。其核心思想是:回答一个问题所需的证据,其大小和形状对于每一个查询来说很少是相同的。有时,一个问题只需要一个微小的细节,比如表格中的一个数字;而另一些时候,则需要理解一个跨越半个页面的大型复杂图表。以往的系统试图用一种固定、僵化的方法来处理所有这些情况,要么观察整个页面,要么将其分解为细小的均匀碎片。然而,ConceptFormer 学会了适应。它创建了一组动态的“潜在概念”(researchers use this term to describe flexible, internal representations of the evidence)——研究人员用这个术语来描述灵活的内部表示——这些概念会根据回答特定问题实际所需的视觉信息量,进行增长或收缩。
为了教导系统如何做到这一点,研究人员使用了一个强大的视觉-语言模型作为训练过程中的向导。这个向导观察问题和正确的文档页面,然后识别出图像中包含答案的具体部分。如果答案是角落里的一个小数字,向导就只标记那个小区域;如果答案涉及一个包含多个部分的复杂图表,向导就会标记整个相关区域。随后,系统会计算有多少个小的视觉“补丁”或图像碎片被这些标记区域所覆盖。基于这个计数,系统会自动决定为该特定的“问题-文档”对创建多少个内部概念标记(concept tokens)。一个简单的问题会得到一组短小、集中的概念,而一个复杂的问题则会得到一组更长、更详细的概念。这使得系统能够学习到:有些问题需要宏观视野,而有些问题需要微观聚焦,且无需预先告知。
这一方法的成果是显著的。在针对包括工业报告、信息图表和统计地图在内的各种文档类型进行测试时,新系统表现优于现有的最佳方法。与最强的视觉搜索系统相比,它在寻找正确页面的准确度上平均提高了 16.7%,与依赖于将图像转换为文本的系统相比,提高了 22.1%。这种提升在涉及复杂视觉结构(如地图和图表)的任务中尤为明显,因为在这些任务中,图像不同部分之间的关系至关重要。在一次涉及地图的具体测试中,新系统的表现比之前的最佳视觉搜索工具高出两倍多。这表明,调整对文档不同部分关注程度的能力,是理解视觉信息的一个关键因素。
研究人员还通过观察系统在其内部记忆中如何组织信息,研究了为什么这种方法如此有效。他们发现,系统创建的灵活概念占据了一个既非纯粹视觉也非纯粹文本的独特空间。不同于依赖文本描述(可能会错过图表的细微差别)或仅依赖原始图像像素(可能会错过标签的含义)的系统,这些学习到的概念成功地结合了两者。它们既捕捉到了用于定位答案的具体视觉细节,又理解了页面的宏观语境。此外,研究表明,无论问题难度如何,对每个问题都使用固定数量的概念会导致较差的结果。当系统被允许改变其内部表示的长度时,其表现最好,这证明了所需证据的复杂性在所有文档中并不是统一的。
最终,这项工作表明,通过允许灵活性,计算机理解视觉文档的方式可以变得更加像人类。正如一个人可能会扫描整个页面以寻找大致主题,然后又放大到一个特定的数字以寻找答案一样,这个系统学会了如何动态地分配其注意力。它不会将每份文档都强行塞入同一个模具,而是通过塑造其理解力来适应可用的证据。通过弥合文档的视觉结构与问题的语义意义之间的鸿沟,该系统为从现代文档丰富的视觉世界中检索信息提供了一种更可靠的方式。该研究的代码和数据已公开,欢迎他人基于此方法进行进一步开发。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。