在现代世界中,海量的关键信息都存储在数字文档之中。这些并非简单的文本文件,而是充满了图表、表格、图形和多栏布局的复杂页面,常见于财务报告、政府政策或技术手册。几十年来,计算机一直难以阅读这些页面,通常要么将其视为单一的文本块,要么无法理解一页上的图表与另一页段落之间的关系。最近,新一代人工智能已经出现,它能够像人类一样观察文档,同时看到文字及其数据的视觉形状。这种被称为“视觉文档检索”的能力,使机器能够从这些丰富且结构化的页面中寻找特定的答案。然而,大多数用于构建这些系统的工具和测试都是针对英语设计的,这导致在理解具有不同书写风格和文档结构的其它语言方面存在显著差距。
韩国庆熙大学的研究团队现在通过创建一种专门针对韩语文档的新测试,填补了这一空白。他们意识到,虽然现有的测试可以要求计算机寻找包含答案的单个页面,但现实世界的提问往往需要收集散布在多个页面中的线索。想象一下,询问一个关于公司财务状况的问题;答案可能需要查看第五页的一个表格、第十二页的一个图表以及第二十页的一个总结。研究人员构建了一个名为 KoViDoRe 的基准测试,以观察当前的计算机模型是否能够处理这种多页面的“侦探工作”。他们从政府报告和企业材料等公共渠道收集了数百份真实的韩语文档,这些文档具有包含表格和图形的复杂布局。利用先进的语言模型,他们生成了数千个问题,迫使计算机将来自单个文档不同部分的信息拼凑起来,从而形成一个完整的答案。
当研究人员在这一新基准上测试一系列现有的主流人工智能模型时,结果令人警醒。计算机表现得非常吃力。即使是规模最大、最复杂的模型,在需要结合多个来源的证据来回答问题时,也难以定位正确的页面。随着回答问题所需的页面数量增加,性能大幅下降。这表明,当前一代检索工具尚未准备好应对现实世界中韩语文档的复杂性,因为在这些文档中,信息往往分布在多个页面中,而非集中在某一点。该研究明确反对“仅仅通过扩大模型规模就能解决问题”的观点;虽然更大的模型表现优于较小的模型,但它们仍然无法掌握跨多个页面聚合信息的能力。
为了帮助解决这个问题,研究人员并未止步于发现问题。他们创建了一个名为 Ko-VDR Train Public 的大规模训练数据集,其中包含超过 31 万个问题及其对应的文档页面示例。随后,他们利用这些新数据对两个现有的模型进行了训练。结果立竿见影且十分积极。在接受了这些针对韩语特定示例的训练后,模型的页面定位能力显著提升,在所有测试的不同类型文档中,其准确率都得到了剧烈改善。此前表现不佳的小型模型,仅通过学习正确类型的资料,就能够赶上大型系统。这一发现强调了,如果人工智能要真正理解特定语言的文档,它需要接受反映该语言现实世界文档独特结构和布局的材料训练。
研究人员还深入探讨了这项任务为何如此困难。他们发现,难度与回答问题所需的页面数量直接相关。当查询仅需要一个页面的信息时,模型的表现尚算成功。但一旦问题要求从两个、三个或更多页面中获取证据,计算机寻找正确答案的能力就开始衰减。这证实了挑战不仅在于阅读文字,更在于理解文档不同部分之间的关系。研究结论指出,尽管当前技术已取得了长足进步,但在机器能够可靠地处理定义现代信息系统的复杂多页文档方面(尤其是在韩语等语言中),仍有很长的路要走。他们发布的这一新基准和训练数据旨在为未来的研究奠定基础,帮助开发者构建能够真正弥合人类好奇心与隐藏在数字档案中海量结构化信息之间鸿沟的系统。
技术摘要:KoViDoRe —— 韩语视觉文档检索基准测试
问题陈述
多模态检索和检索增强生成(RAG)的最新进展增强了处理富视觉文档的能力。然而,现有的基准测试和资源在应用于韩语时存在三个主要局限性:
- 语言偏差: 大多数基准测试以英语和欧洲语言为中心,尽管韩语具有独特的形态和结构特征,但在这些基准中代表性不足。
- 单页限制: 当前的基准测试大多将视觉文档检索(VDR)表述为单页检索任务。这无法捕捉现实场景(例如财务报告、政策文件),在这些场景中,相关信息分布在多个页面中,需要进行证据聚合和多页推理。
- 缺乏专门的训练数据: 缺乏专门为韩语多模态检索设计的规模化、高质量训练数据集,阻碍了针对韩国文档生态系统定制模型的开发。
现有的韩国资源(如 SDS KoPub VDR)解决了布局复杂性的问题,但仍局限于单页检索。相反,像 MIRACL-VISION 这样的多语言基准测试通常依赖于维基百科语料库,这无法反映在现实世界的韩国检索任务中常见的结构化、企业级文档。
方法论
数据集构建流水线 (KoViDoRe)
作者引入了 KoViDoRe,这是一个基于根据韩国开放政府许可(KOGL)授权的公开韩国文档(政府报告、政策文件、企业材料)构建的基准测试。其构建流水线包括:
- 来源收集: 涵盖四个领域(网络安全、人力资源 (HR)、能源和经济)的 57 份文档。
- 结构化解析: 文档被拆分为页面,并使用 Upstage Document Parse 进行处理,以提取页面级和元素级的 Markdown,从而保留布局、表格、图表和标题。
- 合成查询生成: 使用 Solar-Pro3 LLM 的多阶段流水线,基于两种策略生成查询:
- 基于摘要: 从全局摘要(单章节和跨章节)中衍生出查询,以捕捉多页关系。
- 基于上下文: 基于局部页面级或多页上下文窗口的查询。
- 多样性控制: 生成过程强制执行多样化的查询类型,包括多跳推理、数值比较和聚合,确保查询通常需要综合来自多个页面的信息。
- 相关性映射与过滤: 严格的过滤过程结合了基于一致性的检查(比较生成阶段信号与映射阶段信号)和基于规则的过滤(移除平凡或抽取式的查询)。通过人工验证来优化不自然的查询并确认页面级相关性。
训练数据集 (Ko-VDR Train Public)
为了解决在评估中观察到的性能差距,作者策划了 Ko-VDR Train Public,这是一个包含 310,226 个“查询-页面”对的大规模数据集。该数据集使用与基准测试相同的生成流水线,但省略了人工验证以保持可扩展性。它旨在支持专门针对韩国视觉文档进行微调的检索模型。
实验设置
作者在不同的参数规模(从 <1B 到 ≥8B)下评估了广泛的多模态检索模型(基于 CLIP、后期交互和稠密嵌入的模型)。
- 任务: 给定韩语查询,对文档页面进行排序。
- 指标: nDCG@10。
- 相关性标签: 基于页面是否包含充足信息或支持性证据,采用分级标签(2 代表完全相关,1 代表部分相关)。
核心贡献
- KoViDoRe 基准测试: 首个专门设计用于评估韩语视觉文档中多页检索的基准测试。它将范式从单页提取转向多页证据聚合。
- 合成查询生成适配: 将合成查询生成技术适配到韩语领域,生成具有明确页面级监督且需要复杂推理(例如跨章节聚合)的查询。
- Ko-VDR Train Public: 发布大规模训练数据集(31万+ 对),以促进韩国特定多模态检索模型的发展。
- 实证分析: 通过全面的评估表明,当前的先进模型在处理韩语视觉文档时面临显著困难,特别是在查询跨越多个页面或涉及结构化内容(如表格)时。
结果与分析
主要评估发现
- 性能差距: 模型规模与性能之间存在明显的正相关关系,但即使是大型模型(例如 8B 参数)也表现挣扎。表现最好的模型 jina-embeddings-v4 (3.8B) 实现了 55.0% 的平均 nDCG@10,虽然显著优于其他模型,但仍表明有改进空间。
- 领域难度: 性能因领域而异。经济和 HR 子集的得分最低,这归因于复杂的文档结构以及信息在多个页面中的分布。
- 多页挑战: 消融研究显示,随着每个查询所需相关页面数量的增加,检索性能(nDCG@10)通常会下降。这证实了无论模型容量如何,跨多个页面聚合证据对于当前架构来说仍然是一个重大挑战。
训练影响
在 Ko-VDR Train Public 上微调模型带来了实质性的提升:
- colSmol-500M (500M 参数): 微调后在所有领域都显示出显著收益,证明即使是轻量级模型也能从韩国特定数据中获益。
- colqwen2-v1.0 (2.2B 参数): 微调将其平均 nDCG@10 从 29.5% 提高到 52.8%,使其在基准测试设置中能够超越更大的 Qwen3-VL-Embedding-8B (50.4%)。
- 数据组成: 将公开数据 (Ko-VDR Train Public) 与私有的韩国 VQA 数据(包含 TableVQA 和 FigureVQA 监督)相结合,提供了最佳的整体结果,尤其是在具有复杂表格的领域(经济)。
意义与主张
论文声称 KoViDoRe 和 Ko-VDR Train Public 为推进韩国多模态检索提供了统一的资源。作者强调:
- 当前的基准测试无法捕捉现实世界中韩国文档检索的复杂性,特别是多页证据聚合的需求。
- 现有模型不足以胜任此项任务,凸显了该领域的关键差距。
- 在语言特定的大规模数据集上进行训练,对于提高检索性能至关重要,使较小的模型能够与较大的通用模型相竞争。
这项工作为未来研究更适合结构化、富视觉信息的韩国文档的模型和策略奠定了基础,超越了单页检索范式的局限性。
局限性
作者承认存在以下局限性:
- 视觉保真度: 查询生成依赖于解析后的 Markdown 和标题,而非原始视觉输入,这可能会丢失细粒度的视觉细节(例如颜色、特定的图表模式)。
- 标注噪声: 虽然过滤减少了人工工作量,但生成阶段与映射阶段之间的对齐仍可能引入噪声。
- 可复现性: 由于许可限制,用于训练实验的私有 VQA 数据集无法公开发布,这限制了训练设置向公开组件的完全可复现性。
- 模型架构: 本研究评估的是现有模型,而非提出专门为韩国视觉文档检索设计的全新架构。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。