← 最新论文
💻 computer science

KoViDoRe: Korean Visual Document Retrieval

本文介绍了 KoViDoRe,这是一个全面的基准测试及配套训练数据集,旨在通过评估并改进多模态模型在具有多样化布局的复杂多页文档上的表现,来解决韩语视觉文档检索资源匮乏的问题。

原作者: Yongbin Choi, Yongwoo Song, Mujeen Sung

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yongbin Choi, Yongwoo Song, Mujeen Sung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,海量的关键信息都存储在数字文档之中。这些并非简单的文本文件,而是充满了图表、表格、图形和多栏布局的复杂页面,常见于财务报告、政府政策或技术手册。几十年来,计算机一直难以阅读这些页面,通常要么将其视为单一的文本块,要么无法理解一页上的图表与另一页段落之间的关系。最近,新一代人工智能已经出现,它能够像人类一样观察文档,同时看到文字及其数据的视觉形状。这种被称为“视觉文档检索”的能力,使机器能够从这些丰富且结构化的页面中寻找特定的答案。然而,大多数用于构建这些系统的工具和测试都是针对英语设计的,这导致在理解具有不同书写风格和文档结构的其它语言方面存在显著差距。

韩国庆熙大学的研究团队现在通过创建一种专门针对韩语文档的新测试,填补了这一空白。他们意识到,虽然现有的测试可以要求计算机寻找包含答案的单个页面,但现实世界的提问往往需要收集散布在多个页面中的线索。想象一下,询问一个关于公司财务状况的问题;答案可能需要查看第五页的一个表格、第十二页的一个图表以及第二十页的一个总结。研究人员构建了一个名为 KoViDoRe 的基准测试,以观察当前的计算机模型是否能够处理这种多页面的“侦探工作”。他们从政府报告和企业材料等公共渠道收集了数百份真实的韩语文档,这些文档具有包含表格和图形的复杂布局。利用先进的语言模型,他们生成了数千个问题,迫使计算机将来自单个文档不同部分的信息拼凑起来,从而形成一个完整的答案。

当研究人员在这一新基准上测试一系列现有的主流人工智能模型时,结果令人警醒。计算机表现得非常吃力。即使是规模最大、最复杂的模型,在需要结合多个来源的证据来回答问题时,也难以定位正确的页面。随着回答问题所需的页面数量增加,性能大幅下降。这表明,当前一代检索工具尚未准备好应对现实世界中韩语文档的复杂性,因为在这些文档中,信息往往分布在多个页面中,而非集中在某一点。该研究明确反对“仅仅通过扩大模型规模就能解决问题”的观点;虽然更大的模型表现优于较小的模型,但它们仍然无法掌握跨多个页面聚合信息的能力。

为了帮助解决这个问题,研究人员并未止步于发现问题。他们创建了一个名为 Ko-VDR Train Public 的大规模训练数据集,其中包含超过 31 万个问题及其对应的文档页面示例。随后,他们利用这些新数据对两个现有的模型进行了训练。结果立竿见影且十分积极。在接受了这些针对韩语特定示例的训练后,模型的页面定位能力显著提升,在所有测试的不同类型文档中,其准确率都得到了剧烈改善。此前表现不佳的小型模型,仅通过学习正确类型的资料,就能够赶上大型系统。这一发现强调了,如果人工智能要真正理解特定语言的文档,它需要接受反映该语言现实世界文档独特结构和布局的材料训练。

研究人员还深入探讨了这项任务为何如此困难。他们发现,难度与回答问题所需的页面数量直接相关。当查询仅需要一个页面的信息时,模型的表现尚算成功。但一旦问题要求从两个、三个或更多页面中获取证据,计算机寻找正确答案的能力就开始衰减。这证实了挑战不仅在于阅读文字,更在于理解文档不同部分之间的关系。研究结论指出,尽管当前技术已取得了长足进步,但在机器能够可靠地处理定义现代信息系统的复杂多页文档方面(尤其是在韩语等语言中),仍有很长的路要走。他们发布的这一新基准和训练数据旨在为未来的研究奠定基础,帮助开发者构建能够真正弥合人类好奇心与隐藏在数字档案中海量结构化信息之间鸿沟的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →