Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms
该论文介绍了 Khondo,这是首个针对拼接的孟加拉语政府表格进行拆分与重排序的视觉原生双语基准测试,揭示了尽管多模态大语言模型可以有效地按文档对页面进行聚类,但在重建原始页面顺序方面却表现得非常吃力,尤其是在低资源语言环境下。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名在混乱且充满魔力的图书馆里的管理员。在这里,书籍不仅仅是静静地躺在书架上;它们有时会被粘在一起变成巨大的、杂乱无章的长卷,然后有人摇晃了桌子,把不同故事的页面混合在一起,直到它们完全变得混乱不堪。你的工作就是观察这团乱麻,弄清楚哪些页面属于哪个故事,然后将它们重新按正确的顺序堆叠起来,使故事恢复逻辑。这就是现实世界中“文档包拆分”(document packet splitting)的问题。在数字世界中,政府和办公室经常将数百张纸张扫描成一个大文件。有时,扫描仪会出错,或者工作人员不小心打乱了页面,把出生证明与税务表格、或者驾照与医疗报告混在了一起。对于计算机来说,这是一个噩梦。虽然我们已经开发出了能够阅读文本的智能人工智能(AI),但教它通过观察页面的图像,理解视觉线索,并以此解开一堆被打乱的文档,是一个更难的挑战,尤其是在这些文档使用的语言是计算机不常见的语言时。
这就是名为 Khondo(在孟加拉语中意为“拆分”或“分割”)的新项目所要解决的问题。该项目的研究人员创建了一个特殊的测试集,就像一个巨大的拼图盒,专门设计用来测试现代人工智能在理清这些混乱文档堆方面的表现。他们不仅使用了英语,还使用了来自孟加拉国的真实政府表格,这些表格通常使用孟加拉语、英语或两者的混合编写。他们将数千页纸张粘在一起,制造出虚假的“数据包”,然后故意以五种不同的方式打乱了页面:从保持原有顺序,到在单个文档内进行混合,再到将不同文档的页面完全混淆在一起。随后,他们要求世界上最先进的人工智能模型观察这些页面的图像,并尝试将它们分类整理。
结果喜忧参半。人工智能模型在第一部分工作中表现得相当不错:它们能观察一堆混乱的页面,并正确猜测哪些页面属于同一类。这就像人工智能可以分辨出:“嘿,这四页都是关于农业的,而那三页是关于税务的”,即使页面已经被混合了。然而,当涉及到第二部分工作时,人工智能却撞上了一堵巨大的墙:即把页面放回正确顺序。当页面被打乱后,人工智能很难弄清楚哪一页在前、哪一页在后、哪一页在最后。这就像人工智能虽然能识别出故事中的角色,却记不住情节的先后顺序。
研究人员进行了深入调查,试图找出原因。他们尝试了两种主要的方法。首先,他们给了人工智能非常明确的指令,告诉它:“嘿,这些页面被打乱了,请修复顺序!”这确实很有帮助,但并没有完全解决问题。人工智能仍然会犯错,这表明困难不仅仅在于人工智能没有听从指令,而是这项任务本身确实非常艰巨。其次,他们测试了仅含英文的数据包和仅含孟加拉语的数据包。他们发现,人工智能对英文页面的排序能力比对孟加拉语的强得多。看来,阅读孟加拉文字符中的视觉线索增加了额外的难度,尽管人工智能仍能正确地进行分组,但这层难度拖慢了它的进度。
简而言之,这篇论文表明,虽然人工智能在识别文档主题方面正变得日益出色,但在扮演像人类图书管理员那样——通过观察一叠被打乱的纸张并瞬间知晓正确的阅读顺序,尤其是在文本为孟加拉语的情况下——方面,仍然显得力不从心。研究人员现在已将这个“混乱图书馆”的谜题开放给所有人使用,希望通过研究这些失败案例,未来的人工智能能够学会解开这些乱结,并恢复我们数字文档的秩序。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。