← 最新论文
💻 computer science

DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation

DocAnnot 是一个由生成式人工智能(GenAI)驱动的框架,它通过结合大语言视觉模型、光学字符识别(OCR)技术以及一种创新的空间感知上下文匹配算法,加速关键信息提取(KIE)数据集的构建,从而生成高质量的自动标注,在显著减少人工投入的同时,实现有效的下游模型训练。

原作者: Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人阅读一份凌乱的手写收据或一份复杂的保险单。你希望这个机器人能找到“总计”(Total)、“日期”(Date)和“商店名称”(Store Name),并将它们整齐地列在一个清单中。这被称为关键信息提取(Key Information Extraction, KIE)。长期以来,教机器人这个技巧的唯一方法是让一个人坐下来,在成千上万份文档上手动标出每一个单词和数字。这就像雇佣一个团队通过手动复制粘贴的方式来处理一百万张收据——既慢、又贵,还很枯燥。

最近,一种新型的超级聪明计算机大脑——**大型视觉语言模型(Large Vision Language Model, LVLM)**问世了。你可以把它想象成一个不仅能读懂文字,还能“看到”文档图像,并理解文字在页面上如何排列的机器人。然而,这些机器人仍然有点像过度热心的实习生:它们非常擅长理解故事的内容,但有时会对究竟是哪个数字对应哪个标签感到困惑,或者可能会凭空捏造并不存在的事实(这种现象被称为“幻觉”)。科学家们提出的核心问题是:我们能否利用这些聪明的机器人来为我们完成标注数据的枯燥工作,从而更快、更便宜地训练其他机器人,而不需要人类去检查每一行数据?

这正是 DocAnnot 这篇论文所解决的问题。研究人员构建了一个全新的系统,它就像一条用于创建训练数据的超高效流水线。该系统并没有让真人去围绕单词画框,而是通过一个三步走的“舞蹈”来自动完成。首先,一个“视觉机器人”(LVLM)会观察文档,并猜测重要的标签和数值是什么,比如找到“总计”以及它旁边的数字。第二,一个经典的“文本扫描器”(OCR)会读取页面上的每一个单词,并在每个单词所在的位置画出一个精确的框。

奇迹发生在这里:第三步是一个名为 SICM(空间感知上下文匹配,Spatially Informed Contextual Contextual Matching)的新算法。想象一下,视觉机器人说:“总计是 100 美元”,但文本扫描器却看到页面上出现了三次“100”。系统如何知道哪一个“100”才是正确的呢?SICM 算法就像一个拿着尺子的侦探。它会观察视觉机器人找到的“关键文本”(即“总计”这个词),测量它与所有候选“100”之间的距离,并选择物理位置上最靠近“总计”的那一个。它将机器人的“大脑”(对意义的理解)与“尺子”(对布局的理解)结合在一起,从而做出正确的选择。

团队在两个著名的收据数据集 CORDSROIE 上测试了这个系统。结果很有前景,但并不完美。当系统尝试自主对收据进行标注时,它在 CORD 数据集上的准确率得分(称为 F1 分数)约为 0.679,在 SROIE 数据集上为 0.846。为了让你更有概念,人类专家得分会接近 0.9 或更高,所以这个机器人表现不错,但尚未达到完美。

然而,真正的惊喜出现在他们使用这些由机器人生成的标签来训练一个新的、规模较小的机器人时。他们问道:“如果我们仅使用 DocAnnot 生成的数据来训练一个模型,它还能学习吗?”答案是谨慎的“可以”。一个完全基于自动标注数据训练的模型在 CORD 测试集上达到了 0.6765 的得分。虽然这低于使用完美人类数据训练的模型(后者得分为 0.9141),但这是一个相当不错的表现,表明你并不一定需要人类来标注每一份文档才能获得一个可用的系统。

论文还指出,他们系统中的“空间感知”部分至关重要。当他们在没有“尺子”(即 SICM 算法)的情况下运行系统时,在 CORD 数据集上的准确率从 0.679 大幅下降到了 0.571。这证明了仅仅拥有一个聪明的机器人是不够的;你还需要空间逻辑来确定哪个单词属于哪个标签。

最后,研究人员尝试了一种“混合”方法。他们将机器人的工作成果与极少量的人类辅助相结合——具体来说,他们加入了 10%、20% 或 30% 的人工标注数据。这种微小的提升推动了性能的增长,在仅有 30% 人类帮助的情况下,F1 分数就攀升到了 0.7241。这表明,未来的最佳模式可能不是“全机器人”或“全人类”,而是一个机器人承担繁重工作、人类只需介入处理棘手部分的协作团队。

简而言之,DocAnnot 并不声称已经解决了完美自动化的难题。相反,它提供了一个实用的、节省成本的工具,可以生成“足够好”的数据来训练模型,或者作为一个强大的助手,减少人类处理枯燥文书工作的时间。这是向使文档处理变得更快、更便宜迈出的一步,尽管我们仍需要人类来复核工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →