← 最新论文
💻 computer science

DocClaw: A Unified Agentic System for Intelligent Document Processing

DocClaw 是一个统一的智能体系统,它将多样化的智能文档处理任务重新定义为智能体与文档之间基于共享结构化文档状态和可复用工具的迭代交互过程,从而在 OCR、DocQA 和 KIE 基准测试中实现了具有竞争力的性能。

原作者: Siqi Xiang, Zhipeng Xu, Yufei Liu, Junhao Ji, Qing Liu, Zulong Chen, Zhibo Yang, Chunyan Miao, Shijian Lu

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Siqi Xiang, Zhipeng Xu, Yufei Liu, Junhao Ji, Qing Liu, Zulong Chen, Zhibo Yang, Chunyan Miao, Shijian Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每天,我们都身处在由各种文档构成的世界之中,它们承载着人类的知识:年度报告、医疗记录、法律合同以及手写笔记。为了让计算机理解这些页面,它所做的不仅仅是阅读文字;它还必须观察文本是如何排列的,识别图表和表格,并将散落在不同章节中的信息拼凑起来。这一挑战被称为智能文档处理(intelligent document processing),长期以来一直被视为一系列独立的任务。一个程序可能旨在将页面的图像转化为文本,而另一个程序则需要用于在文本中寻找特定答案,还有另一个程序则用于提取日期或价格等关键数字。这些工具孤立地工作,无法通过一项任务所学到的知识来辅助下一项任务,从而被迫采用一种僵化、循序渐进的方法,往往会忽略全局。

研究人员现在推出了一种名为 DocClaw 的新系统,它改变了计算机与文档交互的方式。DocClam 不再将每个任务视为一个独立的问题,而是像一个单一的智能助手,能够在连续的循环中对文档进行阅读、搜索和推理。当接收到问题或请求时,该系统不仅仅是猜测答案;它会积极地探索文档,利用一套专门的工具来寻找正确的信息、检查其工作并完善其理解,直到它对结果充满信心。通过保持对已发现信息的持续记录,该系统可以将这些知识复用于未来的问题,从而随着时间的推移变得更快、更准确。

这种新方法的核心是从静态预测向主动交互的转变。在传统方法中,计算机看一眼文档后就会产生输出,没有办法回头纠正错误,或者在初次尝试不清晰时进行深入查看。然而,DocClaw 将文档视为对话的伙伴。当用户提出问题时,系统首先会根据问题的类型决定策略。如果目标仅仅是阅读文本,它会专注于识别字母和布局。如果目标是寻找特定事实,它会规划一次搜索。如果目标是提取如营收数字之类的数值,它会准备交叉核对其发现。这种策略由研究人员称之为“文档技能”(document skills)的指令引导,这些指令本质上是告诉系统在面对不同类型的任务时应如何表现。

一旦策略确定,系统便通过构建文档的结构化记忆来开始其工作。它将页面分解成易于处理的部分,记录文本、图像和表格的位置。当它使用工具阅读特定部分或分析图表时,它会将这些发现保存在一个持久的记忆库中。这是与旧系统的一个关键区别:从阅读某份报告中获得的知识并不会在任务完成后就被丢弃。相反,它会被存储起来,这样如果后续问题需要来自同一章节的信息,系统已经知道去哪里寻找以及发现了什么。这使得系统能够避免重复劳动,并在回答更多问题时建立起更深层的理解。

该系统在一个“规划、行动、更新”的循环中运行。它观察当前知识的状态,决定下一步使用什么工具——例如放大模糊的部分、裁剪表格以获得更好的清晰度,或搜索关键词——然后执行该动作。该动作的结果会被立即添加到其记忆中。如果系统发现某个数字似乎不一致,它可以利用工具根据原始图像进行验证或进行第二次检查。这个过程持续进行,直到系统收集到足够的证据来自信地回答问题。只有到那时,它才会停止并提供最终答案,同时丢弃针对该特定问题的临时笔记,而保留对文档的永久性知识。

为了测试这种方法,研究人员在三种截然不同的任务类型上对 DocClaw 进行了评估:从图像中读取文本、回答关于长文档的问题,以及提取特定数据点(如财务数字)。他们将该系统与通用人工智能模型以及专门的单项任务工具进行了对比。结果显示,Doc-Claw 在各项指标上均表现得与专门工具一样出色,甚至更好。在涉及复杂文本、公式和表格的识别测试中,该系统取得了极高的准确率,往往优于专用软件。在被要求回答基于长篇报告的问题时,它能够比标准模型更可靠地定位正确信息并提供有据可查的答案。同样,在执行提取关键信息的工作时,它成功地结合了视觉阅读与文本识别,从而减少了错误。

对系统运作方式的深入观察揭示了其高效的原因。研究人员发现,能够自我完善工作是其成功的关键因素。当系统遇到难以阅读的文本时,它经常使用“缩放”工具进行近距离观察,这显著提高了它识别微小符号和数字的能力。在需要提取特定数据的任务中,系统通过对照原始图像核对发现的习惯,纠正了其他模型所犯的大部分错误。此外,系统的记忆功能对于提高效率至关重要。当被问及关于同一文档的一系列问题时,回答后续每个问题所需的时间明显下降。这是因为系统不需要为每个新查询都重新扫描整个文档;它可以简单地调用已学到的知识,并仅专注于所需的新信息。

这项研究表明,将文档处理视为一个统一的、交互式的过程,是处理现实世界文档复杂性的强大方式。通过允许单个系统根据瞬时需求在阅读、搜索和验证之间切换,DocClaw 克服了僵化、单一用途工具的局限性。它表明,当计算机被赋予记忆所见内容并仔细规划下一步行动的能力时,它能以一种以往难以实现的灵活性和准确性来理解文档。这种方法不仅仅是在自动化一项任务;它创造了一种让机器更智能地与塑造我们世界的海量书面信息进行交互的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →