← 最新の論文
💻 computer science

DocClaw: A Unified Agentic System for Intelligent Document Processing

DocClawは、多様なインテリジェント文書処理タスクを、エージェントと文書との間の構造化された文書状態および再利用可能なツールを活用した共有的な反復相互作用プロセスとして再定義することで、OCR、DocQA、およびKIEのベンチマークにおいて競争力のある性能を実現する統合的なエージェンティック・システムです。

原著者: Siqi Xiang, Zhipeng Xu, Yufei Liu, Junhao Ji, Qing Liu, Zulong Chen, Zhibo Yang, Chunyan Miao, Shijian Lu

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Siqi Xiang, Zhipeng Xu, Yufei Liu, Junhao Ji, Qing Liu, Zulong Chen, Zhibo Yang, Chunyan Miao, Shijian Lu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

私たちは日々、年次報告書、医療記録、法的契約書、手書きのメモなど、世界の知識を保持する文書に囲まれています。コンピュータがこれらのページを理解するためには、単に言葉を読み取るだけでなく、テキストがどのように配置されているか、図表や表を認識し、異なるセクションに散らばった情報を一つにまとめ上げる必要があります。インテリジェント・ドキュメント・プロセッシング(知的文書処理)として知られるこの課題は、長い間、個別の仕事の集合体として扱われてきました。あるプログラムはページの画像をテキストに変換するために設計され、別のプログラムはテキストの中から特定の答えを見つけるために必要とされ、さらに別のプログラムは日付や価格といった主要な数値を抽出するために必要とされる、といった具合です。これらのツールは孤立して機能しており、一つのタスクから学んだことを次のタスクに役立てることができないため、全体像を見失いがちな硬直的で段階的なアプローチを強いています。

研究者たちは、コンピュータが文書と対話する方法を変える「DocClaw」と呼ばれる新しいシステムを導入しました。各タスクを別々の問題として扱うのではなく、DocClawは、文書を読み、検索し、連続的なループの中で推論することができる、単一のインテリジェントなアシスタントのように振る舞います。質問やリクエストを与えられたとき、このシステムは単に答えを推測するのではなく、適切な情報を見つけるための専門的なツールセットを使用して、文書を能動的に探索し、自身の作業をチェックし、結果に自信が持てるまで理解を洗練させていきます。すでに発見した内容の記録を保持し続けることで、システムは将来の質問のためにその知識を再利用することができ、時間の経過とともに、より高速かつ正確になります。

この新しいアプローチの核心は、静的な予測から能動的な相互作用への転換にあります。従来の方法では、コンピュータは文書を一度だけ見て出力を生成し、間違いを修正したり、最初の試みが不明瞭だった場合に深く掘り下げたりする方法はありませんでした。しかし、DocClawは文書を「会話のパートナー」として扱います。ユーザーが質問を投げかけると、システムはまず、何が求められているかに基づいて戦略を決定します。単にテキストを読み取ることが目的であれば、文字とレイアウトの認識に集中します。特定の事実を見つけることが目的であれば、検索を計画します。収益額のような数値を抽出することが目的であれば、発見事項をクロスチェックする準備をします。この戦略は、研究者が「ドキュメント・スキル」と呼ぶもの、つまり、異なる種類のタスクに対してシステムがどのように振る舞うべきかを指示する命令によって導かれます。

戦略が決まると、システムは文書の構造化されたメモリを構築することから作業を開始します。ページを管理可能な部分に分解し、テキスト、画像、テーブルがどこに位置しているかを記録します。特定のセクションを読んだりチャートを分析したりするためにツールを使用する際、システムはその発見事項を永続的なメモリバンクに保存します。これが古いシステムとの決定的な違いです。レポートの一部分を読んだことで得られた知識は、タスク終了後に破棄されることはありません。代わりに、後で行われる質問が同じセクションに関する情報を必要とする場合、システムはどこを探すべきか、そこで何を見つけたかをすでに知っている状態でなければなりません。これにより、システムは作業の重複を避け、文書に対するより深い理解を構築することができます。

システムは、計画、実行、更新のサイクルで動作します。現在の知識の状態を確認し、次にどのツールを使うべきか(例えば、ぼやけた部分をズームする、表を切り取って鮮明にする、あるいはキーワードを検索するなど)を決定し、そのアクションを実行します。そのアクションの結果は、直ちにメモリに追加されます。もしシステムが矛盾していると思われる数値を見つけた場合、元の画像に対して検証したり、二度目のチェックを実行したりするためにツールを使用できます。このプロセスは、システムが自信を持って質問に答えるための十分な証拠を集めるまで続きます。その後、システムは停止して最終的な回答を提供し、その特定の質問のための一時的なメモは破棄しますが、将来の使用のための恒久的な知識は保持します。

このアプローチをテストするために、研究者たちは3つの非常に異なるタイプのタスクについてDocClawを評価しました。それは、画像からのテキスト読み取り、長い文書に関する質問への回答、そして財務数値のような特定のデータポイントの抽出です。彼らは、このシステムを汎用人工知能モデルおよび単一タスク向けに設計された専門ツールと比較しました。その結果、DocClawはすべての分野において、専門的なツールと同等、あるいはそれ以上の性能を示しました。複雑なテキスト、数式、表の認識を含むテストにおいて、システムは高い精度を達成し、専用のソフトウェアを上回ることがよくありました。長いレポートに基づいた質問を受けた際、システムは正しい情報を特定し、標準的なモデルよりも信頼性の高い根拠に基づいた回答を提供することができました。同様に、主要な情報を抽出するタ材においても、視覚的な読み取りとテキスト認識をうまく組み合わせることでエラーを減らすことに成功しました。

システムがなぜこれほど効果的であったのか、詳細な調査によって明らかになりました。研究者たちは、自身の作業を洗練させる能力が大きな要因であることを見出しました。システムが読み取りにくいテキストに遭遇すると、頻繁に「ズーム」ツールを使用して近くを見ることで、小さな記号や数字の認識能力が大幅に向上しました。特定のデータの抽出を必要とするタスクにおいて、システムが発見事項を元の画像と照らし合わせてダブルチェックする習慣は、他のモデルが犯した間違いの大部分を修正しました。さらに、システムのメモリは効率性において不可欠であることが証明されました。同じ文書に関する一連の質問が行われた際、次の質問に回答するまでの時間は著しく減少しました。これは、システムが新しいクエリごとに文書全体を再スキャンする必要がなく、すでに学習した内容を単に呼び出し、必要な新しい情報だけに集中できたためです。

この研究は、文書処理を統一されたインタラクティブなプロセスとして扱うことが、現実世界の文書の複雑さを扱うための強力な方法であることを示しています。単一のシステムが、その瞬間のニーズに基づいて読み取り、検索、検証を切り替えることを可能にすることで、DocClawは硬直した単一目的ツールの限界を克服しています。コンピュータに、見たものを記憶し、次の動きを慎重に計画する能力を与えることで、以前は達成が困難であった柔軟性と正確性を持って文書を理解できることを、この研究は示しています。このアプローチは単にタスクを自動化するだけでなく、機械が私たちの世界を形作る膨大な記述情報と関わるための、よりインテリジェントな方法を創出しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →