← 最新の論文
🤖 AI

DOSA: A Tree-Guided, Self-Regressive Framework for Long Document Structure Analysis

本論文は、長距離の依存関係と不均一なレイアウトを効果的に捉えるために、マルチページ文書をチャンクごとに処理することでドキュメントレベルのセマンティックツリーを逐次的に再構成する、ツリー誘導型の自己回帰フレームワークであるDOSAを提案しており、ドキュメント構造解析のベンチマークにおいて最先端の性能を達成している。

原著者: Bohou Li, Benjamin Sowell, Mehul Shah, Mark Lindblad, Henry Lindeman

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Bohou Li, Benjamin Sowell, Mehul Shah, Mark Lindblad, Henry Lindeman

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、バラバラになった大量の紙のシートの上に散らばった、巨大な多巻本の百科事典を理解しようとしているところだと想像してください。あるページには写真があり、あるページにはリストがあり、またあるページには大きな太字のタイトルがあります。この混乱した状態を理解するためには、単に言葉を読むだけでは不十分です。断片がどのように組み合わさっているのかを見極めなければなりません。その写真は上の段落の一部なのか? そのリストはタイトルの子要素なのか、それとも全く別のセクションなのか? これが「視覚的に豊かな文書(visually-rich documents)」の世界です。そこでは、情報は単なるテキストの流れではなく、形、位置、スタイルが織りなす複雑なパズルのようなものです。コンピュータがこれらの文書(法的契約書、科学論文、スライド資料など)を真に「読む」ためには、「文書構造解析(Document Structure Analysis)」と呼ばれる特定のパズルを解かなければなりません。彼らは「セマンティック・ツリー(意味論的木構造)」を構築する必要があります。これは文書のパーツのための家系図のようなものであり、誰が誰の親であるか、そして全員をどのような順序で読むべきかを示します。これがないと、コンピュータはタイトルと段落を、実際には親子関係にあるにもかかわらず、無関係な他人として見てしまうかもしれません。

ここで、長大な多ページ文書のこのパズルを解くために、Glean Technologiesの研究者によって提案された新しい手法、DOSA(Document Structure Analyzer)が登場します。1,000ピースのレゴのお城を一気に組み立てようとしていると考えてみてください。それは圧倒される作業ですし、もし早い段階でミスをすると、全体が崩れてしまうかもしれません。従来の手法は、文書全体を一度に捉えようとしてきました。それは、お城を組み立てながら、そのお城全体を両手で抱え込もうとするようなもので、手に重すぎてコンピュータが混乱してしまいます。DOSAは異なるアプローチを取ります。それは、お城を一度に作るのではなく、小さなセクションごとに組み立てていきます。つまり、次の部屋に移る前に、まず一つの部屋を組み立てるようなプロセスです。しかし、ここには巧妙な仕掛けがあります。新しい部屋を組み立てる際、手元にあるレンガを見るだけでなく、すでに組み立てられたお城の「右端の枝(rightmost branch)」を見ているのです。これがガイドとなり、前の部屋のどの部分が新しい部屋に関連しているのかをコンピュータに正確に伝えます。この「ツリー誘導型」のマップを使うことで、DOSAは文書の膨大なサイズの中で迷子になることを回避します。

研究者たちは、このステップ・バイ・ステップの自己誘導型の手法が驚くほど効果的であることを発見しました。DocHieNetと呼ばれる、複雑な多ページレイアウトを含む非常に難解なデータセットを含む5つのデータセットでDOSAをテストしたところ、現在の最高の手法を上回る結果を出しました。この困難なベンチマークにおいて、DOSAはF1スコア(精度を示す尺度)で最大4ポイント、TEDS(コンピュータが作ったツリーが実際のツリーとどれほど似ているかを測る尺度)では20ポイント近く向上しました。さらに印象的なことに、Gemini-2.5-ProやGPT-5.2のような強力な汎用AIモデルをも上回りました。これは、文書のツリー構造を構築するというこの特定の仕事においては、巨大なAIに構造を「推測」させるよりも、特化した構造化されたアプローチの方が優れていることを示唆しています。論文は、視覚的な手がかり(ボックスがページ上のどこにあるかなど)、テキストの内容、およびオブジェクトのサイズを融合させることで、DOSлоSAは文書全体を一気に暗記することなく、高い精度で文書の論理を再構築できると述べています。しかし、著者らは、この手法は堅牢ではあるものの完璧ではないとも指摘しています。現在はツリー構造に焦メントしており、引用のようなより複雑なウェブ状の接続はまだ扱えず、また、初期段階でのミスを後から修正できないという課題も残っています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →