← 最新の論文
💬 NLP

HPD-Parsing: Hierarchical Parallel Document Parsing

HPD-Parsingは、グローバルなレイアウト解析と並行的なブロックレベルのコンテンツ生成および漸進的なマルチトークン予測を組み合わせた階層的並列デコーディング・パラダイムを導入し、競争力のある精度を維持しながら、4,752トークン/秒のスループット(既存モデルより2.62倍高速)を達成しています。

原著者: Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、糊で固められた巨大で複雑な図書館の本を読もうとしているところだと想像してください。その本を理解するには、決して先に進むことなく、最初の一ページから最後の一ページまで、一文字ずつ、一つずつ、すべての単語を読み進めなければなりません。これは、現在の多くの現代的なコンピュータプログラムが、PDFやスキャンされた書類などの文書を「読む」際に試みている方法です。これらは、画像を見ながら同時にテキストを読み取ることができる超スマートなロボットである、「視覚言語モデル(VLM)」と呼ばれる一種の人工知能を使用しています。これらのロボットは、文書の内容を理解することにおいて驚異的に上手くなっていますが、しばしば非常に時間がかかります。それは、まるで一つのピースを置くたびに次のピースに触れることができるようになるまで待つという、パズルを一つ一つのピースを見ながら解こうとしているようなものです。文書が長くなったり、テキスト、表、数式などで混み合ってきたりすると、この「一つずつ」という方法が交通渋滞を引き起こし、何千もの文書を迅速に処理することを困難にします。

ここで、HPD-Parsingと呼ばれる新しいアイデアが登場します。このプロジェクトの背後にいる研究者たちは、文書にはグローバルな計画(章の順序を知るようなもの)が必要であるが、各セクションの実際の読み取りは厳格な直線で行う必要はないことに気づきました。彼らはよりスマートな方法を提案しています。一つのロボットが本全体を逐次的に読むのではなく、チームを使うのです。一つの「マネージャー」ロボットがレイアウトを把握して様々なセクションを指し示し、一方で「ワーカー」ロボットのチームがそれらのセクションを同時に読み取ります。彼らはさらに、一度に複数の単語を先読みできるトリックも追加しました。これにより、単語ごとに立ち止まって考える必要をスキップできます。その結果、このシステムは劇的に高速化し、正確性を損なうことなく、毎秒4,752語以上の単語を処理することができます。

問題点:遅い、一列の行列

従来のドキュメントパーサーを、巨大なフルコースの宴会を食べようとしている一人の人物として考えてみてください。彼らはサラダに手を触れる前にスープを終えなければならず、メインディッシュを食べる前にサラダを終えなければなりません。たとえスープが単純なものであっても、スープがなくなるまでサラダを始めることはできません。コンピュータサイエンスの世界では、これを**自己回帰生成(autoregressive generation)**と呼びます。コンピュータは、出力(文書から読み取られるテキスト)を、一度に一つのトークン(単語の極めて小さな断片)ずつ生成します。生成した直後の内容を見て、次に何が来るかを決定し、それを書き、そして繰り返します。

短いメモであれば、これは問題ありません。しかし、チャートや数式、密集したテキストが含まれる50ページの文書の場合、この一列の行列が大きなボトルネックとなります。コンピュータは、次のステップに進む前に、自分自身が前のステップを完了するのを待つのにほとんどの時間を費やしてしまいます。研究者たちは、長い文書の場合、テキストをデコード(復号)するのに費やした時間は、ページの画像を見るために費やした時間の500倍近くに達することを発見しました。それは、リンゴを一つ選ぶためだけに、食料品店まで車で5時間かけて運転しているようなものです。

解決策:スーパーリーダーのチーム

HPD-Parsingの著者たちは、この一列の行列を打破することに決めました。彼らは**階層的並列デコーディング(Hierarchical Parallel Decoding)**という概念を導入しました。建設現場において、現場監督(「レイアウト・ブランチ」)が足場の上に立ち、建物全体を見渡している様子を想像してください。監督はすべてのレンガを積むわけではありません。代わりに、壁の異なるセクションを指差して、「君はキッチンを作れ!君は寝室を作れ!君はバスルームを作れ!」と言うのです。

この新しいシステムでは:

  1. マネージャー(レイアウト・ブランチ): このAI部分は、まず文書の画像全体を見ます。そして、「ここにタイトルがあり、ここに段落があり、ここに表があり、ここに数式がある」という構造を把握します。つまり、文書のマップを作成します。
  2. ワーカー(コンテンツ・ブランチ): マネージャーがセクションを特定するとすぐに、そのセクションだけを読み取る独立した新しい「ワーカー」AIを生成します。決定的なのは、これらのワーカーがすべて、同じタイミングで、割り当てられたセクションの読み取りを開始することです。キッチンが完成するのを待ってから寝室を始めることはありません。
  3. 共有メモリ: 時間を節約するために、これらすべてのワーカーは元の画像とマネージャーのマップの同じ「メモリ」を共有します。彼らは画像全体を読み直す必要はなく、自分の特定の仕事に集中するだけです。

秘密兵器:未来を予測する

ワーカーのチームがあっても、一単語ずつ読むのは依然として少し遅いです。そこで、研究者たちは**プログレッシブ・マルチトークン予測(Progressive Multi-Token Prediction: P-MTP)**と呼ばれる、二層目のスピードアップ技術を追加しました。

あなたが次のような文章を読んでいると想像してください:「猫が、その……」
通常の読者は「その」の後で立ち止まり、次に何が来るかを一生懸命考えます。彼らは「マット(敷物)」と推測するかもしれません。その後、また立ち止まって次の単語について考えます。
P-MTPシステムは、「猫が、その……」を見た瞬間に、自信を持って次の「三つの単語」を一度に予測する読者のようなものです。「マットの上で、眠った」といった具合です。そして、それらの推測が正しいかどうかをチェックします。もし正しければ、一度にすべてを書き込みます。もし間違っていれば、修正してやり直します。

HPD-Parsingシステムでは、すべてのワーカー(およびマネージャー)がこのトリックを使用します。一歩ずつ進む代わりに、彼らは数単語先を予測することで、大きな飛躍をします。論文によれば、これにより平均して、一度のステップでわずか1語ではなく、約6.6語を受け入れることが可能になります。

結果:速さと正確さ

研究者たちは、複雑なレイアウト、数学、表を含むあらゆる種類の難しい文書を含む、OmniDocBench V1.6という標準的なベンチマークを用いてこの新システムをテストしました。

  • 速度: 新しいHPD-Parsingシステムは、毎秒4,752トークンの速度を達成しました。これは、標準的な「一つずつ」の方法よりも3.06倍速く、現在利用可能な最も速い既存のドキュメントパーサーよりも2.62倍速い数値です。
  • 正確性: これほど高速であるにもかかわらず、システムは決して疎かになりませんでした。競争力のある94.91という精度スコアを維持しており、これはより大規模で低速な多くの強力なモデルよりも実際に高い数値です。
  • エラーへの対処: チームはこの手法がより堅牢(ロバスト)であることも示しました。従来のシステムが早い段階でミスを犯すと、混乱して同じエラーを文書の最後まで繰り返してしまうことがよくあります。HPD-Parsingは作業を独立したブランチに分割しているため、あるセクション(例えば表)でのミスは、そのセクション内に留まり、文書の他の部分を台無しにすることはありません。

なぜ重要なのか

この論文は、スピードと正確さを選択する必要はないということを示唆しています。文書には自然な構造があること、つまり、一つの脳によって管理されるグローバルなレイアウトと、多くの脳が協力して読み取ることができるローカルなコンテンツがあることを理解することで、情報をより効率的に処理できるのです。

研究者たちは単に高速なコンピュータを作ったのではありません。コンピュータが文書を「読む」という「考え方」を変えたのです。孤独で遅い歩行者ではなく、調整されたスプリンターのチームを作り上げたのです。このアプローチは、膨大なライブラリの文書をリアルタイムで処理することを可能にし、AIによる情報抽出、研究、データ検索を、以前は不可能だった規模で行う道を開くと彼らは主張しています。論文は、この「階層的並列」スタイルが、ドキュメント解析の未来における強力な新しい方向性であると結論づけています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →