← 最新の論文
💬 NLP

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PixelRAGは、パースされたテキストの代わりにウェブサイトの生のスクリーンショットを検索・処理することで、レイアウトの損失を排除し、従来のテキストベースのRAGシステムと比較して多様なベンチマークにおいて優れた性能と効率性を達成する、完全にピクセル空間で動作する新しい検索拡張生成フレームワークを導入するものである。

原著者: Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

数百万冊の本がある巨大な図書館の中から、特定の事実を見つけ出そうとしている場面を想像してみてください。

旧来の手法(テキストベースのRAG): 「目が見えない司書」
現在、ウェブを検索するほとんどのAIシステムは、目が見えない司書のように機能しています。質問を受けると、システムはまず(画像、表、太字、カラフルなボックスなどで構成された)ウェブページを取り込み、視覚的なデザインをすべて削ぎ落として「読み取ろう」とします。そして、ページをスピーチの書き起こしのような、長く平坦なプレーンテキストの文字列へと変換してしまうのです。

ここには問題があります。このプロセスは非常に雑然としています。例えるなら、完成した料理の写真や、ステップごとの写真、あるいは調理時間を表した表を無視して、材料リストだけを読んで複雑なレシピを理解しようとするようなものです。

  • 情報の喪失: システムがページを平坦化すると、しばしば構造が失われます。表は単語の乱雑な塊に変わってしまうかもしれません。チャート(図表)は完全に消えてしまうこともあります。
  • 混乱: ページの「テキスト版」は、他のページと非常によく似たもの(同じキーワードが大量に含まれるもの)になりやすいため、たとえ正しい答えが、平坦化されてしまった画像や表の中に存在していたとしても、司書は間違ったページや間違った段落を掴んでしまうことがあります。

新しい手法(PIXELRAG): 「鋭い眼識を持つ探偵」
この論文の著者たちは、次のようなシンプルな問いを立てました。「なぜ、人間が見ている通りにウェブページを見ないのだろうか?」

PIXELRAGは、ページをテキストに変換する代わりに、ウェブページのスクリーンショットを撮ります。インターネットを、画像の巨大なコレクションとして扱うのです。

  • 図書館: 図書館は今や、3,000万枚のウェブページのスクリーンショットが並ぶ壁のようなものになりました。
  • 検索: 質問をしたとき、システムはテキストファイル内のキーワードを探すのではありません。特殊な「視覚的な脳」(視覚言語モデル:Vision-Language Model)を使用して、答えが含まれていそうな「見た目」のスクリーンショットを見つけ出します。システムは、画像を見るだけで、表やチャート、あるいは特定のレイアウトを識別できます。
  • 読解: 適切なスクリーンショットを見つけると、システムはその画像を直接AIリーダーに渡します。リーダーはピクセルを見つめ、画像内のテキストを読み取り、表の構造を設計通りに正確に把握します。翻訳も、平坦化も、情報の喪失もありません。

なぜこれが画期的なのか(比喩による解説)

  1. 「表」の問題:
    スポーツの統計が載ったスプレッドシートを想像してください。
  • テキスト方式: システムはこれを「チームA、7、チームB、0、日付、5月22日……」と読み取ります。これでは、「7」が「チームA」に属しているという繋がりが失われてしまいます。
  • Pixel方式: システムはグリッド(格子)を見ます。線とレイアウトが見えているため、「7」が「チームA」の列にあることを瞬時に理解します。
  1. 「インフォボックス」の罠:
    Wikipediaの各記事には、基本的事実をまとめたサイドバーの要約ボックス(インフォボックス)があります。
  • テキスト方式: システムがページをテキストに変換すると、この要約ボックスは大量のキーワードの塊になります。もし「マネージャーは誰ですか?」と質問した場合、システムはキーワードが詰まっているために要約ボックスを拾ってしまうかもしれません。たとえ本当の答えがメインの本文段落の中にあったとしても、要約ボックスが「本物の答え」をかき消してしまうのです。
  • Pixel方式: システムは、要約ボックスが横にある小さな枠付きのボックスであり、メインのストーリーは大きなテキストのブロックであることを認識します。そのため、ボックスを無視してメインのストーリーに注目し、より速く答えを見つけることができます。
  1. 「圧縮」のトリック:
    驚くべき発見の一つは、答えを得るために高解像度の写真は必要ないということです。研究者たちは、スクリーンショットを(例えば4K写真を小さなサムネイルにするように)縮小しても、AIは依然としてテキストを完璧に読み取れることを見出しました。これは、部屋の向こう側から新聞を読んでいるようなものです。見出しを確認するために、すぐ目の前まで寄る必要はありません。これにより、システムをより安価かつ高速に運用できるようになります。

結果
この論文は、有名な質問回答テストを用いて検証を行いました。テキストのみを対象としたテストにおいてさえ、PIXELRAGはテキストベースのシステムを上回りました。

  • 表の中に隠された答えを見つける能力に優れていました。
  • 古いシステムを混乱させる「ノイズ」(無関係なテキスト)を無視することに長けていました。
  • 画像やレイアウトが重要なニュースサイトや複雑な文書において、より高いパフォーマンスを発揮しました。

まとめ
PIXELRAGは、インターネットをテキストボックスに押し込めようとするのをやめました。代わりに、インターネットをあるがままの姿、つまり視覚的な場所として受け入れています。スクリーンショットから直接検索し、読み取ることで、カラフルで構造化されたウェブページを退屈で平坦な段落に変えようとした時に起こるミスを回避しているのです。それは、映画の書き起こしを読むのではなく、実際に映画を観ることに切り替えるようなものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →