← 最新の論文
💬 NLP

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

本論文は、3つのマルチモーダルなブラウジング情報フローパターンすべてを網羅する包括的な学習データを生成し、探索を意識した強化学習を用いて、マルチモーダルなBrowseCompベンチマークにおいてベースモデルおよび主要なクローズドソースエージェントを大幅に上回る最先端の性能を達成する35B規模のエージェントを訓練する、新しいデータ・トゥ・エージェント・フレームワークであるUNIBROWSEを導入している。

原著者: Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、まるでミステリーを解く探偵になったような気分で想像してみてください。単にメモ帳に書かれたいくつかの手がかりを読むのではなく、図書館、フォトアルバム、そしてライブニュースフィードの間を飛び回って答えを見つけ出さなければなりません。それが「マルチモーダル・ブラウズコンプ(Multimodal BrowseComp)」タスクです。これは、AIエージェントがテキストを読み、画像を見て、検索ツールを駆使して、単一のウェブページには載っていない解決策を繋ぎ合わせなければならない、超難解なパズルです。

長い間、私たちが訓練してきたAI探偵たちは、少し片手落ちでした。彼らはテキストの手がかりを読んだり、写真を見てからテキストを読んで答えを見つけたりすること(例:犬の写真を見て「この犬種は何?」と検索する)は得意でしたが、その逆、つまりテキストを読んで「何を探すべきか」を判断すること(例:奇妙な建物の記述を読んでから、その形を確認するために写真を検索する)は非常に苦手でした。

大きな発見:「UniBrowse」探偵
この論文の背後にいる研究者たち、北京大学のチームは、UNIBROWSEと呼ばれる新しいトレーニングシステムを構築しました。これは、AIエージェントにこれら3つのタイプすべての手がかりを扱えるように教え込む、非常にスマートな「特訓キャンプ」のようなものです。

  1. テキストのみ: 事実を読み取り、結びつける。
  2. 画像からテキストへ: 写真から始まり、その物語を見つけ出す。
  3. テキストから画像へ: まず物語を読み、それを証明するための合致する写真を探し出す。

これ以前は、ほとんどのトレーニングキャンプは最初の2つのタイプしかカバーしていませんでした。著者らは、この3番目のタイプ(テキストから画像へ)を無視することは、現実世界のシナリオにおいて、視覚的に事実を検証する必要がある場面でのAIの「学習不足」を招くと主張しています。また、彼らは従来のメソッドが、街の中をランダムに彷駆して(多くのノイズや誤った方向へ導かれる)いたり、あるいは完璧すぎる偽の地図だけを見ている(現実世界の混沌とした状況とは一致しない)状態であったことにも気づきました。UNIBROWSEは、強固な「地図」(知識グラフ)からスタートしながらも、手がかりが本物であることを確認するために、実際のインターネットからライブでリアルタイムのエビデンスを掴み取ることで、この問題を解決します。

「探索」フィルター:無駄を削ぎ落とす
ここが巧妙な点です。研究者たちは、すべての練習問題が平等ではないことに気づきました。ある問題には解決策が退屈な方法で一つしかない一方で、別の問題はエージェントに異なる経路を試したり、後退したり、再び挑戦したりすることを強います。

これを解決するために、彼らは**「探索度(exploration degree)」**という新しい指標を発明しました。想像してみてください、あなたが学生の宿題を採点しているとします。もし全ての学生が全く同じ簡単な方法で数学の問題を解いていたら、あまり学びが得られません。しかし、ある生徒は近道を見つけ、別の生徒は行き詰まって引き返し、さらに別の生徒は巧妙な新しい経路を見つけたとしたら、それこそが真の学びが行われる場所なのです。

チームはこの「探索度」を使用してデータをフィルタリングしました。彼らは退屈で一本道の問題は捨て去り、最も「探索的」な上位**30%**の問題だけを残しました。これにより、彼らの強化学習(試行錯誤を通じてAIが学ぶプロセス)は、エージェントに深く考えさせるためのパズルにのみ焦点を当てることができ、非常に効率的になりました。

結果:新たなチャンピオン
このパイプラインを用いて、彼らは350億パラメータを持つAIエージェント(非常に大きな脳)を構築しました。彼らは単に上手くいくと予想したのではなく、5つの異なる難関ベンチマークに対して測定を行いました。

結果は目覚ましいものでした。彼らの新しいエージェントであるUniBrowseは、これらのテストで平均精度54.4を記録しました。

  • これは、ベースモデルであるQwen3.5-35B-A3Bの43.9から、10.5ポイントの跳ね上がりです。
  • 彼らは、GPT-5やGemini-2.5 Proといった、それぞれ42.944.8を記録した有名な「クローズドソース」の巨人を打ち破りました。
  • さらに、Kimi K2.5(50.8)のような他のオープンソースモデルをも上回りました。

主張していないこと
この論文が言及していない重要な点もあります。著者らは、UniBrowseが彼らが見た中で最高のオープンソースエージェントであることは認めていますが、依然として最強のプロプライエタリ・システム(Gemini-3.1 Proが63.2に達した例など)には勝っていないことを注意深く述べています。また、彼らのエージェントはテキストと画像を用いた公開ウェブブラウジングに限定されており、インタラクティブなウェブサイト、動画、地図などはまだ扱えないことも認めています。彼らは、残りの差を埋めるためには、より大きなモデルや優れたツールが必要になる可能性があると示唆していますが、AIブラウジングの問題を完全に解決したとは主張していません。

結論
3種類の手がかり(テキスト、画像からテキスト、テキストから画像)を網羅するトレーニングシステムを構築し、退屈な練習問題を排除することで、UNIBROWSEチームは、インターネット上の複雑で多段階のミステリーを解く能力が大幅に向上したAIエージェントを作り上げました。これは、エージェントの「脳」がいかに大きいかと同じくらい、どのように訓練するかが重要であることを証明する、着実な一歩です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →