← 最新の論文
💬 NLP

LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling

既存の人間による作成された検索ベンチマークの難易度の天井を克服するため、本論文は、現在の最先端の検索エージェントに大きな課題を与え、その精度を34.74%にまで低下させる、11のドメインにわたる544個の複雑で長期的な質問を特徴とする、自動化された知識グラフベースのベンチマークであるLoHoSearchを導入する。

原著者: Jiarui Zhao, Rongzhi Zhang, Lingchuan Liu, Hao Yang, Xunliang Cai, Xi Su

公開日 2026-06-12
📖 1 分で読めます☕ さくっと読める

原著者: Jiarui Zhao, Rongzhi Zhang, Lingchuan Liu, Hao Yang, Xunliang Cai, Xi Su

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

LoHoSearch の解説:概念を日常的な例えで分かりやすく

大きな問題:「イージーモード」の罠

宝探しゲームを想像してみてください。目的は、隠された特定の宝物を見つけることです。ここ1年、研究者たちは「BrowseComp」というゲームを使って、AI「サーチエージェント」(インターネットを閲覧するロボット)のテストを行ってきました。

最初は難しいゲームでした。しかし、人間が質問を作成したため、意図せず問題が簡単になりすぎてしまいました。人間はどうしても有名なもの(例:「エッフェル塔」や「テイラー・スウィフト」)を選び、それらを明らかな手がかりと結びつけてしまいがちです。それは、まるで「宝物」と書かれたドアの後ろに宝物を隠しているようなものです。

手がかりがあまりにも明白だったため、優れたAIロボットはすぐにパズルの90%を解けるようになってしまいました。その結果、ゲームは「賢いロボット」と「非常に賢いロボット」を見分ける能力を失ってしまったのです。難易度は「天井」に達してしまい、人間が設計した質問では、インターネット全体にどれほど多くの「宝物」が隠れているかの完全なマップを持っていないため、この壁を突破することができませんでした。

解決策:「スーパーマップ」の構築

この論文の著者である LoHoSearch は、人間の推測に頼るのをやめることにしました。代わりに、彼らは ナレッジグラフ(知識グラフ) に基づいた大規模な自動システムを構築しました。

このナレッジグラフを、インターネット全体(具体的にはWikipedia)の巨大なデジタル地図だと考えてください。そこには、700万以上のエンティティ(人物、場所、物事)とそのつながりが含まれています。

人間が質問を選ぶ代わりに、コンピュータはこのマップを使用して以下を行います:

  1. 「難しい」経路を見つける: 答えの候補が1つや2つではなく、数千個存在するような接続箇所を探し出します。
  2. 複雑な迷路を作る: ロボットが正しい道を見つけるまでに、多くの行き止まりを確認しなければならないような質問を作成します。
  3. 答えを検証する: 数学的に、その手がかりに適合する答えが「ただ一つだけ」であることを証明し、パズルが公平であることを保証します。

新しいゲーム:LoHoSearch

その結果、LoHoSearch(ロングホライゾン・サーチ) と呼ばれる新しいベンチマークが誕生しました。これには、音楽、スポーツ、映画など11の異なるトピックにわたる、544個のトリッキーな質問が含まれています。

この新しいゲームでは、ルールがどのように変わったのでしょうか:

  • 探索空間が膨大: 旧ゲームでの手がかりが「この曲を歌ったのは誰?」であれば、有名な歌手は5人程度でしょう。しかし、LoHoSearchでの手がかりは、「特定の年代、特定のジャンルの、あのマイナーな曲を歌ったのは誰?」といったものです。これでは、数百人の候補者が存在することになります。ロボットはそれらすべてをチェックしなければなりません。
  • 迷路がねじれている: 質問は単なる直線ではありません。手がかりが互いにループしながら交差する、絡まったクモの巣のような構造になっています。単に推測するだけでは不十分で、深く思考する必要があります。

結果:ロボットが壁にぶつかる

研究者たちは、世界最高峰のAIモデルをこの新しいゲームでテストしました。その結果は衝撃的でした。

  • 旧ゲーム: トップモデルのスコアは 90%以上 でした。
  • 新ゲーム: 最強のモデル(GPT-5.5)でさえ、わずか 34.7% しかスコアを出せませんでした。

それはまるで、ロボットたちがチェスのグランドマスターから、全く新しい、より難しいゲームのルールを学ぶのに苦戦している状態へと転落したかのようです。

なぜ既存のテクニックが通用しないのか

ロボットが難しいパズルで行き詰まったとき、通常は 「コンテキスト管理(文脈管理)」 という戦略を試みます。これは、探偵が100ページのメモを書いている状況を想像してください。ノートがいっぱいになったら、探偵は新しい情報を入れるスペースを作るために、メモを要約したり古いページを捨てたりします。

研究者たちは、これらの戦略をLoHoSearchに対してテストしました。

  • 旧ゲームでは、これらのテクニックによってロボットの性能が 14% 向上しました。
  • しかし、この新しい難しいゲームでは、テクニックによる向上はわずか 6.8% でした。

これは、問題が単に「覚えているかどうか」ではなく、「迷路」があまりにも複雑で「探索空間」があまりにも広いため、ロボットの現在の脳では、求められる長い思考の連鎖(推論)を処理できないことを示しています。

結論

LoHoSearch は、人間が書いた質問を少しずつ難しくするだけでは不十分であることを証明しました。AIが本当に賢くなっているのかを真にテストするためには、コンピュータが生成したマップを使用して、数学的に「難しい」ことが保証されたパズルを作る必要があります。

この新しいベンチマークは、AIの限界を明らかにする「ストレス・テスト」として機能します。AIは簡単な答えを見つけるのは得意ですが、膨大な情報の複雑なネットワークを通り抜け、たった一つの隠された真実を見つけ出すという課題においては、依然として大きな困難に直面しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →