← 最新の論文
🤖 AI

GTA: Generating Long-Horizon Tasks for Web Agents at Scale

本論文は、既存のベンチマークの限界を克服し、堅牢な訓練と評価を可能にするため、クロール、検索ベースのシード生成、および自動検証を統合して、実行可能な軌道を持つ現実的なマルチホップ Web エージェントタスクを自動的に生成するスケーラブルなフレームワークである GTA を紹介する。

原著者: Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにインターネットの使い方を教えようとしていると想像してください。このロボットには脳(言語モデル)と手(クリックや入力をするためのツール)がありますが、現在は非常に不器用です。「フランスの首都はどこか?」のような単純な答えは見つけられますが、「東京行きの最も安い航空券を探し、ホテルにプールがあるか確認し、飛行機の時刻が私の医師の予約と合っているか確認する」といった複雑なミッションには苦労します。

問題は、私たちがこのロボットに十分な「質の高い」練習を与えてこなかったことです。

問題:壊れた地図での訓練

現在、これらのウェブロボットに対するテストの多くは、「出発点」と「目的地」しか示されていない地図を与えられ、そこへの道順についての指示がないようなものです。

  • 従来のベンチマーク: これらは人間によって作成された手書きの謎解きのようなものです。数が少なく、単純な一ステップのタスクしかテストしていないことが多いです。
  • 自動的な試行: 一部の研究者は、ロボットに自らウェブサイトを探索させて新しい謎解きを作成しようとしました。しかし、これは幼児におもちゃを見つけるためにショッピングモールを放浪させたようなもので、彼らは輝いて目につくもの(おもちゃ屋など)しか見つけず、それ以外(薬局やフードコートなど)は見向きもしませんでした。また、非常にコストが高く、時間がかかりました。

このため、ロボットは「過学習」を起こしています。与えられた特定の謎解きを暗記してしまっており、異なるページやウェブサイトを行き来して問題を解決しなければならない、現実世界の複雑な状況には対応できません。

解決策:GTA(「建築家」アプローチ)

著者らは、GTA(大規模なウェブエージェント向け長期タスクの生成)を導入しました。GTA をはたらく先生がワークシートを配るものではなく、トレーニングジムを建設するマスター建築家だと考えてください。

以下に、彼らがそれを構築した手順を簡単に示します。

  1. クロール(都市の地図作成): ロボットが盲目に放浪する代わりに、GTA はまずデジタルの「偵察員」の部隊を送り出し、電子商取引サイト、政府サイト、ニュースポータルなど、ウェブサイト全体を地図化します。それらはすべてのページとそれらのつながりを記した完全な「都市地図」を作成します。
  2. シード(課題の選定): 難しいタスクがどのようなものか推測する代わりに、GTA は地図上の 2 つのランダムな場所(例えば、特定の靴に関するページと特定の割引に関するページ)を選びます。
  3. 生成(ミッションの作成): AI に、両方の場所を訪れることが解決に「必要となる」ミッションを書かせるよう依頼します。例えば、「ページ A の靴の価格を見つけ、その後ページ B にそれが安くなるクーポンがあるか確認する」といったものです。
  4. 品質管理(審判): ミッションが公開される前に、厳格な審判がそれをチェックします。
    • 解決可能か?(実際に答えを得られるか?)
    • 明確か?(正解が一つだけか?)
    • マルチホップか?(ロボットに複数のページを訪れさせるか?)
  5. ゴールドパス(解答鍵): 重要なのは、GTA がロボットが取るべき「正確な」経路を記録することです。これにより、研究者はミッションを完全に再生し、ロボットがどこで間違えたかを正確に確認できます。

なぜこれが重要なのか:「人間とロボット」の格差

著者らは、この新しいジムで現在のロボットをテストし、大きな格差を発見しました。

  • ロボット: これらの新しい多段階タスクに直面した際、ロボットはほとんどの場合失敗しました(多くの場合 20% 未満のスコア)。道に迷ったり、早々に諦めたり、サイトを適切にナビゲートする代わりに検索バーを使ったりしました。
  • 人間: 同じタスクを人間が試したところ、容易に解決しました(成功率 85%)。
  • 検索エンジン: 答えが一つの場所にあるのではなく、異なるページに隠れていたため、単純な Google 検索さえもこれらのタスクを解決できませんでした。

GTA の主要な特徴

  • 「生きている」ジム: 時間の中で凍りついた静的な古いテストとは異なり、GTA はライブのウェブサイトから新しいタスクを生成し続けることができます。これにより、ロボットが単に答えを暗記することを防ぎます。
  • グローバル: 英語だけでなく、イタリア語、日本語、ドイツ語、中国語など、多くの言語で機能します。ロボットは非英語のサイトではさらに苦労しました。
  • サイト横断型: 一部のタスクでは、ロボットが問題を解決するために健康サイトから金融サイトへジャンプする必要があり、これは人々が実際にウェブを利用する様子を模倣しています。

結論

GTA は、ウェブロボットのための現実的で困難な訓練ミッションを作成するための、新しく大規模で自動化されたシステムです。これは、現在のロボットが現実のインターネットの複雑で多段階的な性質をナビゲートする能力において依然としてかなり脆弱であることを証明しています。無限に高品質で検証可能な課題を生成する方法を提供することで、GTA は研究者がロボットがどこで失敗しているかを正確に理解し、より良いロボットを構築するのを助けます。

何ではないか:

  • 医師や企業がすぐに使用できるツールではありません。
  • ウェブエージェントの問題を解決したと主張しているわけではありません。単により良いテスト方法を提供し、まだ多くの作業が残っていることを示しただけです。
  • 安全上の規則により、プライベートアカウントへのログインや実際の購入を必要とするタスクは対象外です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →