✨ 要約🔬 技術概要
ロボットにインターネットを操作させ、フライトの予約や靴の購入、フォームの記入などのタスクを実行させる方法を教えたいと想像してみてください。インターネットは混沌とし、常に変化する場所です。まるで、潮が絶えず変化し、新たな波が毎秒のように打ち寄せる嵐の海に、誰かを投げ入れて泳ぎを教えるようなものです。
これが、論文WEBLICA が解決しようとしている問題です。アップル社の著者らは、「ライブ」のウェブ上で AI エージェントを訓練することは、あまりにも煩雑で遅く、予測不可能だと気づきました。その代わりに、彼らはWEBLICA と呼ばれる巨大で完璧なオフラインシミュレーター を構築しました。
彼らがどのように行ったか、2 つの簡単な部分に分けて説明します。
1. 「タイムトラベルカメラ」(HTTP レベルのキャッシング)
ウェブページの写真を撮ると想像してください。ただし、単なる画像ではなく、あなたのコンピュータとウェブサイトとの間の完全な 会話を記録します。
問題点: その会話を後で再生しようとすると、ウェブサイトが「待て、セッショントークンが異なる!」「タイムスタンプが間違っている!」と言ってブロックしてくることがあります。これは、再ロックされたドアに古い鍵を使おうとするようなものです。
解決策: チームは、すべてのリクエストとレスポンスを記録する「タイムトラベルカメラ」として機能するスマートなシステムを構築しました。その後、タイムスタンプやランダムなセッション番号など、毎回変化する部分を無視し、安定した部分のみを保持するルールブックを使用して処理します。
結果: これにより、記録されたウェブサイトを、実際のインターネットに接続することなく、完璧に何度も再生できるようになりました。まるで、ボタンをクリックしたりボックスに入力したりできる、完璧に凍結されたウェブサイトのスナップショットを持っているようなものです。
2. 「無限のレゴ工場」(LLM による合成)
時には、ウェブサイトが複雑すぎるか、まだ存在しないため、単に記録することができないこともあります。
問題点: 実際のウェブサイトは限られています。「ショッピングカート」や「フライト予約ページ」の 1 万種類もの異なるバージョンを練習用に見つけることは容易ではありません。
解決策: 彼らは、超賢い AI コーダー(LLM)を工場 として機能させました。「ヨガスタジオのクラス予約ができるウェブサイトを作って」とか、「車種を比較できるディーラーサイトを作って」と指示しました。
魔法: AI コーダーはコードからこれらのウェブサイトをゼロから構築し、偽の画像を作成し、さらにはそれらで行う必要があるタスクさえも考案します。まるで、ドアや窓が機能する状態で、城、宇宙船、家など、100 万種類もの異なるバージョンを瞬時に建設できるレゴ工場のようなものです。これにより、ロボットはそれらを開く練習ができます。
なぜこれが重要なのか:「トレーニングジム」
これらの 2 つの方法を組み合わせることで、著者らは AI のための巨大で安全なトレーニングジム を構築しました。
嵐の心配なし: 彼らは、実際のインターネットが壊れたり、変化したり、ボットをブロックしたりすることを心配する必要がありません。
速度: すべてがオフラインでローカルにあるため、AI は実際のウェブサイトの読み込みを待っている場合よりも数千倍速く練習できます。
規模: 彼らは、多様で偽物だが現実的な環境の数千種類で AI を訓練しました。
結果:「Weblica-8B」チャンピオン
彼らはこのジムでWeblica-8B というモデルを訓練しました。何が起きたかはこちらです。
より速く、賢い: 実際のウェブサイトでテストされた際、このモデルは同じサイズの他のオープンソースモデルよりもタスクをうまく解決しました。
より少ないステップ: 競合他社よりも少ないクリック数と試行回数で問題を解決できました。
スケーラビリティ: より多くの思考時間(より多くの「テスト時計算」)を与えると、さらに性能が向上し、使用に費用がかかる高価なプロプライエタリ AI モデル(OpenAI や Google のものなど)の性能にほぼ匹敵します。
要約すると: 論文はこう述べています。「ロボットを、学ぶために混沌とした実際のウェブの海に投げ込まないでください。代わりに、濡れることなく数百万回練習できる完璧で無限のオフラインシミュレーターを構築してください。」そして、それは機能しました。ロボットは驚くほど上手に泳ぐことを学びました。
技術概要:WEBLICA - 視覚的 Web エージェントのためのスケーラブルで再現可能なトレーニング環境
問題定義
自律型視覚的 Web エージェントの開発は、トレーニングデータと環境をスケーリングしつつ再現性を維持できないという決定的なボトルネックに直面している。Web は本質的に複雑で、開放的であり、絶えず進化している。既存のアプローチは以下のような重大な限界を有している:
オフライン軌道: オフラインの人間またはモデル生成の軌道を用いた教師あり微調整(SFT)に依存する手法は、Web の確率的性質に対処するために必要なインタラクティブ性を欠いている。
シミュレーション環境: 現在のシミュレーション環境(例:WebArena)は、手動で定義された数少ないドメインのみを網羅しており、実世界の Web の多様性への汎化を制限している。
ライブ Web でのトレーニング: ライブ Web サイト上で直接トレーニングを行うことは、タイムアウト、ボット検出、および Web サイトが時間とともに変化するにつれて制御されたアブレーションを実行できない、または再現可能なトレーニング条件を確保できないことにより不安定である。
中心的な課題は、厳密なトレーニングと評価に必要な再現性を犠牲にすることなく、Web の多様性を捉えるためにインタラクティブな Web 環境をどのようにスケーリングするかである。
手法
著者は、視覚的 Web エージェントのトレーニングのための再現可能かつスケーラブルな Web 環境を構築するためのフレームワークである**WEBLICA(Web Replica)**を提案する。このフレームワークは、多様なオフライントレーニング環境を生成するために、2 つの相補的なメカニズムに基づいて動作する:
1. HTTP レベルのキャッシング(Weblica-Cache)
このメカニズムは、高い忠実度で現実世界の Web サイトとのインタラクションを捕捉し、再生する。
記録: Playwright を使用して、すべての HTTP リクエストとレスポンスを捕捉しながらブラウジングセッションを記録する。
揮発性パラメータの処理: キャッシュミスを引き起こす揮発性パラメータ(例:タイムスタンプ、セッショントークン)の自動識別と正規化を行うことが主要な革新である。システムは、URL、ヘッダー、POST ボディからこれらのパラメータをフィルタリングするためのルールベースの正規化パイプラインを使用する。
再生: 揮発性パラメータを除去することで、システムは完全なネットワーク分離下で複雑な動的 Web インタラクションの決定論的再生を可能にする。
スケーリング: InstaV3 データセットを活用し、タスクをキャッシュされた環境にマッチングさせ、15,600 の検証済みキャッシュ環境とタスクを保持した。
2. LLM による環境合成(Weblica-Synth)
キャッシングの限界(安定した記録が存在するドメインに限定される)を克服し、特定のインタラクティブ機能を生成するために、著者は自動合成パイプラインを採用する。
機能抽出: Qwen3-VL-32B エージェントの成功および失敗した軌道を分析し、19,721 の微細な Web インタラクション機能を抽出し、144 の高レベル機能グループ(例:フォーム送信、認証、動的フィルタリング)に集約する。
生成: コーディングエージェント(Claude Code)を使用して、外部フレームワークの依存関係なしに、自己完結型の静的 Web 環境(HTML、CSS、JavaScript)を生成する。
パラメータ: 生成は、ターゲット機能グループ、Web サイトカテゴリ(銀行、旅行など 1,160 ドメインからサンプリング)、および視覚スタイル(961 のオプションからサンプリング)に基づいて条件付けられる。
アセット: 視覚アセット(画像、バナー)は Z-Image-Turbo を使用して生成される。
状態管理: 環境は静的であるため、状態を伴うインタラクション(例:ショッピングカート)は JavaScript の localStorage 経由で管理される。
検証: 生成されたサイトは、機能性と CSS 問題の不存在を確保するために、Playwright スクリーンショットによる反復的な自己検証を受ける。
スケーリング: このパイプラインは、トレーニング用(Weblica-train)に 44,227 のタスクを網羅する 2,500 の合成サイトを生成し、検証用(Weblica-val)に 250 のサイトを生成した。
エージェントの定式化とトレーニング
観測と行動: エージェントは視覚入力(1280x720 スクリーンショット + URL)のみに基づいて動作し、DOM 構造や汎化を損なう可能性のある「マーク集合」オーバーレイに依存することなく、座標ベースの行動(クリック、ホバー)を予測する。
ポリシー: ポリシーは、ビジョン - ランゲージモデル(VLM)が行動を選択する前に推論トレースを生成する ReAct スタイルのフレームワークに従う。
トレーニングパイプライン:
SFT ウォームスタート: ベースモデル(Qwen3-VL-Instruct)を 51.7K の検証済み成功軌道で微調整する。
RL トレーニング: Dr. GRPO(Group Relative Policy Optimization)を使用して、モデルを強化学習させる。
報酬メカニズム: LLM-as-Judge(GPT-4o)が、タスク記述、行動シーケンス、および結果のスクリーンショットに基づいてタスクの成功を評価し、プログラムによる検証がないオープンエンドなタスクでのトレーニングを可能にする。
主要な結果
著者は、最も優れたモデルであるWEBLICA-8B を、複数のベンチマークにおいてオープンウェイトベースラインおよび API ベースのエージェントと比較評価した。
ライブベンチマークでの性能: Online-Mind2Web ベンチマークにおいて、WEBLICA-8B はわずか 30 ステップで39.2% の pass@1 を達成した。これは、同程度のサイズのオープンウェイトベースライン(例:MolmoWeb-8B は 100 ステップ以上で 35.3%)を上回り、推論ステップを大幅に少なく使用している。
テスト時のスケーリング: モデルは追加の計算資源に対して好意的にスケーリングする。合計 240 ステップ(pass@8)で、WEBLICA-8B は**68.9%**の精度に達し、100 ステップで 60.8% の Gemini CUA などの API ベースモデルの性能に近づいた。
ベースラインとの比較:
WEBLICA-8B(30 ステップ)は、ライブベンチマーク全体でベースの Qwen3-VL-8B より平均 10.8 ポイント上回った。
最良のオープンウェイトベースライン(MolmoWeb-8B)を、合計ステップ数を 40% 少なく(60 ステップ対 100 以上以上)使用して上回った。
グラウンディングの維持: 明示的なグラウンディング監督なしのデータでトレーニングされたにもかかわらず、WEBLICA-8B はベースモデルと比較して UI グラウンディングベンチマーク(MMBench-GUI、ScreenSpot-v2、ScreenSpot-Pro)において性能を維持、あるいはわずかに向上させ、獲得が視覚的グラウンディングの劣化ではなく、改善されたナビゲーション行動に由来することを示している。
アブレーション研究:
環境構成: 合成環境は、Online-Mind2Web や WebTailBench などの複雑なベンチマークにおいて、キャッシュのみの環境よりも一般的に優れていた。
トレーニング段階: SFT と RL の組み合わせが、すべてのモデルサイズ(2B、4B、8B)で最良の結果を提供し、RL は SFT 単独よりも大幅な向上をもたらした。
意義と主張
本論文は、WEBLICA がライブ Web トレーニングに対するスケーラブルで再現可能な代替手段 を提供し、実世界の Web の多様性と大規模強化学習に必要な安定性の間のギャップを効果的に埋めると主張している。
スケーラビリティ: HTTP キャッシングと LLM による合成を組み合わせることで、フレームワークは数千の多様な環境を生成し、以前のシミュレーション環境のドメイン制限を克服する。
再現性: フレームワークはネットワーク遅延、タイムアウト、ボット検出の問題を排除し、制御された決定論的トレーニングと評価を可能にする。
効率性: このアプローチは、大規模な人間のデモンストレーションや高価な API モデルに依存することなく高性能な視覚的 Web エージェントをトレーニングできることを示しており、大幅に少ない推論ステップで競争力のある結果を達成している。
汎化: 視覚的グラウンディングを維持しながら中核的なナビゲーションスキルを捉える合成環境でトレーニングする能力は、汎用コンピューター使用エージェントへの viable な道筋を示唆している。
著者は限界を認め、キャッシュされた環境は静的なスナップショットであり、合成環境は動的な現実世界アプリケーションの複雑さを完全に捉えられない可能性(シミュレーションから現実へのギャップ)があると指摘している。また、現在の焦点はシングルターンタスクにあるが、現実世界の使用はマルチターンセッションや人間とのループインタラクションを伴うことが多いとも述べている。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×