← 最新の論文
🤖 AI

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

本論文は、HTTP レベルのキャッシングと大規模言語モデルに基づく合成を活用してスケーラブルかつ再現性のある Web 環境を構築するフレームワーク「Weblica」を導入し、これにより視覚的 Web 移動タスクにおいて既存のオープンウェイトベースラインを上回る Weblica-8B モデルの訓練を可能にすることを報告する。

原著者: Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

公開日 2026-05-11
📖 1 分で読めます☕ さくっと読める

原著者: Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにインターネットを操作させ、フライトの予約や靴の購入、フォームの記入などのタスクを実行させる方法を教えたいと想像してみてください。インターネットは混沌とし、常に変化する場所です。まるで、潮が絶えず変化し、新たな波が毎秒のように打ち寄せる嵐の海に、誰かを投げ入れて泳ぎを教えるようなものです。

これが、論文WEBLICAが解決しようとしている問題です。アップル社の著者らは、「ライブ」のウェブ上で AI エージェントを訓練することは、あまりにも煩雑で遅く、予測不可能だと気づきました。その代わりに、彼らはWEBLICAと呼ばれる巨大で完璧なオフラインシミュレーターを構築しました。

彼らがどのように行ったか、2 つの簡単な部分に分けて説明します。

1. 「タイムトラベルカメラ」(HTTP レベルのキャッシング)

ウェブページの写真を撮ると想像してください。ただし、単なる画像ではなく、あなたのコンピュータとウェブサイトとの間の完全な会話を記録します。

  • 問題点: その会話を後で再生しようとすると、ウェブサイトが「待て、セッショントークンが異なる!」「タイムスタンプが間違っている!」と言ってブロックしてくることがあります。これは、再ロックされたドアに古い鍵を使おうとするようなものです。
  • 解決策: チームは、すべてのリクエストとレスポンスを記録する「タイムトラベルカメラ」として機能するスマートなシステムを構築しました。その後、タイムスタンプやランダムなセッション番号など、毎回変化する部分を無視し、安定した部分のみを保持するルールブックを使用して処理します。
  • 結果: これにより、記録されたウェブサイトを、実際のインターネットに接続することなく、完璧に何度も再生できるようになりました。まるで、ボタンをクリックしたりボックスに入力したりできる、完璧に凍結されたウェブサイトのスナップショットを持っているようなものです。

2. 「無限のレゴ工場」(LLM による合成)

時には、ウェブサイトが複雑すぎるか、まだ存在しないため、単に記録することができないこともあります。

  • 問題点: 実際のウェブサイトは限られています。「ショッピングカート」や「フライト予約ページ」の 1 万種類もの異なるバージョンを練習用に見つけることは容易ではありません。
  • 解決策: 彼らは、超賢い AI コーダー(LLM)を工場として機能させました。「ヨガスタジオのクラス予約ができるウェブサイトを作って」とか、「車種を比較できるディーラーサイトを作って」と指示しました。
  • 魔法: AI コーダーはコードからこれらのウェブサイトをゼロから構築し、偽の画像を作成し、さらにはそれらで行う必要があるタスクさえも考案します。まるで、ドアや窓が機能する状態で、城、宇宙船、家など、100 万種類もの異なるバージョンを瞬時に建設できるレゴ工場のようなものです。これにより、ロボットはそれらを開く練習ができます。

なぜこれが重要なのか:「トレーニングジム」

これらの 2 つの方法を組み合わせることで、著者らは AI のための巨大で安全なトレーニングジムを構築しました。

  • 嵐の心配なし: 彼らは、実際のインターネットが壊れたり、変化したり、ボットをブロックしたりすることを心配する必要がありません。
  • 速度: すべてがオフラインでローカルにあるため、AI は実際のウェブサイトの読み込みを待っている場合よりも数千倍速く練習できます。
  • 規模: 彼らは、多様で偽物だが現実的な環境の数千種類で AI を訓練しました。

結果:「Weblica-8B」チャンピオン

彼らはこのジムでWeblica-8Bというモデルを訓練しました。何が起きたかはこちらです。

  • より速く、賢い: 実際のウェブサイトでテストされた際、このモデルは同じサイズの他のオープンソースモデルよりもタスクをうまく解決しました。
  • より少ないステップ: 競合他社よりも少ないクリック数と試行回数で問題を解決できました。
  • スケーラビリティ: より多くの思考時間(より多くの「テスト時計算」)を与えると、さらに性能が向上し、使用に費用がかかる高価なプロプライエタリ AI モデル(OpenAI や Google のものなど)の性能にほぼ匹敵します。

要約すると: 論文はこう述べています。「ロボットを、学ぶために混沌とした実際のウェブの海に投げ込まないでください。代わりに、濡れることなく数百万回練習できる完璧で無限のオフラインシミュレーターを構築してください。」そして、それは機能しました。ロボットは驚くほど上手に泳ぐことを学びました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →