BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes
BrowserForgeは、オープンなウェブ上で並列のブラウザサンドボックスを実行することで、203,238個の軌跡からなる多様なコーパスを生成し、高品質なウェブインタラクションデータの生成をスケールアップさせるフレームワークであり、これによりライブおよびスタティックなベンチマークにおけるピクセルベースのウェブエージェントの性能を大幅に向上させます。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットをナビゲートするのを助けるための、コンピュータプログラムを想像してみてください。それは、タスクを完了するためにボタンをクリックしたり、テキストを入力したり、ページをスクロールしたりできるデジタルアシスタントのようなものです。これらのプログラムがこれを行う方法を学ぶためには、人間が開始点から終了目標までどのように移動するかを観察しながら、実際のウェブサイトで練習する必要があります。これまで、これらのプログラムを教育するために使用されたデータは限られていました。ほとんどのトレーニングセットは、少数の固定された人気ウェブサイト上で人間の動作を記録したり、狭い範囲のチュートリアルに基づいた架空のシナリオを生成したりすることで構築されてきました。これは、プログラムがインターネットのごくわずかな部分しかナビゲートすることを学習できないことを意味しており、新しい、あるいは未知のサイトに遭遇すると苦戦することになりました。彼らは、たった一冊の教科書しか勉強したことがない学生のようでした。別の本を渡されると、その読み方を知らなかったのです。
研究チームは、この問題を解決するために「BrowserForge」と呼ばれるシステムを構築しました。少数の選定されたウェブサイトのリストに頼る代わりに、彼らはインターネット全体を訓練の場へと変えました。彼らは、それぞれが個別のウェブブラウザを実行する数百台の仮想コンピュータからなる大規模なネットワークを作成しました。これらのブラウザは、公開されているウェブ上にある何十万もの異なる実際のウェブサイトを訪問するように送り出されました。システムは単にこれらのページを訪問しただけではありません。それらのページ上でタスクを実行しようと試みました。第一の人工知能エージェントがページを観察し、「特定の記事を見つける」や「価格をチェックする」といった、もっともらしいタスクを考案しました。次に、第二のエージェントが、クリックやタイピングを行うことでそのタスクを完了しようと試み、行ったすべての動きを記録しました。もしタスクが正常に完了した場合、それらの動きの記録はレッスンとして保存されました。もしエージェントが行き詰まったり失敗したりした場合は、その試行は破棄されました。このプロセスが何度も繰り返され、完全に異なるウェブサイトから抽出された20万件以上のユニークな学習例が生成されました。
研究者たちは、このアプローチが以前利用可能だったものよりもはるかに大規模で多様なデータセットを生み出したことを発見しました。古いデータセットは、数百のサイトからわずか数千の例しか含んでいませんでしたが、この新しいコレクションは、20万近い異なるウェブサイトをカバーしていました。この新しいデータを使用してコンパクトで効率的なコンピュータモデルを訓練したところ、結果は即座に、かつ劇的なものでした。ライブウェブサイト上でタスクを完了するモデルの能力は、約25パーセントから33パーセント以上に跳ね上がりました。この向上は単なる小さな上昇ではなく、比較的小さなモデルが、より古く限定的なデータで訓練された、より大きく複雑なシステムを凌駕することを可能にしました。この研究は、改善の鍵がモデルを教えるための新しいテクニックにあるのではなく、単にモデルが見たウェブサイトの多様性にあることを示しました。システムを、開かれたウェブの混沌とした予測不可能な現実にさらすことで、研究者たちは、より適応力を高める方法を教え込んだのです。
この手法の成功は、注意深いクリーニングプロセスに依存していました。システムは人間の監督なしにタスクを生成し、それを試みていたため、多くの試行が失敗したり、乱れた記録を生み出したりしました。研究者たちは、これらの悪い例を除去するためのフィルターを構築しました。まず、単純なルールを使用して、完了しなかったものなど、明らかに失敗した試行を破棄しました。次に、別のインテリジェントなシステムを使用して、残りの試行をレビューし、タスクが実際に完了したかどうかを確認しました。最後に、学習モデルがアクションの背後にある論理を理解できるように、成功した試行を明確で一貫した形式に書き換えました。これにより、モデルがノイズではなく、高品質な例から学習することを保証しました。研究は、ウェブサイトの多様性が成功の主な推進力であったことを裏付けました。研究者が異なる種類のウェブサイトやタスクでモデルをテストした際、その改善は安定して維持されており、モデルが特定のページを暗記したのではなく、真に一般的なスキルを学習したことを示唆していました。
この取り組みは、コンピュータにウェブをナビゲートする方法を教える最善の方法は、コンピュータ自身にウェブを探索させることであることを示しています。実際のサイトを訪問し、実際のタスクを実行するプロセスを自動化することで、研究者たちは、インターネットの真の複雑さを反映したトレーニングセットを作成しました。その結果、より有能で信頼性の高いデジタルアシスタント、つまり、今日存在する何百万ものウェブサイトの予期せぬレイアウトやユニークな機能を扱うことができるアシスタントが誕生しました。今回の知見は、このオープンウェブのデータ量が増えるにつれて、これらのエージェントの性能は向上し続け、真のユニバーサル・ウェブ・アシスタントという目標に近づいていくことを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。