Scaling Agents for Computer Use
本論文は、行動ナラティブ(behavior narratives)を用いて複数の実行ロールアウトを評価・選択することで、コンピュータ操作エージェントの信頼性を向上させ、OSWorldにおいて人間レベルの能力を凌駕する最先端の性能を達成するフレームワークであるBehavior Judge (BJudge) を紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、コンピューターの画面を見ながら、ロボットに洗濯をし、夕食を作り、請求書を支払う方法を教えようとしていると想像してください。これが「コンピューター使用エージェント(CUA)」が本来すべきことです。これらは、人間と同じようにボタンをクリックし、テキストを入力し、ソフトウェアを操作できるAIプログラムです。
しかし、大きな問題があります。これらのロボットは非常に脆いのです。もし早い段階で、例えば間違ったウィンドウをクリックしたり、ポップアップを見逃したりといった小さなミスを一度でも犯すと、そのエラーは雪だるま式に膨れ上がります。ステップ50に到達する頃には、彼らは完全に迷子になっています。それはまるで、風の吹く部屋でトランプの家を作ろうとしているようなものです。一つの小さな揺れが、すべてを台無しにしてしまいます。
旧来の方法:「ワン・アンド・ダン(一度きりの試行)」
以前、研究者たちは、ロボットが次のクリックを行う前に「もっと深く考える」ように指示することで、この問題を解決しようとしました。彼らはAIに対し、次のクリックに対して5つの異なるアイデアを生成し、その中から最善のものを選ぶよう求めました。しかし、これは、一人の人物に「食料品店への5つの異なるルートを考え、その中からベストなものを選び、そして歩きなさい」と頼むようなものです。もしその一人が最初の交差点で混乱してしまったら、旅全体が失敗してしまうからです。
新しいアイデア:「レース」(ワイド・スケーリング)
論文の著者たちは、**ワイド・スケーリング(Wide Scaling)**と呼ばれる異なる戦略を提案しています。一つのロボットに正解させるのではなく、同じタスクに挑戦するために、10体の異なるロボットを同時に送り出すのです。
これは、10人のランナーによるレースのようなものです。たとえランナー#3が転び、ランナー#7が道に迷ったとしても、ランナー#5が近道を見つけて勝つかもしれません。目標は、10回の試行を並列で走らせ、その中の勝者を選ぶことです。
ボトルネック:どうやって勝者を選ぶのか?
ここがトリッキーな部分です。10体のロボットのうち、どれが実際に成功したのかをどうやって判断すればよいのでしょうか?
- 問題点: ロボットがタスクに取り組んでいる10時間のビデオをすべて見るのは、あまりにも膨大な作業です。ビデオの大部分は、退屈であったり無関係なものだったりします(例えば、ロボットが空白の画面をじっと見つめている場面など)。さらに、多くのタスクには、完了するための「正しい」方法が複数存在します。単純なスクリプトでは、生のスクリーンレコーディングを見るだけで、ロボットが成功したのか失敗したのかを簡単に判断することはできません。
- 比喩: 料理コンテストを判定するために、シェフたちが料理をしている3時間の映画を10本も見なければならない状況を想像してください。あなたは疲れ果て、重要な瞬間を見逃してしまうでしょう。アクションを要約する方法が必要です。
解決策:「ビヘイビア・ジャッジ(BJudge)」
著者たちは、新しいシステムである**ビヘイビア・ジャッジ(BJudge)**を導入しました。その仕組みは以下の通りです。
- レース: 彼らは、異なるAIモデルを用いて、タスクを10回同時に実行します。
- 翻訳機(ビヘイビア・ナラティブ・ジェネレーター): ジャッジに画面の生のビデオを見せる代わりに、このシステムは「翻訳機」として機能します。これは各ロボットの試行を観察し、何が起きたのかについての短く明快な物語(ナラティブ)を書き上げます。
- 生のデータ: 「ロボットはマウスをピクセル400, 200に移動し、クリックし、画面が更新され、新しいウィンドウが開いた……」
- 書き出される物語: 「ロボットは『保存』をクリックし、ドキュメントはフォルダに正常に保存された。」
- これはノイズを取り除き、原因と結果(「私はXを行った、そしてYが起きた」)に焦点を当てます。
- ジャッジ(比較評価者): これにより、ジャッジは10時間のビデオを見る代わりに、10の短い物語を読むことになります。ジャッジはそれらを並べて比較します。「物語Aはファイルが保存されたと言っている。物語Bはファイルが削除されたと言っている。物語Aの勝ちだ。」
結果
彼らがOSWorld(現実世界のコンピュータータスクの集合体)というベンチマークでテストを行ったところ、以下の結果が得られました。
- 旧来の最高値: 以前の最高の手法は約**63.4%**のタスクに成功しました。
- 人間レベル: 人間は約**72.36%**のタスクに成功します。
- 新しい手法(BJudge): 彼らのシステムは**72.6%**を達成しました。
彼らは単に以前のロボットに勝っただけでなく、人間をも超えたのです。
なぜこれが重要なのか
この論文は、AIエージェントを信頼できるものにするための鍵は、個々のエージェントを賢くすることだけではなく、多くのエージェントを同時に走らせ、その中のベストな結果を選ぶスマートなシステムを持つことにあることを示しています。
彼らはまた、異なるオペレーティングシステム(WindowsおよびAndroid)でもテストを行い、この手法がうまく機能することを確認しました。これは、この「レースして判定する」戦略が、コンピューターを使用するAIをより堅牢にするための普遍的な方法であることを証明しています。
要約すると: AIコンピューターの「脆さ」を解決するには、単に完璧なロボットを一つ作るのではなく、10体のロボットを作り、彼らをレースさせ、彼らの乱雑な試行をシンプルな物語へと翻訳させ、そしてスマートなジャッジに勝者を選ばせるのです。このシンプルな変更によって、彼らは複雑なデジタルタスクにおいて人間のパフォーマンスを超えることができました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。