OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents
本論文は、現在のコンピュータ操作エージェントが計画や振り返りに過剰なモデル呼び出しを要することで、許容しがたい遅延と非効率に悩まされ、その結果、タスク完了に人間よりも2.7〜4.3倍のステップ数を要することを明らかにする、人手で注釈付けされたベンチマーク「OSWorld-Human」を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に頭は良いが、信じられないほど遅い個人秘書を雇い、ドキュメントのフォントサイズを変更するといった、コンピューター上の単純なタスクを任せていると想像してください。30 秒で終わるはずの作業が、秘書は 12 分もかかってしまいます。なぜでしょうか?
この論文「OSWorld-Human」は、まさにその問題を調査しています。これは「コンピューター操作エージェント」(マウスとキーボードを制御する AI プログラム)に焦点を当て、「なぜ彼らはそれほど遅いのか、そしてどのようにすれば速くできるのか?」という問いに答えます。
以下に、彼らの発見を簡単な比喩を用いて解説します。
1. 問題:「考えすぎる」秘書
研究者たちは、これらの AI エージェントが「仕事を完了させること」(精度)については向上している一方で、「どれほど速く行うか」(効率性)については極めて劣っていることを発見しました。
- 人間 vs ロボット: 人間の専門家は、ドキュメントの行間を変更するのに 30 秒未満で済ませます。一方、AI エージェントは 12 分かかります。
- ボトルネック: 遅延の原因は、AI がマウスをゆっくりクリックしているからではありません。AI が絶えず思考を停止しているからです。
- 比喩: あなたが食料品店へ車を運転していると想像してください。人間のドライバーはただ運転します。しかし、この AI ドライバーは、すべての交差点で停止し、超知的なコンサルタントに電話をかけて、「この右折で合っているか?左折すべきか?左折は正しくできたか?次の曲がり角はどうするか?」と尋ねます。
- 現実: AI は次の動きを計画し、その動きが成功したかどうかを判断し、何が起こったかを振り返るために、巨大な「脳」(大規模言語モデル)に電話をかけます。これらの電話が最も時間を取ります。実際、「計画」と「判断」のステップだけで、全体の時間の約**75% から 96%**を占めているのです!
2. 調査:ステップの分解
研究者たちは、2 つの人気の AI エージェント(Agent S2 と GTA1)が 39 の異なるコンピュータータスクを解決しようとする様子を観察しました。そして、プロセスのすべての秒を分解しました。
- 「思考」税: AI が一歩を踏み出すたびに、巨大なメッセージをその「脳」に送信する必要があります。タスクが長くなるにつれて、メッセージは大きくなります。なぜなら、それまでに何をしたかの履歴を含めなければならないからです。
- 比喩: 日記を書くようなものです。1 日目には 1 文を書きます。50 日目には、新しい 1 文を追加するために、1 日目からの本全体を書き直す必要があります。これにより、後半のステップは初期のステップに比べて3 倍の時間がかかるようになります。
- 「間違った方向」のループ: 時々、AI は「何をするか」(例:「開くボタンをクリックする」)は知っているのに、画面の「どこ」をクリックすべきか見つけられません。間違った場所をクリックし、それが間違っていると気づき、再度試みます。
- コスト: この「立ち往生」は頻繁に起こります。あるケースでは、AI がフォルダを開こうとして 27 分間ループに陥り、画面の正しい場所を見つけられなかっただけで、8.47 ドルものコンピューティングコストを浪費しました。
3. 解決策:「人間基準」(OSWorld-Human)
これらのロボットがいかに非効率であるかを証明するために、研究者たちはOSWorld-Humanと呼ばれる新しいベンチマークを作成しました。
- それは何か: 彼らは手動で 369 のすべてのタスクを完了し、人間がそれらを完了させるための最短かつ最も論理的な経路を書き留めました。
- 「グループ化」のトリック: 彼らは、人間がしばしば思考を停止することなく、一度に複数のことを行うことに気づきました。
- 比喩: 人間はテキストボックスを見て、名前を入力し、「Enter」キーを押すまでを、一つの滑らかな動作で行います。しかし、AI はボックスを見てから停止し、入力を計画するために脳に電話をかけ、再び停止して「Enter」キーを押すことを計画し、再度脳に電話をかけます。
- 発見: 研究者たちは、多くの動作を「グループ化」できることを発見しました。AI が 3 回のクリックを 1 つの「思考」で行うことができれば、莫大な時間を節約できるはずです。
4. 結論:ロボットはステップを無駄にしている
研究者たちは、16 の異なる AI エージェントを、彼らの新しい「人間基準」に対してテストしました。
- 結果: 最も優れた AI エージェントでさえ、同じタスクを完了するために必要なステップ数を、人間が要するステップ数の2.7 倍から 4.3 倍もかけてしまいました。
- スコア: 彼らは**重み付け効率スコア(WES)**と呼ばれる新しいスコアを作成しました。
- AI が仕事を完了しても、必要な時間の 4 倍の時間がかかれば、そのスコアは劇的に低下します。
- リーダーボードのトップ AI は、古いテストでは素晴らしい成績を収めていましたが、この新しい効率テストではわずか**15.6%**しかスコアを獲得できませんでした。これは、多くの不要な作業を行っていることを意味します。
まとめ
この論文は、現在の AI コンピューターエージェントは頭は良いが不器用な学生のようであると結論付けています。彼らは答えを知っていますが、手を挙げ、先生を待ち、ノートを読み返すのに時間を費やしすぎるため、テストを時間内に終わらせることができません。
これを修正するために、この論文は主に 3 つのことを提案しています:
- 考えすぎを止める: AI が「脳」に電話をかけて計画し、判断する回数を減らす。
- 動作をグループ化する: AI が入力や Enter キーを押すなど、複数のステップを単一の思考で行えるようにする。
- 場所を見つける能力を向上させる: ループに陥らないよう、どこをクリックすべきかを正確に見つける AI の能力を向上させる。
目標は、AI をより賢くすることだけでなく、実世界での使用においてより速く、より実用的にすることです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。