← 最新の論文
🤖 AI

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

本論文は、GUIエージェントが相互作用の信頼性の高さから現在CLIエージェントを上回っている一方で、CLIの性能差はモデル固有の限界ではなく、主にスキルの網羅性の不完全さに起因しており、検証器によるガイド付きのスキル拡張がCLIの成功率を大幅に向上させることを示す、制御されたベンチマークを導入するものである。

原著者: Xiao Zhou, Siyue Zhang, Yilun Zhao, Jinbiao Wei, Tingyu Song, Arman Cohan, Chen Zhao

公開日 2026-06-24
📖 1 分で読めます☕ さくっと読める

原著者: Xiao Zhou, Siyue Zhang, Yilun Zhao, Jinbiao Wei, Tingyu Song, Arman Cohan, Chen Zhao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたのコンピュータ上で家事を行う、非常に賢いロボットアシスタントがいるとします。あなたは、このロボットに2通りの異なる方法で仕事を与えることができます。

  1. 「人間」流(GUI): ロボットは、人間と同じようにコンピュータの画面を見ます。アイコン、ボタン、メニューを目にします。そして、あなたと同じようにマウスを使ってクリックしたり、ドラッグしたり、タイピングしたりします。
  2. 「コード」流(CLI): ロボットは画面を見ません。その代わりに、あらかじめプログラムされた命令(スキル)の特別なリストを通じてコンピュータと対話します。ロボットは「トラックを追加」と言い、コンピュータは「トラック追加」ボタンを一度も見ることなく、即座にそれを実行します。

この論文は、どちらの方法がより優れているかを判断するための大きな実験です。しかし、ここには落とし穴があります。過去に人々がこれら2つの方法を比較した際、不公平な比較を行っていたのです。彼らは「コード」ロボットに対して、より簡単なタスクを与えたり、異なる目標を設定したりしていました。それはまるで、レースカーと自転車を比較しているのに、自転車には下り坂のコースを与え、レースカーには山道を走らせるようなものでした。

大きな実験:公平なレース

研究者たちは公平な競技場を作り上げました。彼らは440種類の異なるコンピュータタスク(ビデオ編集、音楽の整理、スプレッドシートの作成など)を作成しました。

  • 同じゴール: 両方のロボットに全く同じ指示(例:「これら3つの曲の名前を変更して」)が与えられました。
  • 同じスタート地点: 両方のロボットは、コンピュータが全く同じ状態からスタートしました。
  • 同じゴールライン: コンピュータプログラムが結果をチェックし、仕事が正しく完了したかどうかを確認しました。
  • 異なるツール: 唯一の違いは、作業を行うことが「どのように」許可されているかでした。一方はボタンをクリックしなければならず、もう一方はコマンドリストを使用しなければなりませんでした。

結果:勝者は誰か?

ラウンド1:オリジナルのレース

  • 「人間」ロボット(GUI): 勝率は**59.1%**で勝利しました。画面上の視覚的な手がかりに従うのが非常に得意でした。
  • 「コード」ロボット(CLI): 勝率は**48.2%**で敗北しました。より苦戦しました。

なぜコード・ロボットは負けたのか?
研究者たちは失敗の原因を掘り下げ、驚くべき理由を見つけました。コード・ロボットは必ずしも「頭が悪かった」わけではありません。単に**「取扱説明書」が壊れていた**のです。

  • 例えば、コード・ロボットには100個のスキルリストがありますが、タスクが「スキル#42」を必要としていたものの、そのスキルがリストに存在しなかったと想像してください。ロボットは混乱したのではなく、ツールが存在しなかったために仕事を完遂できなかったのです。
  • 元々のスキルのリストで実行できたタスクは、わずか**37%**でした。

ラウンド2:「修正されたマニュアル」によるレース
研究者たちは、コード・ロボットのマニュアルを修正しました。ロボットがテストに合格するために必要な、足りなかったスキルを追加したのです。

  • 新しいスコア: コード・ロボットの成功率は**69.3%**へと跳ね上がりました。
  • 教訓: コード・ロボットに適切なツールを与えると、実際には人間(GUI)のロボットよりも優れた性能を発揮しました!これは、コード・ロボットの最初の失敗が、思考能力の問題ではなく、押すべきボタンが適切に用意されていなかったことが原因であることを証明しています。

各ロボットが得意なこと(とつまずくところ)

この論文は、それぞれのロボットに異なる「スーパーパワー」と「弱点」があることを明らかにしました。

  • 人間ロボット(GUI):

    • スーパーパワー: ウェブサイトのナビゲーションやビデオタイムラインの整理など、手順が画面上に明白なタスクに長けています。
    • 弱点: 迷子になりやすいです。メニューが隠れていたり、連続して20回クリックする必要があったりすると、何をしていたか忘れたり、間違ったものをクリックしたりすることがよくあります。それは、目隠しをして迷路を進むようなものです。壁は見えていますが、何度もつまずいてしまうのです。
  • コード・ロボット(CLI):

    • スーパーパワー: ファイルの整理や3Dモデリングのように、構造が明確な「レゴブロックを組み立てる」ようなタスクに長けています。正しいコマンドさえあれば、高速かつ正確です。
    • 弱点: 推測するのが苦手です。もしコンピュータに、人間なら何も考えずにクリックするような「デフォルト」の設定がある場合、コード・ロボットにはそのデフォルトが何であるかを正確に伝えなければなりません。もしマニュアルに「デフォルトの名前は『トラック1』である」と書かれていなければ、ロボットは名前を「トラック2」にしてしまい、失敗します。それは、完璧なステーキを焼けるけれど、書かれていない限り「通常は焼く前に塩を振る」ということを知らないシェフのようなものです。

結論

この論文の結論は、これら2つの方法を比較することは、どちらが「優れている」かを決めることではなく、**「どこにロジックが存在するか」**についての問題であるということです。

  • 人間(GUI)の手法では、ロジックは目に見えるインターフェースの中に組み込まれています。コンピュータは手順を示してくれますが、あなたはそれを見つけ出し、物理的にクリックしなければなりません。
  • コード(CLI)の手法では、ロジックは隠れたスキルの層の中に組み込まれています。コンピュータが重労働を引き受けますが、それは誰かがマニュアルにすべてのステップを書き記している場合に限られます。

教訓: ロボットにコンピュータ作業をさせたい場合、どちらにするかを決めなければなりません。「見て、クリックさせる」のか(これは長いタスクを行う際に難易度が高くなります)、それとも「コマンドを出す」のか(これは高速ですが、完璧で完全なコマンドライブラリを構築している場合にのみ機能します)。最善のシステムは、おそらく両方の要素を組み合わせたものになるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →