TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
本論文は、AI エージェントのベンチマークのために 80,870 件の実世界記録から 1,530 件の高忠実度ターミナルタスクを自動的に逆実装するスケーラブルなデータエンジン「TerminalWorld」を導入し、最先端モデルが実在のワークフローに苦戦し、既存の専門家によるキュレーションベンチマークと比較して性能が劣ることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにコンピュータの「コマンドライン」——アイコンをクリックする代わりにテキストコマンドを入力するあの黒い画面——の使い方を教えることを想像してみてください。長らく、こうしたロボットをテストする方法は、厳格な教師が考案したパズルを与えるようなものでした。教師は「これは難しいなぞなぞだ。解け!」と言うのです。ロボットがなぞなぞを解ければ、私たちはそれを賢いと考えました。
しかし、この論文の著者たち、TERMINALWORLDは、ある問題に気づきました。現実はなぞなぞではないのです。 現実はごちゃごちゃしており、予測不能で、人々が実際に毎日使っている特定のツールで満ちています。なぞなぞを解けるロボットでも、実際のオフィスでサーバーを修理したりファイルを整理したりするように頼まれたら、失敗するかもしれません。
彼らがこれをどう解決したか、簡単に説明します。
1. 「壁のハエ」アプローチ
研究者たちは、架空のタスクを考案する代わりに、asciinemaという公開ウェブサイトに出向きました。これはコンピュータ画面用の YouTube チャンネルのようなものです。開発者たちは自発的に、実際の作業セッションの録画をアップロードします。
- 比喩: 学生に料理の仕方を教えたいと想像してください。レシピ本をゼロから書く(それは完璧すぎたり奇妙すぎたりするかもしれません)代わりに、キッチンに行き、本物のシェフが本物の料理を作る様子を 8 万時間録画し、「さて、彼らは今何をした?」と尋ねます。
- 結果: 彼らは開発者が作業している実際の録画を80,870件収集しました。
2. 「ロボットシェフ」エンジン
生の録画はごちゃごちゃしています。タイプミス、失敗した試行、関係のないシステムメッセージの長いリストが含まれています。研究者たちはこれを整理するための特別な「データエンジン」(賢いソフトウェアシステム)を構築しました。
- ステップ 1: 目標の理解。 エンジンはごちゃごちゃした録画を見て、超賢い AI に「この人は実際に何を達成しようとしていたのか?」と尋ねます。それはごちゃごちゃしたログを明確な指示に変換します。「これらの悪い IP アドレスをブロックし、そのリストをこのファイルに保存せよ。」
- ステップ 2: キッチンの構築。 録画にはシェフが持っていたツールが記載されていません。エンジンは何のソフトウェアとファイルが必要かを推測し、そのコンピュータ環境の完璧なデジタルコピー(「Docker コンテナ」と呼ばれるものを使用)を構築し、元のコマンドが実際にそこで機能することを確認する必要があります。
- ステップ 3: セーフティネット。 仕事を評価する教師がいないため、エンジン独自の「テスト」を作成します。解決策を実行し、「ファイルは現れたか?リストは正しいか?」を確認します。テストが失敗すれば、完璧になるまでテストを修正します。
3. 新しい「現実世界」試験
それら 8 万件の録画から、TERMINALWORLDと呼ばれる大規模な新しい問題集が作成されました。
- 検証済みのタスクが1,530件含まれています。
- クラウドサーバーのセットアップからデータベースエラーの修正まで、18 種類の異なる現実の職業を網羅しています。
- 1,280種類の異なるコンピュータコマンドを使用しており、その 91% は以前の試験では見たことがありません。
また、人間が二重チェックを行い 100% 正確であることを保証した、より小さく超難易度の高いバージョンTERMINALWORLD-VERIFIED(200 タスク)も作成されました。
4. 衝撃的な結果
彼らは、世界で最も賢い AI モデル(Claude、GPT、Gemini の最新バージョンなど)と、それらがコンピュータを使用するのを助ける「エージェント」フレームワークを、この新しい試験にかけました。
彼らが発見したのは以下の通りです。
- 「効率のパラドックス」: AI が賢いほど、時として苦労する傾向があります。最高の AI でもタスクの**62.5%**しか合格しませんでした。失敗した際、彼らは単に諦めたわけではなく、間違った経路を探求し続け、膨大な時間と費用を浪費しました。まるで、助けを求めずに同じ混乱した段落を何度も読み返す学生のようなものです。
- 「パズル対現実」のギャップ: 古い「なぞなぞ」試験(Terminal-Bench)での AI の成績と、この新しい「現実生活」試験での成績との間には、ほとんど関連性はありませんでした。
- 比喩: AI は数独パズル(古い試験)を解くチャンピオンかもしれないが、実際の交通状況で車を運転すること(新しい試験)では完全に失敗するかもしれません。古い試験は現実の作業とはあまりにも異なっていたのです。
- エージェント対人間: AI がタスクを解決した際、それは録画内の人間がやったのと同じ方法でやることは稀でした。彼らは同じ目的地に到達するために異なる経路を取りました。これは実際には良いことです!それは AI が単にコピーしているのではなく、たとえその方法が人間のものより長くても、自分なりの方法を figuring out していることを意味します。
結論
この論文は、実験室の専門家によって考案された試験をもう信頼できないと主張しています。AI が本当に現実世界で働く準備ができているかどうかを知るには、ごちゃごちゃで複雑かつ絶えず変化する実際の人間のワークフローでテストする必要があります。
TERMINALWORLDは、実際の人間の作業を自動的に試験に変換するツールであり、開発者が働き方を変えるにつれて、AI に対する私たちの試験もそれと並行して進化することを保証します。これは「パズルを解けるか?」という試験から、「仕事をこなせるか?」という試験への転換です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。