ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents
本論文は、永続的な状態競合を伴う実行可能なワークフロー上でコマンドラインエージェントを評価する生成器支援型のベンチマークフレームワーク ClawForge を導入し、最先端のモデルが既存状態の検査と既存アーティファクトの処理において著しく困難を抱えており、厳密な精度が最大でも 45.3% にとどまることを明らかにする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、ClawForge論文の解説を、日常的な言葉と創造的な比喩を用いて翻訳したものです。
全体像:「散らかった机」の問題
非常に賢いロボットアシスタントを雇って、あなたの生活を整理させると想像してください。これらのロボットに与えるテストのほとんどは、新品で何もない机を与えて、「タスクリストを作成してください」と言うようなものです。ロボットはリストを書き、私たちはその言葉が正しいかを確認します。
しかし、現実の世界では、あなたの机が空っぽであることは決してありません。そこには、未完成のプロジェクト、古い付箋、矛盾する指示、そして時代遅れになったファイルが散らばっています。ロボットの知能を真に試すのは、「リストが書けるか?」ではなく、「この散らかった机を見て、何が壊れているかを見極め、良いものを消さずに古いものを修正し、仕事を完了させることができるか?」という点です。
この論文は、AI エージェント(ロボット)をテストする新しい方法であるClawForgeを紹介しており、これは完全にこの「散らかった机」のシナリオに焦点を当てています。
ClawForge とは何か?(「シナリオ工場」)
著者らは、これらの「散らかった机」のテストを手作業で作成するのは難しすぎ、遅すぎると気づきました。100 種類の異なる散らかったシナリオをテストしたい場合、手動で 100 種類の異なる散らかり状態を構築しなければならないからです。
ClawForge は自動化された工場です。
人間がすべてのテストを書く代わりに、研究者たちはテストを生成するシステムを構築しました。これは「リリーススケジュールの修正」のようなテンプレートを受け取り、異なる都市、異なる日付、異なるエラーなどの詳細を自動的に埋め込みます。
- 出力: 完全な「実行可能なタスク」を作成します。これは単なる質問ではなく、初期状態(散らかった机)、一連のルール、そして結果を評価する方法を備えたミニシミュレーションです。
- 目的: AI が状態の競合に対処できるかどうかを確認することです。これは、すでに存在するもののうち、一部が間違っていたり、時代遅れであったり、重複していたりするものを扱うことを意味します。
テストの仕組み(「ゲームループ」)
このテストを、AI がプレイヤーとなるビデオゲームのレベルだと考えてください。
- セットアップ: ゲームは、すでにボード上にいくつかのアイテムがある「セーブファイル」をロードします。例えば、「サーバーの修正」というタスクがすでにあるが、「優先度:低」と誤ってマークされている場合などです。
- 指示: AI は命令を受けます。「サーバー修正は誤っています。修正してください。ただし、他の有効なタスクは削除しないでください。」
- 行動: AI は人間がコマンドラインを使用するように、コマンドを一つずつ入力します。
- 評価: ここが最も重要な部分です。システムは、AI が人間と同じ言葉を正確に入力したかどうかをチェックするのではありません。代わりに、机の最終状態をチェックします。
- 古い誤ったタスクは削除されましたか?
- 新しい正しいタスクは存在しますか?
- AI は誤ってタスクの重複を作成しましたか?
- 有効なものはそのまま残されましたか?
最終的な机が完璧であれば、AI は合格します。散らかっていれば不合格です。
結果:ロボットはまだ学習中
著者らは、この新しいベンチマークで、OpenAI、Anthropic、Kimi などの企業から提供されている 7 つの最も賢い AI モデルをテストしました。結果は驚きと謙虚さをもたらすものでした。
- 「満点」は稀: 最高の AI モデルでも、タスクの約**45%**しか完璧に正解できませんでした。これは、このベンチマークが難しく、まだ「解決」されていないことを意味します。
- 「間違った修正」の問題: 特定の種類の失敗が非常に一般的でした。誤ったアイテムの入れ替えを求められたとき、モデルはしばしば立ち往生しました。誤ったアイテムを削除するのを忘れるか、新しいアイテムを追加するのを忘れるか、あるいは新しいアイテムを追加しても古い壊れたものをそのまま残してしまうのです。
- 比喩: 空になったタイヤを交換するよう指示された状況を想像してください。AI は空のタイヤを外しますが、スペアを取り付けるのを忘れます。あるいは、スペアを取り付けますが、空のタイヤを地面に転がしたままにします。
- 「触らないで」の問題: もう一つの一般的な失敗は、机がすでにほぼ完了している場合でした。AI はすでに正しいタスクを見て、それをそのままにしておく代わりに、再度「修正」しようと試み、重複を作成しました。
- 比喩: あなたはロボットに「コーヒーはもう淹れられています」と伝えます。ロボットは「わかりました」と答え、すぐに 2 杯目を淹れてしまい、散らかりを生み出します。
- 効率性が重要: 一部のモデルは単純な問題を解決するために必要以上に多くのステップを踏む一方、他のモデルは速かったものの間違いを犯しました。最も優秀なパフォーマンスを示したのは、行動する前に既存の状態を確認したモデルたちでした。
2 つの最も困難な課題
この論文は、ほぼすべてのモデルを困惑させた「散らかった机」のシナリオの 2 つの特定のタイプを強調しています。
- 誤った状態の置換: AI は、間違ったものを特定し、正しいもので置き換え、他のすべてを安全に保たなければなりません。これが最も難しいタスクでした。最高のモデルでも、17% しか正解できませんでした。
- 中断されたワークフローの再開: AI は、誰かがプロジェクトを開始した部屋に入り、不足している部分を完成させ、すでに完了した部分をやり直さないようにしなければなりません。ここでの最高と最低のモデルの差は大きく(17% から 90%)、一部のモデルが飛び込む前に「その場の空気を読む」ことに非常に優れていることを示しています。
なぜこれが重要なのか
著者らは、もはや AI を「清潔な」タスクだけでテストすることはできないと主張しています。現実の仕事には、歴史、間違い、そして部分的な進捗との対処が含まれます。ClawForgeは、AI が本当に現実のオフィスで働く準備ができているかどうかを測定するためのツールです。現実のオフィスでは、物事が完璧であることは稀であり、ゼロから始めることはめったにありません。
要約: ClawForge は、すでに機能している家具を壊すことなく、散らかった部屋を片付ける方法を学ぶための AI エージェントのためのジムです。現在、最も強力な AI エージェントでさえ、このジムで自分の足に躓いています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。