RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions
RealClawBenchは、実際のOpenClawデベロッパー・エージェント・セッションに由来する再構成された実行環境と決定論的なスコアラーを活用し、281件の困難な実世界のタスクを再現可能な評価へと変換することで、現在のモデルにおける顕著な性能差を明らかにするライブ・ベンチマーク・フレームワークを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
新しいロボットシェフがどれほど優秀かをテストしようとしている場面を想像してみてください。
従来の方法(従来のベンチマーク):
伝統的に、研究者は「グリルドチーズサンドイッチを作る」や「チョコレートケーキを焼く」といった、完璧で教科書通りのレシピのリストを作成してきました。そして、そのレシピをロボットに与え、手順通りに従えるかどうかを確認してきました。しかし、問題があります。現実の世界は教科書通りではないのです。現実には、顧客から「パンが少し硬くなっているし、チーズは冷蔵庫の奥にあるんだ。それに、グリルじゃなくてトースターオーブンしかないんだけど。何か食べられるものを作ってくれる?」と言われるかもしれません。従来のテストでは、こうした現実世界の泥臭いディテールに対処できるかどうかまではチェックしていませんでした。
新しい方法 (REALCLAWBENCH):
この論文の著者たちは、「デベロッパー・エージェント」(プログラマーを支援するロボット)を真にテストするためには、偽のテストを作成することをやめ、実際の開発者が現場でどのようにロボットを使用しているかを観察する必要があることに気づきました。
彼らは REALCLの一つであるREALCLAWBENCH というシステムを構築しました。これは、簡単な比喩を用いて以下のように説明できます。
1. 真実の瞬間を捉える(ソース)
タスクを捏造する代わりに、チームは実際の開発者が「OpenClaw」というツールを使ってコードの助けを求めている 76,155件の実際のセッション を観察しました。彼らは、人々が複雑で、時に曖昧で、混沌としたリクエストを行っている様子を目の当たりにしました。
- 比喩: 静かなキッチンでシェフがメニューを書くのではなく、忙しいレストランで実際に多くの顧客が料理を注文している様子を、防犯カメラで録画している様子を想像してください。
2. 「魔法のクリーニング」(パイプライン)
実際の顧客の生の記録を、そのままテストに変換することはできません。その記録には、プライベートなパスワードや企業の機密ファイル、あるいは現在は存在しないコンピュータへの参照が含まれている可能性があるからです。
論文では、これらの現実の瞬間を洗浄するための パイプライン(ステップ・バイ・ステップの工場ライン)について説明しています。
- プライバシー・スクリーン: ビデオの顔をぼかすように、秘密情報やプライベートな情報を除去します。
- 環境の再構築: もし開発者が自分の特定のコンピュータ上のファイルを修正するようロボットに頼んでいた場合、チームはそのテストを後で何度でも実行できるように、偽の安全なコンピュータ環境を構築します。
- リクエストの書き換え: 曖昧で会話的なリクエスト(「ねえ、さっき言ったあの件を見てくれる?」)を、明確で独立した指示(「ログインファイルのバグを修正してください」)に変換します。
- 自動判定機: 人間が採点する代わりに、コンピュータプログラムを書いて結果をチェックします。ファイルは修正されたか? はい/いいえ。推測の余地は許されません。
3. 結果: 「ライブ」テスト
最終的な成果物は、281個の実世界のタスク を含むベンチマークです。
- なぜ特別なのか: これは「ライブ」であり、「アンカー(固定)」されています。これは、テストが古くなる静的な質問リストではないことを意味します。継続的な実際のユーザーデータから構築されているため、後で新しい実世界の例を追加して、テストを常に新鮮に保つことができます。
- 「リアリズムのギャップ」: 論文は、従来のテストには、テスト内容と実際に起きていることの間に「ギャップ」があったと主張しています。REALCLAWBENCHはそのギャップを埋めるものです。それは、ドライバーを完璧で空っぽのサーキットトラックでテストするのではなく、渋滞や穴、混乱した歩行者がいる実際のラッシュアワーの交通の中でテストするようなものです。
何が見つかったのか?
彼らは、現在利用可能な最もスマートな 14のAIモデル を、この新しい、泥臭い実世界のテストで検証しました。
- スコア: 最も優れたAIモデル(Claude Opus 4.7)でさえ、タスクの約 66% しか解決できませんでした。
- 教訓: これは、まだ改善の余地が多分にあることを意味します。現在の「超知能」を持つロボットたちは、実際の日々の開発者が直面するような、泥臭い現実世界の課題に対しては、まだ苦戦しているのです。
要約
要するに、この論文はこう言っています。「ロボットを偽の完璧なシナリオでテストするのはやめましょう。彼らが実際に直面している、泥臭い実世界の課題でテストしましょう。ただし、公平に採点できるよう、適切にクリーンアップした上で。」
彼らはまさにそれを実行するシステムを構築し、現在最高のロボットたちでさえ、現実世界で真に信頼されるようになるには、まだ3分の2程度までしか到達していないということを明らかにしました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。