EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions
本論文は、プロプライエタリな実世界のエンタープライズ・エージェント・セッションから派生したベンチマークであるEnterpriseClawBenchを紹介し、852の再現可能なタスクを用いて、現在のモデルが限定的な成功(0.663)しか達成できていないことを示し、将来の評価においては、単一のスコアに依存するのではなく、ハーネスとモデルの組み合わせ、アーティファクトのデリバリー、視覚的品質、コスト、実行時間、およびスキル転移行動を報告する多次元的なフレームワークを採用しなければならないことを提示する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常にスマートで、新しいファイルを読むことができ、ツールを使いこなし、レポートを作成できる「新人従業員」がいると想像してください。あなたは、その従業員が本当に仕事ができるかどうかを知りたいと考えています。
これまでのAI「従業員」に対するテストの多くは、静かな教室で抜き打ちテストを行うようなものでした。それらは、隔離された環境で質問に答えたり、コードを書いたりすることを求めていました。しかし、実際のオフィスワークは静かなクイズではありません。それは、乱雑なメールを読み、特定の添付ファイルを開き、壊れたリンクを修正し、一日の終わりにまでに完成した成果物(スプレッドシートやプレゼンテーションなど)を届ける必要がある、混沌とした騒がしい環境なのです。
この論文は、作り物の練習テストではなく、ある企業における**「実際の業務セッション」に基づいた、新しいAIエージェントのテスト手法であるEnterpriseClawBench**を紹介しています。
以下に、彼らが何を行い、何を見出したのかを、簡単な比喩を用いて解説します。
1. 実業務のための「リサイクル工場」
研究者たちは、自社における数千件の実際の業務セッションからなる膨大なアーカイブからスタートしました。これらのセッションは、プライベートなチャットや壊れたファイルパス、曖昧な指示が含まれるなど、非常に乱雑なものでした。
このアーカイブを、未精製の「生の鉱石」の山だと考えてください。論文では、この鉱石を洗浄するための**「建設パイプライン(リサイクル工場)」**について説明しています。
- フィルター: タスクが短すぎるもの、ファイルが不足しているもの、またはリンクが切れているものを取り除きました。
- 翻訳機: 複数回のやり取りを含む乱雑な会話を、明確なシングルショットの指示へと書き換えました(例:とりとめもないメールの連鎖を、明確な「ToDoリスト」に変えるような作業)。
- 安全チェック: すべてのタスクが、会社の秘密のパスワードを必要とせずに、何度でも繰り返し実行できるようにしました。
5,291件の生の試行から、最終的に852件の高品質で再現可能なタスクを抽出しました。また、品質を完璧に保証するために人間が手動でチェックした、120件のより小規模な「Lite」バージョンも作成しました。
2. 「ドライバーと車」のテスト
この論文の主要な発見は、AIモデル(「エンジン」)だけを真空状態でテストしてはいけないということです。AIと**ソフトウェアフレームワーク(「車」)**をセットでテストしなければなりません。
- 比喩: フェラーリのエンジンをテストすることを想像してください。もしそのエンジンを、錆びついた壊れたトラックに載せたら、うまく性能を発揮できないでしょう。しかし、洗練されたスポーツカーに載せれば、猛烈に走ります。
- 結果: 彼らは、「エンジン」(GPT-5.5、Sonnet 4.6など)と「車」(Claude Code、OpenClaw、Hermesなどのソフトウェアフレームワーク)の32通りの組み合わせをテストしました。
- 驚きの事実: 強力なエンジンであっても、不適切なフレームワークと組み合わせると、パフォーマンスが著しく低下することが分かりました。例えば、トップクラスのモデルであっても、「Hermes」フレームワークを使用すると、スコアが大幅に低下しました。これは、フレームワークがモデルによる特定の必要なアクションをブロックしてしまうためです。このことは、AIの「脳」と同じくらい、ソフトウェアの「外装(ラッパー)」も重要であることを証明しています 있습니다。
3. 「通知表」は一つの成績だけではない
学校では、一つの最終成績をもらいます。しかし、このベンチマークにおいて、研究者たちはそれでは不十分だと言います。彼らは、多角的な通知表でエージェントを採点します。
- 仕事を完了できたか?(成果物の納品)
- 迅速にこなせたか?(実行時間)
- コストがかかりすぎていないか?(コスト)
- ファイルは実際に使えるものか?(視覚的品質)
- 文脈を理解しているか?(意味的品質)
現実的な検証: 最良の組み合わせ(CodexとGPT-5.5)であっても、スコアはわずか**66.3%**でした。これは、私たちの最もスマートなAIエージェントであっても、現実世界のオフィス業務を完璧にこなすには、まだ苦戦していることを意味します。彼らは細部を見落としたり、正しいファイルを見つけられなかったり、あるいは見た目は良くても数字が間違っているレポートを作成したりすることがよくあります。
4. 「スキル転移」の実験
研究者たちは、AIがあるタスクから学んだスキルを、別の類似したタスクに適用できるかどうかを調べたいと考えました。
- 実験: 「フロントエンドWebページ」の作成を練習させたAIに対し、一度も見せたことのない新しいWebページのタスクを与えました。
- 「教師」対「生徒」: スキルの質は、完全に「誰が教えたか」に依存することが分かりました。
- 強力なAI(GPT-5.5など)がスキルを蒸留(ディスティル)した場合、生徒となるAIは向上しました。
- 弱いAIがスキルを教えようとした場合、生徒となるAIの成績はむしろ悪化しました。
- 教訓: AIがスキルを「学習した」と単純に仮定してはいけません。教え方の質が重要であり、時には悪い教師が優れた生徒を台無しにしてしまうこともあるのです。
5. 「人間 vs ロボット」の判定問題
これらのタスクを採点するために、彼らはAI判定器(ロボットを採点するロボット)を使用しました。
- テキストタスク: AI判定器はテキストレポートの採点において非常に優秀であり、人間の判定者ともよく一致しました。
- 視覚的タスク: スプレッドシート、スライド、または画像を採点する場合、AI判定器は非常に信頼性が低いことが分かりました。人間なら拒絶するような、乱雑なアウトプットに対しても高いスコアを与えてしまうことが多々ありました。
- 教訓: 私たちは、AIが文章を書けるかどうかをテストすることには長けていますが、AIがプロフェッショナルなビジネス文書を作成できるかどうかをテストすることについては、まだ未熟です。
まとめ
EnterpriseClawBenchは、AI業界に対する現実的な警告です。それは以下の通りです。
- クリーンで偽りの環境でAIをテストするのはやめ、乱雑で現実的なアーカイブでテストすべきである。
- 使用するソフトウェアフレームワークは、AIモデルそのものと同じくらい重要である。
- 現在のAIエージェントは、複雑なオフィス業務において人間を完全に代替できるほどにはまだ到達していない。彼らは、最終製品を信頼して任せるには、まだあまりにも多くのミスを犯している。
- テキストだけでなく、視覚的なアウトプットを評価するためのより良い方法が必要である。
論文は、AIは進化しているものの、「AIとチャットすること」と「信頼できるビジネス部門を運営すること」の間には、依然として大きな隔たりがあるという結論で締めくくられています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。