← 最新の論文
🤖 machine learning

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

本論文は、現実的なファイル依存関係と多様なタスクを備えた大規模ベンチマーク「Workspace-Bench」を導入し、AI エージェントのワークスペース学習能力を評価するものであり、現在のモデルは複雑なファイル間推論と意思決定の処理において人間の性能に大幅に遅れをとっていることを明らかにする。

原著者: Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Weizheng Wang, Hongzhang Huang, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen
公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Weizheng Wang, Hongzhang Huang, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが仕事を手伝ってくれる超賢いロボットアシスタントを雇ったと想像してください。あなたはスプレッドシート、メール、PDF、コード、古いドラフトなど、ファイルでいっぱいのフォルダを渡します。あなたの目標は、ロボットが適切な情報を見つけ、それらがどのように関連しているかを理解し、レポートを作成することです。

Workspace-Bench は、今日の AI ロボットが迷ったり混乱したり、事実を捏造したりすることなく、実際にこの仕事をこなせるかどうかを調べるために設計された、巨大で現実的なテストです。

以下に、論文の発見を簡単な比喩を用いて解説します。

1. 問題点:「クリーンルーム」対「散らかった机」

これまでの AI のテストのほとんどは、学生に完璧な教科書を一冊渡し、質問に答えさせるようなものでした。AI は単にページを読んで答えるだけでよかったです。

  • 現実: 実際の仕事は散らかった机のようなものです。20,000 個のファイルが Excel、コード、PDF、メールなど 74 種類の異なる形式に散らばっています。ファイルには古いドラフトもあれば、最終版もあり、単なるメモもあります。
  • テスト: 研究者たちは(物流マネージャー、研究者、開発者などのための)5 つの異なる「デジタルオフィス」を構築しました。各オフィスは数千のファイルが入った巨大で散らかったデジタル空間です。そして、AI に「昨年の売上データと今週のメールに基づいて戦略レポートを作成する」といった 388 種類の異なるタスクを与えました。

2. 大きな発見:AI はまだ迷っている

研究者たちは、28 種類の異なる AI の「脳」(モデル)と AI の「体」(AI がツールを使用できるようにするソフトウェアフレームワーク)の組み合わせをテストしました。

  • スコア: 最も優れた AI の組み合わせでも、詳細の約**69%しか正しくできませんでした。平均的な AI は50%**未満でした。
  • 人間との比較: 実際の人間が同じテストを行った場合(ツールの助けを借りて)、スコアは**81%**でした。
  • 比喩: 人間ランナーが 10 分でゴールするレースで、最も速いロボットは 20 分かかり、それでも自分の足でつまずいているようなものです。この論文は、現在の AI は実際のオフィスワークにおいて「信頼性にほど遠い」と述べています。

3. なぜ失敗するのか?(3 つの主要なボトルネック)

この論文は、AI が苦労する 3 つの具体的な理由を特定しました。

  • 「タイムトラベル」問題(系譜追跡):
    実際のワークスペースには、report_v1report_reviewedreport_final という名前のファイルがあります。AI はしばしば間違ったバージョン(最終版の代わりに古いドラフトなど)を取得してしまいます。ファイルの「家系図」を理解できていないのです。
  • 「翻訳」問題(異種理解):
    AI はテキストを読むのは得意ですが、PowerPoint のチャートと Excel シートの生データを結びつけたり、会議の文字起こしとコードファイルを同時に理解したりすることに苦労します。AI は異なるファイルタイプを、相互に翻訳できない別々の言語として扱っています。
  • 「干し草の山の中の針」問題:
    タスクが難しくなると(6 つ以上の異なるファイル間の関連性を見つける必要がある場合)、AI のパフォーマンスは急激に低下します。膨大なデータ量に圧倒され、重要なリンクを見逃してしまいます。

4. 試行の「コスト」

この論文は、AI が問題を解決しようとする様子について、興味深い点に気づきました。

  • 「空回り」効果: 一部の AI 設定は非常に必死に努力し、60 以上のステップで自分自身と対話し、莫大なコンピューターパワー(トークン)を使用しました。しかし、そのすべての努力にもかかわらず、答えは間違っていました。
  • 「賢く速い」効果: 最もパフォーマンスが高かった AI(OpenClaw + Opus-4.7)は、ステップ数が少なく、コンピューターパワーも少なく、素早く問題を解決し、正しい答えを出しました。これは、単に努力するよりも、推論の質の方が重要であることを示唆しています。

5. 未来:成長の 5 つの段階

著者たちは、AI がオフィスで働くことを学ぶ過程を、はしごを登るように 5 つの段階で想像しています。

  1. L0(受動的助言者): AI は単に助言を与えるだけで、人間が作業を行います。
  2. L1(受動的実行者): 人間が「ファイル A を開いてファイル B にコピーして」と言うと、AI はそれを実行しますが、なぜそれをするのかは理解していません。
  3. L2(依存関係推論者): AI はファイル A がファイル B に依存していることを理解し始めます。(現在の AI はここを乗り越えるのに苦労しています)。
  4. L3(能動的探索者): AI はオフィス全体を見回し、必要なファイルを自分で見つけ、問題を解決できます。(これは、この論文がまだ到達していないと述べる「能力の単一性」です)。
  5. L4(自己進化パートナー): AI はすべてのタスクから学び、あなたの習慣を記憶し、時間の経過とともにあなたの特定の仕事をより上手にこなせるようになります。

まとめ

Workspace-Bench は現実的なチェックです。それは、AI が会話や執筆において向上している一方で、実際の人間のオフィスのような散らかり、相互接続され、バージョン管理された世界をナビゲートする能力においては、依然として非常に拙劣であることを示しています。AI がファイルの履歴を確実に追跡し、異なる種類のドキュメントを結びつけることができるようになるまで、軌道修正のために人間の「パイロット」が必要となるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →