← 最新の論文
🤖 AI

WorkBench Revisited: Workplace Agents Two Years On

本論文は、WorkBenchベンチマークの初期評価から2年後にそれを再検証するものであり、Claude Opus 4.8のような最先端のエージェントが、タスク完了率を大幅に向上させ(43%から89%へ)、有害なエラーを劇的に減少させた(26%から2.5%へ)一方で、能力と安全性が共に向上していること、オープンウェイトモデルが高性能なアクセスを民主化したこと、そして不可逆的な危害につながる特定の基本的なエラータイプが依然として存在することを示している。

原著者: Olly Styles

公開日 2026-06-15
📖 1 分で読めます☕ さくっと読める

原著者: Olly Styles

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

WorkBenchを、巨大なシミュレーション上のオフィス・プレイグラウンド(遊び場)として想像してみてください。このプレイグラウンドの中には、カレンダー、メールの受信トレイ、顧客リスト、そしてプロジェクトボードのデジタル版が存在します。この論文の目的は、AI「エージェント」(賢いコンピュータプログラム)が、メールを読み、会議をスケジューリングし、顧客の記録を修正する際に、混乱を招くことなく、いかに人間の従業員のように振る舞えるかをテストすることです。

著者たちは、このプレイグラウンドを最初にオープンしてから2年後に、状況を確認することにしました。彼らが発見した内容は、以下の通り分かりやすく説明されています。

1. 「ビフォー・アフター」の写真

2024年(過去):
当時、最高のAIであったGPT-4は、非常に意欲的だが不器用なインターンのようなものでした。690のタスクのうち、完了できたのはわずか**43%でした。さらに悪いことに、助けようとして(間違った人にメールを送るなど)誤ってトラブルを引き起こした割合が26%**に達していました。一生懸命ではありましたが、しばしば混乱したり、危険な挙動を見せたりしていました。

2026年(現在):
著者たちは、最新のAIモデルを用いてテストを再実施しました。勝者となったClaude Opus 4.8は、長年現場で働いてきたシニア・エグゼクティブのようです。このモデルはタスクの**89%を完了しました。さらに素晴らしいことに、偶発的な実害を与えたケースはわずか2.5%**でした。単に速くなっただけでなく、より安全になっているのです。

2. 大きな驚き:安全性とスキルは両立する

通常、ロボットをより速く、より賢くすれば、より無謀になるのではないかと私たちは考えがちです。しかし、この論文は、これらのAIエージェントについてはそれが当てはまらないと述べています。

  • 例え話: レースカーを想像してみてください。かつて、最も速い車は最も衝突しやすい車でもありました。しかし今、最も速い車は、最高のブレーキと安全機能を備えた車でもあるのです。最も多くのタスクを完了したモデルは、同時に最もミスが少なかったモデルでもありました。

3. オープンソース・モデルの「魔法」

この論文は、レースの勝者がどのように変化したかを強調しています。

  • 旧来のやり方: 高価な「プロプライエタリ(独占的)」なモデル(大手テック企業によるものなど)だけが、仕事をうまくこなすことができました。
  • 新しいやり方: 「オープンウェイト」モデル(誰でもダウンロードして改良できる、オープンソース・ソフトウェアのようなもの)が、今やわずかなコストで、同等の成果を出しています。
  • メタファー: アメリカ大陸を横断するために高級車が必要だったと想像してください。今では、別のメーカーの、走行コストが100分の1で済む、全く新しい高性能な電気自動車を手に入れることができます。論文によれば、現在、能力を備えた最も安価なAIは中国のオープンソース・ラボから生まれており、絶対的に最も強力なものは依然として西洋のプロプライエタリ・モデルであると記されています。

4. テスト自体に何が変わったのか?

著者たちは、2024年のオリジナルのテストにおいて、自分たちがミスをしたことを認めています。それは、解答集にタイポ(誤植)がある状態で数学のテストを採点しているようなものでした。

  • 修正: 彼らはルールを修正しました。例えば、「直近5日間」を求める指示に対し、解答集が「直近4日間」で計算されていたというバグを修正しました。
  • 結果: 修正されたルールで2024年のチャンピオン(GPT-4)を再テストしたところ、スコアは49%から57%へと上昇しました。これは、AIが突然賢くなったのではなく、テストがより公平になったことを証明しています。

5. いまだに起きている間違いとは?

AIは非常に優秀になりましたが、完璧ではありません。論文は、最高のモデルであっても依然として発生してしまう、いくつかの手強いエラーを指摘しています。

  • 「日付の間違い」問題: もしAIが「今日」のチャートを作成するよう指示された際、システムが「今日」を過去の日付だと認識していると、AIはまだ訪れていない日のためのデータを描こうとしてしまうことがあります。これは、明日の天気を今日レポートしようとするようなものです。
  • 「検索の切り捨て」問題: 一部のツールは上位5件の結果しか表示しません。AIは5件の結果を見ると、それが「すべて」であると仮定して探索を止めてしまい、6番目にあった正しい答えを見逃してしまうことがあります。
  • 「リテラル(文字通り)対 ロジカル(論理的)」問題: 時としてAIは数学で混乱します。例えば、タスクが「成長率が平均より高い場合」と指示しているとき、AIがパーセンテージ(例:5%)と生の数値(例:100時間)を比較して、論理的な判断を誤ることがあります。

まとめ

2年前、AIエージェントは、物を壊してしまうこともある不器用なインターンでした。今日、最高峰のモデルは、仕事を完遂し、めったに害を及ぼさない信頼できるプロフェッショナルです。最も強力なモデルは依然として高価ですが、安価なオープンソースの代替案も、多くのタスクにおいて実用的なレベルまで追いついています。テスト自体もより公平になるよう整理されており、その結果は、AIが職場において真に測定可能な進歩を遂げていることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →