← 最新の論文
💬 NLP

APEX-Agents

投資銀行アナリスト、経営コンサルタント、企業法務弁護士によって作成された長期的かつ複合的な業務タスクを実行する AI エージェントの能力を評価する新しいベンチマーク「APEX-Agents」と、その評価基盤となるオープンソースインフラ「Archipelago」を提案し、複数の最新モデルの性能を比較検証した。

原著者: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Rob
公開日 2026-02-24
📖 1 分で読めます☕ さくっと読める

原著者: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Robinson, Calix Huang, Olivia Varones, Daniyal Khan, Michael Haines, Austin Bridges, Jesse Boyle, Koby Twist, Zach Richards, Chirag Mahapatra, Brendan Foody, Osvald Nitski

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🏢 1. 何をしたのか?「AI への実務テスト」

この研究では、AI に「投資銀行家」「経営コンサルタント」「企業弁護士」という、非常に高度な専門職の仕事をさせました。

  • 従来のテスト: 「この文章を要約して」「この画像を説明して」といった、単発で簡単なタスクが多かった。
  • 今回のテスト(APEX-Agents): 「会社の財務データを読み込み、市場動向を調べ、スライド資料を作り、上司にメールで報告する」といった、**複数のアプリをまたいで、長い時間をかけて行う「本物の仕事」**を課しました。

まるで、**「AI にオフィスに配属させ、1 週間かけてプロジェクトを完遂させる」**ようなものです。

🌍 2. テスト会場は「デジタルの架空世界」

AI が実際に仕事をする環境として、研究者は**33 個の「架空の会社(ワールド)」**を作りました。

  • 設定: 各ワールドには、メール、スプレッドシート、チャット、PDF、カレンダーなど、人間が使うのと同じツールやファイルがぎっしり詰まっています。
  • 役割: AI は「新人社員」として、この環境に放り込まれ、与えられた指示(タスク)を、ファイルを探したり、ツールを使ったりしながら実行しなければなりません。
  • 規模: 合計 480 問の課題があり、それぞれが「1〜2 時間」かかる本格的な仕事です。

🏆 3. 結果は?「AI はまだ『見習い』レベル」

8 種類の最新 AI をテストした結果、面白いことが分かりました。

  • 合格ライン(100%)には遠く及ばない:
    一番上手な AI(Gemini 3 Flash)でも、100 問中 24 問しか完璧にこなせませんでした(Pass@1 という指標)。
    • 例え話: 100 問のテストで、トップの AI でも 24 点しか取れなかった、ということです。
  • トップ争い:
    1 位:Gemini 3 Flash(24.0%)
    2 位:GPT-5.2(23.0%)
    3 位:Claude Opus 4.5(18.4%)
    ※トップ 3 はほぼ同率ですが、これでも「プロの仕事を任せられる」には程遠いレベルです。
  • オープンソース AI は苦戦:
    無料で公開されているモデルは、有料の高性能モデルに比べると、5% 未満という惨敗でした。

🔄 4. 「運」に左右される不安定さ

AI は「1 回で成功する」ことよりも、「何回か試せば成功する」ことが多かったです。

  • 8 回挑戦すると:
    1 回目は 24% しか成功しませんでしたが、同じ AI に 8 回挑戦させると、成功する確率は約 40% まで上がりました。
    • 例え話: 「1 回で完璧に料理を作るのは難しいけど、8 回も作れば、そのうち 4 回は美味しいものが作れる」という状態です。
    • これは、AI が**「一貫性(毎回同じようにできる)」**にまだ欠けていることを示しています。

🛠️ 5. 失敗のパターン

AI が失敗する理由は様々でした。

  • ループ地獄: 「ファイルを探して…あ、違うファイルだ…また探して…」と、同じことを繰り返して時間切れになる(「ドゥームループ」と呼ばれます)。
  • 不要な削除: 指示されていないのに、大切なファイルを消してしまう「暴走」が起きることもありました。
  • リソースの無駄遣い: 正解した AI でも、失敗した AI でも、トークン(計算リソース)を大量に消費していました。特に「Gemini 3 Flash」は、他の AI の 5 倍ものリソースを使っていましたが、結果はそれほど変わらないという「非効率さ」も浮き彫りになりました。

💡 6. この研究の意義と未来

この研究の最大の特徴は、**「すべてをオープンソース(公開)した」**ことです。

  • 480 問の課題、評価基準、AI の回答データ、そして AI を動かすためのインフラ(Archipelago)まで、誰でも見られるようにしました。
  • これにより、世界中の研究者が「なぜ AI は失敗するのか」「どうすればもっと賢くなるのか」を一緒に研究できるようになります。

🎯 まとめ

この論文は、**「AI はすごい技術だが、まだ『プロの仕事を任せる』には、人間が手を貸す必要がある」**と伝えています。

今の AI は、**「優秀な見習い」**です。

  • 指示されれば一生懸命動きます。
  • 時には素晴らしい成果を出します。
  • でも、失敗したり、迷ったり、リソースを無駄にしたりすることもあります。

しかし、この「APEX-Agents」というテストを通じて、AI がどこでつまずいているかが明確になり、**「次はもっと賢く、安定して働ける AI」**を作るための道筋が見えてきました。


一言で言うと:
「AI に本物のプロの仕事をさせてみたけど、まだ 2 割〜3 割しか完璧にできず、失敗も多かった。でも、その失敗を分析して公開したから、今後はもっと良くなるはず!」という、AI 業界の「成長記録」です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →