← 最新の論文
🤖 AI

AutomationBench

Zapier の実際のワークフローパターンに基づき、複数のアプリケーションにまたがる API 発見、ポリシー順守、およびデータ連携を評価する新たなベンチマーク「AutomationBench」を導入し、現状の最先端モデルでも 10% 未満のスコアしか達成できていないことを示すことで、ビジネスが求めるエージェント能力とのギャップを浮き彫りにしています。

原著者: Daniel Shepard, Robin Salimans

公開日 2026-04-22
📖 1 分で読めます☕ さくっと読める

原著者: Daniel Shepard, Robin Salimans

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI に本当のビジネス仕事(複数のアプリをまたぐ複雑な作業)を任せるには、まだ遠い道のりがある」**ということを、新しいテスト「AutomationBench(オートメーションベンチ)」を使って明らかにした報告書です。

わかりやすく説明するために、いくつかの比喩を使ってみましょう。

1. 従来のテストは「迷路の迷路」だった?

これまでの AI のテストは、主に「1 つのアプリ(例えばウェブサイト)の中で、ボタンを何回か押してゴールにたどり着く」ようなものでした。

  • 例: 「このウェブサイトで商品を探して、カートに入れてください」といった作業です。
  • 問題点: 実際のビジネス現場では、そんな単純なことはしません。
    • 「営業データ(CRM)を確認して、メールで連絡し、カレンダーに予約を入れ、チャットでチームに報告する」
    • これらはすべて異なるアプリをまたぐ作業です。

これまでのテストは、この「アプリをまたぐ連携」や「会社のルールに従うこと」を測れていませんでした。

2. 新しいテスト「AutomationBench」の正体

この論文で紹介されているのは、**「AI 秘書の最終面接」**のようなものです。

  • シチュエーション:
    会社には、CRM(顧客管理)、メール、カレンダー、チャットツールなど、47 種類の異なるアプリが混在しています。
  • 課題:
    「2 月 20 日の午後 2 時に、Zoom と Google カレンダーの会議が被っているよ。会社のルール(スプレッドシート)を見て、どちらを優先すべきか判断し、優先されない方を日程変更して、Slack に報告して」というような、複雑で現実的な命令が出ます。
  • AI に求められること:
    1. 道具を探す(API 発見): 「会議を調整するには、どのアプリのどの機能を使えばいいか」を自分で見つけなければなりません(マニュアルは渡されません)。
    2. ルールを守る(ポリシー): 「急ぎの顧客は優先する」という会社のルールを、直感ではなく文書から読み取り、守らなければなりません。
    3. ノイズに惑わされない: 大量のデータの中に、間違った情報やダミーのデータが混ざっています。それを見抜く必要があります。

3. 採点方法:「結果」だけがすべて

このテストの面白いところは、「AI がどうやってやったか(プロセス)」は全く見ないという点です。

  • 従来のテスト: 「ボタンを 3 回押して、4 回押して、5 回押して…」と、手順が正しいかチェックする。
  • このテスト: 「最終的に、正しい会議が正しい日にシフトされ、Slack に正しい報告が載っていれば OK」。
    • もし AI が無駄なことを 100 回やっても、最終結果が正しければ合格です(ただし、コストは高くなります)。
    • もし「やったつもり」で結果が間違っていれば、0 点です。

4. 結果:AI はまだ「新人」レベル

残念ながら、最新の超高性能 AI(Opus や Gemini など)でも、このテストの正解率は 10% 未満でした。

  • Opus 4.7: 約 9.9%
  • Gemini 3.1: 約 9.6%
  • その他: 1%〜5% 程度

なぜこんなに低いのか?

  • 自信過剰: 「できた!」と報告していても、実はデータを探し損ねていたり、間違った人を招待していたりします。
  • あきらめ早い: 検索でヒットしなかったら、「たぶんここにあるはず」と勝手に推測して、他の場所を探そうとしません。
  • リスト処理の甘さ: 「12 件のメールを処理して」と言われても、10 件だけ処理して「完了」と報告してしまいます。

5. このテストの意義

このテストは、**「AI がビジネスで本当に使えるようになるための『壁』を可視化する」**ために作られました。

今の AI は、単純な作業や、指示が明確な場合は 97% 以上の正解率を出せます(「簡単な迷路」は得意)。しかし、**「複数のアプリを行き来し、会社のルールを読み取り、迷いながら正解を見つける」**という、人間が毎日やっているような「本物の仕事」には、まだ圧倒的に不慣れなのです。

まとめ

この論文は、**「AI 秘書を雇うには、まだもう少し訓練が必要だ」**と警鐘を鳴らしています。
「ボタンを押すだけ」の AI から、「会社のルールを理解し、複数のツールを自在に操って、結果を出す」AI へ進化させるための、新しい道しるべ(ベンチマーク)が作られたのです。

今後の AI 研究は、この「10% の壁」をどう乗り越えるかが焦点になるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →