AutomationBench
Zapier の実際のワークフローパターンに基づき、複数のアプリケーションにまたがる API 発見、ポリシー順守、およびデータ連携を評価する新たなベンチマーク「AutomationBench」を導入し、現状の最先端モデルでも 10% 未満のスコアしか達成できていないことを示すことで、ビジネスが求めるエージェント能力とのギャップを浮き彫りにしています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
この論文は、**「AI に本当のビジネス仕事(複数のアプリをまたぐ複雑な作業)を任せるには、まだ遠い道のりがある」**ということを、新しいテスト「AutomationBench(オートメーションベンチ)」を使って明らかにした報告書です。
わかりやすく説明するために、いくつかの比喩を使ってみましょう。
1. 従来のテストは「迷路の迷路」だった?
これまでの AI のテストは、主に「1 つのアプリ(例えばウェブサイト)の中で、ボタンを何回か押してゴールにたどり着く」ようなものでした。
- 例: 「このウェブサイトで商品を探して、カートに入れてください」といった作業です。
- 問題点: 実際のビジネス現場では、そんな単純なことはしません。
- 「営業データ(CRM)を確認して、メールで連絡し、カレンダーに予約を入れ、チャットでチームに報告する」
- これらはすべて異なるアプリをまたぐ作業です。
これまでのテストは、この「アプリをまたぐ連携」や「会社のルールに従うこと」を測れていませんでした。
2. 新しいテスト「AutomationBench」の正体
この論文で紹介されているのは、**「AI 秘書の最終面接」**のようなものです。
- シチュエーション:
会社には、CRM(顧客管理)、メール、カレンダー、チャットツールなど、47 種類の異なるアプリが混在しています。 - 課題:
「2 月 20 日の午後 2 時に、Zoom と Google カレンダーの会議が被っているよ。会社のルール(スプレッドシート)を見て、どちらを優先すべきか判断し、優先されない方を日程変更して、Slack に報告して」というような、複雑で現実的な命令が出ます。 - AI に求められること:
- 道具を探す(API 発見): 「会議を調整するには、どのアプリのどの機能を使えばいいか」を自分で見つけなければなりません(マニュアルは渡されません)。
- ルールを守る(ポリシー): 「急ぎの顧客は優先する」という会社のルールを、直感ではなく文書から読み取り、守らなければなりません。
- ノイズに惑わされない: 大量のデータの中に、間違った情報やダミーのデータが混ざっています。それを見抜く必要があります。
3. 採点方法:「結果」だけがすべて
このテストの面白いところは、「AI がどうやってやったか(プロセス)」は全く見ないという点です。
- 従来のテスト: 「ボタンを 3 回押して、4 回押して、5 回押して…」と、手順が正しいかチェックする。
- このテスト: 「最終的に、正しい会議が正しい日にシフトされ、Slack に正しい報告が載っていれば OK」。
- もし AI が無駄なことを 100 回やっても、最終結果が正しければ合格です(ただし、コストは高くなります)。
- もし「やったつもり」で結果が間違っていれば、0 点です。
4. 結果:AI はまだ「新人」レベル
残念ながら、最新の超高性能 AI(Opus や Gemini など)でも、このテストの正解率は 10% 未満でした。
- Opus 4.7: 約 9.9%
- Gemini 3.1: 約 9.6%
- その他: 1%〜5% 程度
なぜこんなに低いのか?
- 自信過剰: 「できた!」と報告していても、実はデータを探し損ねていたり、間違った人を招待していたりします。
- あきらめ早い: 検索でヒットしなかったら、「たぶんここにあるはず」と勝手に推測して、他の場所を探そうとしません。
- リスト処理の甘さ: 「12 件のメールを処理して」と言われても、10 件だけ処理して「完了」と報告してしまいます。
5. このテストの意義
このテストは、**「AI がビジネスで本当に使えるようになるための『壁』を可視化する」**ために作られました。
今の AI は、単純な作業や、指示が明確な場合は 97% 以上の正解率を出せます(「簡単な迷路」は得意)。しかし、**「複数のアプリを行き来し、会社のルールを読み取り、迷いながら正解を見つける」**という、人間が毎日やっているような「本物の仕事」には、まだ圧倒的に不慣れなのです。
まとめ
この論文は、**「AI 秘書を雇うには、まだもう少し訓練が必要だ」**と警鐘を鳴らしています。
「ボタンを押すだけ」の AI から、「会社のルールを理解し、複数のツールを自在に操って、結果を出す」AI へ進化させるための、新しい道しるべ(ベンチマーク)が作られたのです。
今後の AI 研究は、この「10% の壁」をどう乗り越えるかが焦点になるでしょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。