← 最新の論文
💬 NLP

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

既存の言語エージェントベンチマークが抱える多様性や現実性の欠如を補うため、32 のアプリケーションと 604 のツールを用いた現実的な環境で長期タスクを評価する新ベンチマーク「Toolathlon」を提案し、最先端モデルの実世界タスク遂行能力の限界を明らかにした。

原著者: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xin
公開日 2026-02-27
📖 1 分で読めます☕ さくっと読める

原著者: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xingyao Wang, Xiang Yue, Shuyan Zhou, Graham Neubig, Junxian He

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🏆 「ツール・デカスロン」:AI 助手の「実戦テスト」の紹介

この論文は、**「AI 助手(言語エージェント)が、現実世界で本当に役に立つのか?」**を厳しくテストするための新しい基準(ベンチマーク)「ツール・デカスロン(TOOLATHLON)」の発表です。

これまでのテストは「おままごと」のような単純な課題が多かったのに対し、今回は**「本物のオフィスで、本物のツールを使って、複雑な仕事をする」**というシミュレーションを行いました。

わかりやすくするために、いくつかの比喩を使って解説します。


1. これまでのテスト vs 今回のテスト

🎮 以前のテスト:「おままごと」のシミュレーター
これまでの AI のテストは、まるで「おままごと」のゲームのようでした。

  • 状況: 「メールを送ってください」と言われると、AI は「送りました!」と答えますが、実際には誰にも届いていません。
  • 問題: 現実世界には「メールが送れない」「ファイルが見つからない」「データベースがエラーになる」といったトラブルがあります。これまでのテストは、そんな**「現実の泥臭さ」を無視**していたため、AI が実務で使えないという問題がありました。

🏋️ 今回のテスト:「オリンピック」の実戦
「ツール・デカスロン」は、AI に**「本物の職場」**に放り込んで、実際の仕事をさせます。

  • 環境: Google カレンダー、Notion、Snowflake(企業用データベース)、Kubernetes(サーバー管理)など、32 種類の本物のアプリ604 個のツールを使います。
  • 課題: 「メールの添付ファイルから Python コードをダウンロードして、エラーがないかチェックし、合格したら Notion に点数を記録し、不合格なら担当者にメールを送る」といった、複数のアプリをまたぐ複雑な仕事を任されます。
  • 特徴: 最初から「空っぽ」の状態ではなく、**「すでに学生が 50 人登録されている授業管理システム」「過去の取引データが詰まったスプレッドシート」**など、**現実と同じ「ごちゃごちゃした状態」**からスタートします。

2. 具体的な課題の例(比喩で解説)

このテストでは、AI に以下のような「人間らしい曖昧な指示」を出します。

  • 課題 A(教育現場):

    • 指示: 「メールにある宿題の提出ファイルを確認して、Canvas(授業管理システム)で採点して。Python のコードにエラーがなければ 10 点、なければ 0 点にしてね。学生 ID はこのファイルを見てね。」
    • AI の仕事: メールを開き、添付ファイル(Python)をダウンロード → ターミナルで実行してエラーチェック → 結果を Canvas に記録。
    • 難しさ: 「エラーがあったらどうするか」「複数回提出されたら最新のものを」といった文脈を自分で推測する必要があります。
  • 課題 B(企業管理):

    • 指示: 「データベースのチケット(問い合わせ)で、対応が遅れているものを探して。マニュアルに従って、担当者にリマインダーメールを、ユーザーにはお詫びメールを送って。」
    • AI の仕事: Snowflake(データベース)で遅延をチェック → PDF マニュアルを読んで対応ルールを確認 → 適切なテンプレートを選んでメール送信。
    • 難しさ: 複数のツールをまたぎ、マニュアルという「外部の知識」も活用する必要があります。

3. 結果:AI はまだ「新人」レベル

このテストで、世界最高峰の AI モデル(Claude-4.5-Sonnet や GPT-5 など)を評価しました。結果は**「残念ながら、まだ実務には不十分」**でした。

  • 成功確率: 一番できたモデルでも、**38.6%**しか成功しませんでした。つまり、10 回やっても 6 回以上は失敗します。
  • 主な失敗原因:
    1. 道具の使い間違い: 「存在しないボタンを押す」や「間違ったツールを選ぶ」などのミス。
    2. 長い物語の忘れ: 20 回以上の手順を踏むと、最初の指示を忘れたり、途中で諦めてしまったりする(「長期的なタスク」の弱点)。
    3. 大量の情報の処理: データベースから大量のデータを読み込んだとき、AI がパニックになって処理を放棄してしまう。

4. なぜこれが重要なのか?

これまでのテストは「AI が頭でっかちで、指示通りに動くか」を見ていましたが、このテストは**「AI が現実の混乱の中で、どうやって問題を解決するか」**を見ています。

  • 現実の壁: 実際の仕事では、マニュアルが完璧ではないし、ツールは時々壊れます。AI はそんな**「不確実な状況」**でも、自分で考えて動き続けなければなりません。
  • 今後の展望: このテスト(ツール・デカスロン)は、AI 開発者にとっての「コンパス」になります。どこが弱いか(長文の理解力、エラー処理など)が明確になったので、より**「現実世界で使える頼れる AI 助手」**を作るための道筋ができました。

まとめ

「ツール・デカスロン」は、AI に対して**「おままごと」ではなく「本物の仕事」を課す、新しい「実力テスト」です。
今の AI は「優秀な学生」ですが、まだ「社会人」として一人前になるには、
「混乱した状況での判断力」「粘り強さ」**をさらに磨く必要があります。このテストが、そのためのトレーニング場として機能し、私たちが本当に使える AI 助手が生まれるきっかけになることを期待しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →