OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
OmniaBenchは、実世界の資源から派生した階層的な分類法を活用して、明示的な状態空間を持つ1,431の実行可能なタスクを生成することにより、多様なToC、ToB、およびToEのシナリオにわたって汎用AIエージェントを評価するために設計された包括的なベンチマークであり、現在の最先端モデルにおけるプランニング、制約維持、および適応的修正に関する重大な限界を明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約: OmniaBench
問題提起
大規模言語モデル(LLM)は、静的なテキスト生成器から、ユーザーの意図を理解し、外部ツールを呼び出し、対話を通じて複雑なタスクを完了できる汎用エージェントへと急速に進化しています。しかし、これらのエージェントを評価するための既存のベンチマークには、重大な限界があります。それらは、限定的なシナリオ、制限されたツールエコシステム、あるいは孤立したインタラクション形式に焦点を当てがちです。このような多様性の欠如は、現実世界の多様なアプリケーション設定に見られるモデルの能力を体系的に特徴付けることを困難にしています。現在のベンチマークのカバー範囲と、現実世界のエージェントのユースケースに見られる多様でマルチターン、ステートフル、かつ制約の多い性質との間には、決定的な乖離が存在します。
メソドロジー
1. タクソノミーとシナリオ構築
OmniaBenchは、現実世界のアプリケーション・エコシステムに基づいた階層的なタクソノミーを構築することで、このギャップに対処します。著者らは、アプリストア、製品要求仕様書(PRD)、業界リソース、ウェブ検索、および人間による洗練からシナリオ知識を導出しています。これにより、以下の3つの主要な設定にわたるタクソノミーが構築されました:
- ToC (消費者向け): 22のレベル1ドメインと101のレベル2ドメイン。
- ToB (ビジネス向け): 38のレベル1ドメインと186のレベル2ドメイン。
- ToE (従業員向け): 30のレベル1ドメインと67のレベル2ドメイン。
総計で90のレベル1ドメインと354のレベル2ドメインをカバーしており、単一のツールエコシステムを中心としたベンチマークよりも大幅に広いドメイン空間を提供しています。
2. 環境とタスクの合成
各ドメインに対して、エンティティ、状態変数、ツール、および初期化構成を含む実行可能な環境を構築します。これらは、ファイル操作やコード操作のための制御されたサンドボックス環境を備えたPythonクラスとしてインスタンス化されます。タスクは、多様なインタラクション形式を確保するために、4つの補完的なルートを通じて合成されます:
- DAG (有向非巡回グラフ): マルチターンのステートフルなインタラクションとツールチェーンの実行に焦点を当てます。
- DAG-S: クエリの洗練を通じて、DAGベースのタスクからシングルターンのタスクを派生させます。
- Solver (ソルバー): 暗黙的または明示的なソルバーによる誘導を用いた合成を用い、選択、スケジューリング、割り当て、および最適化のシナリオを対象とします。
- Program (プログラム): 分岐、反復、タスク・プログラム合成、およびデバッグを含む、複雑な手続き的推論に焦点を当てます。
結果として得られるデータセットには1,431のタスクが含まれており、評価コストを削減しデータの汚染を軽減するために精査された644のタスクからなる「チャレンジング・セット」が用意されています。
3. 評価フレームワーク
OmniaBenchは、部分観測マルコフ決定過程(POMDP)の定式化内において、統一された軌跡ベースの評価フレームワークを採用しています。
- 指標: 主要な指標はPass@1です。
- スコアリング: タスクは、10次元の能力タクソノミー(タスク理解、情報収集、計画と意思決定、状態管理、ツール利用、コードおよびプログラマティック操作、データ分析、オフィスおよびドキュメント処理、インタラクティブなコラボレーション、信頼性と安全性)を用いて評価されます。
- 検証: 一般的なタスクにはルーブリックベースの基準が使用され、プログラムベースのタスクには、軌跡と最終的な観測に基づいてバイナリの合否を判定するVerifyCodeが用いられます。
- シミュレーション: マルチターン・インタラクションでは、好み、コミュニケーションスタイル、情報の開示量を通じて難易度を制御するために、ペルソナに基づいたユーザーシミュレータを利用します。
主な貢献
本論文は、4つの主要な貢献を概説しています:
- OmniaBenchベンチマーク: 現実世界のアプリストア、PRD、およびウェブ検索を統合して広範なタクソノミー(ToC/ToB/ToE)を構築し、実行可能かつ評価可能なエージェントタスクとしてインスタンス化した、シナリオ豊かな挑戦的なベンチマーク。
- 多次元能力タクソノミー: 10の異なる次元にわたってモデルの能力を特徴付けるフレームワークであり、集計された成功率を超えた微細な診断分析を可能にします。
- 構成的な原子的難易度フレームワーク: ユーザーの意図、ペルソナの制約、環境の状態、ツールの実行、マルチターン・インタラクション、エラーリカバリ、および結果の検証を中心にタスクの課題を整理する設計。
- 体系的な評価: クローズドソースおよびオープンソースの両方のモデルに対する包括的な評価を行い、能力の境界、ドメイン特化、およびエラーパターンに関する証拠を提供します。
結果
ベンチマークは、現在の最先端モデルに対して実質的な課題を突きつけています:
- パフォーマンスの天井: テストされた最も高度なモデルであるClaude-Sonnet-5とGPT-5.6-Solでさえ、総合Pass@1スコアはそれぞれわずか**58.54%および57.14%**でした。
- 能力の分散: パフォーマンスは10の能力次元間で極めて不均一です。同様の総合スコアを持つモデルであっても、強み(例:タスク理解 vs 状態管理)は著しく異なります。
- ドメインの分散: ToB、ToC、ToEの分割間で、大幅なパフォーマンスの差が存在します。例えば、あるモデルはToBで優れている一方で、ToEではパフォーマンスが低下する場合があり、これは単一の集計指標では実用的な適用性を完全には特徴付けられないことを示しています。
- 効率性: 同程度の成功率を持つモデルであっても、ツール使用の効率性は大きく異なることがよくあります。冗長な探索や回り道をしたインタラクションを必要とするものもあれば、コンパクトで的を絞ったツールシーケンスで結果を達成するものもあります。
- エラー分析: 推論に関連する失敗が**53.8%**を占めており、その中でも計画/分解(36.7%)と制約違反(16.5%)が主要な要因となっています。直接的なツール使用のエラー(例:フォーマット)はより小さな割合であり、ボトルネックは基本的な呼び出しではなく、長期的な計画と適応的な修正にあることを示唆しています。
重要性
OmniaBenchは、汎用エージェントの能力の境界を特徴付けるための、広範かつ診断的なベンチマークを提供します。著者らは、タスクの全体的な成功率が向上するにつれ、単一の集計スコアでは不十分になると主張しています。代わりに、本ベンチマークは特定の能力、ドメイン特化、および失敗パターンの分析のための体系的な基盤を提供します。計画、制約の維持、および適応的な修正における持続的な限界を明らかにすることで、OmniaBenchは、多様で現実世界のシナリオにおいて動作可能な、より堅牢で効率的かつ信頼性の高い汎用AIエージェントの開発を導くための重要なツールとして機能します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。