OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
OmniaBench 是一个综合性基准测试,旨在通过利用源自真实世界资源的层级分类法来创建具有显式状态空间的 1,431 个可执行任务,从而评估通用 AI 智能体在多样化的 ToC、ToB 和 ToE 场景中的表现,并揭示了当前前沿模型在规划、约束维护和自适应纠错方面的显著局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:OmniaBench
问题陈述
大语言模型(LLMs)正在迅速从静态文本生成器演变为能够理解用户意图、调用外部工具并通过交互完成复杂任务的通用智能体。然而,现有的用于评估这些智能体的基准测试存在显著局限性:它们通常侧重于狭窄的场景、受限的工具生态系统或孤立的交互格式。这种多样性的缺失使得难以系统地刻画模型在现实世界异构应用设置中的能力。当前的基准测试覆盖范围与现实世界智能体用例中多样化、多轮、有状态且具有强约束性的本质之间存在着关键差距。
方法论
1. 分类法与场景构建
OmniaBench 通过构建基于现实世界应用生态系统的层级分类法来填补这一差距。作者从应用商店、产品需求文档(PRDs)、行业资源、网络检索和人工精炼中提取场景知识。由此产生的分类法涵盖了三个主要领域:
- ToC(消费者): 22 个一级领域和 101 个二级领域。
- ToB(商业): 38 个一级领域和 186 个二级领域。
- ToE(员工): 30 个一级领域和 67 个二级领域。
总规模涵盖 90 个一级领域和 354 个二级领域,提供了比以单一工具生态系统为中心的基准测试更广泛的领域空间。
2. 环境与任务合成
对于每个领域,团队构建了包含实体、状态变量、工具和初始化配置的可执行环境。这些环境被实例化为 Python 类,并配有受控的沙盒环境以进行文件和代码操作。任务通过四种互补的路径进行合成,以确保交互形式的多样性:
- DAG(有向无环图): 侧重于多轮有状态交互和工具链执行。
- DAG-S: 通过查询精炼从基于 DAG 的任务中衍生出单轮任务。
- Solver(求解器): 利用隐式或显式的求解器引导合成,针对选择、调度、分配和优化场景。
- Program(程序): 侧重于涉及分支、迭代、任务-程序合成及调试的复杂程序化推理。
最终生成的数据集包含 1,431 个任务,其中包含一个精心挑选的 644 个任务 的“挑战集”,旨在降低评估成本并减轻数据污染。
3. 评估框架
OmniaBench 在部分可观测马尔可夫决策过程(POMDP)的框架下,采用统一的基于轨迹的评估框架。
- 指标: 主要指标是 Pass@1。
- 评分: 任务使用十维能力分类法进行评估(任务理解、信息获取、规划与决策、状态管理、工具使用、代码与程序化操作、数据分析、办公与文档处理、交互协作、可靠性与安全性)。
- 验证: 通用任务使用基于准则(Rubric)的标准,而程序化任务则使用 VerifyCode,根据轨迹和最终观察结果来判定二元的通过/失败结果。
- 模拟: 多轮交互利用基于人格(Persona)的用户模拟器,通过偏好、沟通风格和信息披露程度来控制难度。
核心贡献
本文概述了四个主要贡献:
- OmniaBench 基准测试: 一个场景丰富的挑战性基准测试,整合了现实世界的应用商店、PRD 和网络搜索,以构建广泛的分类法(ToC/ToB/ToE),并将其实例化为可执行、可评估的智能体任务。
- 多维能力分类法: 一个通过十个不同维度表征模型能力的框架,实现了超越聚合成功率的细粒度诊断分析。
- 组合原子难度框架: 一种围绕用户意图、人格约束、环境状态、工具执行、多轮交互、错误恢复和结果验证来组织任务挑战的设计。
- 系统化评估: 对闭源和开源模型进行了全面评估,为能力边界、领域专业化和错误模式提供了证据。
结果
该基准测试对当前的尖端模型提出了实质性挑战:
- 性能天花板: 即使是测试中最先进的模型,Claude-Sonnet-5 和 GPT-5.6-Sol,其整体 Pass@1 得分也仅分别为 58.54% 和 57.14%。
- 能力差异: 模型在十个能力维度上的表现高度非均匀。即使整体得分相似的模型,在不同维度(例如任务理解 vs. 状态管理)上也表现出显著的能力差异。
- 领域差异: 在 ToB、ToC 和 ToE 切分中存在显著的性能差异。例如,虽然某些模型在 ToB 领域表现出色,但其在 ToE 中的表现可能会下降,这表明单一的聚合指标无法完全刻画实际的应用能力。
- 效率: 具有相似成功率的模型在工具使用效率上往往存在显著差异。有些模型需要冗余的探索和迂回的交互,而另一些则能通过紧凑、有针对性的工具序列完成任务。
- 错误分析: 与推理相关的失败占错误的 53.8%,其中规划/分解(36.7%)和约束违反(16.5%)是主要原因。直接的工具使用错误(如格式问题)占比较小,这表明瓶颈在于长程规划和自适应修正,而非基础的调用能力。
意义
OmniaBench 提供了一个广泛且具诊断性的基准测试,用于刻画通用智能体的能力边界。作者认为,随着整体任务成功率的提高,单一的聚合分数将变得不再充分。相反,该基准测试提供了一个系统性的基础,用于分析特定的能力、领域专业化和失败模式。通过揭示在规划、约束维护和自适应修正方面的持续局限性,OmniaBench 成为一个关键工具,旨在指导开发能够在多样化现实场景中运行的更鲁棒、更高效且更可靠的通用 AI 智能体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。