← 최신 논문
💬 NLP

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

OmniaBench는 실제 자원에서 유래한 계층적 분류 체계를 활용하여 명시적인 상태 공간을 가진 1,431개의 실행 가능한 태스크를 생성함으로써, 현재의 프런티어 모델들이 계획 수립, 제약 조건 유지 및 적응적 교정 측면에서 보이는 중대한 한계를 드러내는, 다양한 ToC, ToB 및 ToE 시나리오 전반에 걸쳐 범용 AI 에이전트를 평가하도록 설계된 종합적인 벤치마크이다.

원저자: Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

게시일 2026-07-17
📖 1 분 읽기☕ 가벼운 읽기

원저자: Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: OmniaBench

문제 정의

대규모 언어 모델(LLM)은 정적인 텍스트 생성기에서 사용자 의도를 이해하고, 외부 도구를 호출하며, 상호작용을 통해 복잡한 과업을 완수할 수 있는 범용 에이전트로 빠르게 진화하고 있습니다. 그러나 이러한 에이전트를 평가하기 위한 기존 벤치마크는 상당한 한계를 지니고 있습니다. 이들은 종종 협소한 시나리오, 제한된 도구 생태계, 또는 고립된 상호작용 형식에 집중합니다. 이러한 다양성의 결여는 실제 세계의 이질적인 애플리케이션 환경에서 발견되는 모델의 역량을 체계적으로 특징짓는 것을 어렵게 만듭니다. 현재의 벤치마크 커버리지와 실제 세계의 에이전트 유스케이스가 가진 다회차(multi-turn), 상태 유지(stateful), 제약 조건 중심의 특성 사이에는 심각한 간극이 존재합니다.

방법론

1. 분류 체계 및 시나리오 구축

OmniaBench는 실제 애플리케이션 생태계에 기반한 계층적 분류 체계를 구축함으로써 이 간극을 해결합니다. 저자들은 앱 스토어, 제품 요구 사항 문서(PRD), 산업 리소스, 웹 검색 및 인간의 정교화 과정을 통해 시나리오 지식을 도출했습니다. 그 결과 다음과 같은 세 가지 주요 환경을 아우르는 분류 체계가 도출되었습니다:

  • ToC (Consumer/소비자): 22개의 Level-1 및 101개의 Level-2 도메인.
  • ToB (Business/기업): 38개의 Level-1 및 186개의 Level-2 도메인.
  • ToE (Employee/직원): 30개의 Level-1 및 67개의 Level-2 도메인.
    전체 범위는 90개의 Level-1 및 354개의 Level-2 도메인을 포괄하며, 이는 단일 도구 생태계에 집중된 벤치마크보다 훨씬 넓은 도메인 공간을 제공합니다.

2. 환경 및 태스크 합성

각 도메인에 대해 팀은 엔티티(entities), 상태 변수, 도구, 초기화 구성을 포함하는 실행 가능한 환경을 구축합니다. 이는 파일 및 코드 작업을 위한 제어된 샌드박스 환경을 갖춘 Python 클래스로 인스턴스화됩니다. 태스크는 다양한 상호작용 형태를 보장하기 위해 네 가지 보완적인 경로를 통해 합성됩니다:

  • DAG (Directed Acyclic Graph/유향 비순환 그래프): 다회차 상태 유지 상호작용 및 도구 체인 실행에 중점을 둡니다.
  • DAG-S: 쿼리 정교화를 통해 DAG 기반 태스크로부터 단회차(single-turn) 태스크를 도출합니다.
  • Solver (솔버): 암시적 또는 명시적 솔버 가이드 합성을 사용하여 선택, 스케줄링, 할당 및 최적화 시나리오를 타겟팅합니다.
  • Program (프로그램): 분기, 반복, 태스크-프로그램 합성 및 디버깅을 포함하는 복잡한 절차적 추론에 중점을 둡니다.
    결과물인 데이터셋은 1,431개의 태스크를 포함하며, 평가 비용을 줄이고 데이터 오염을 완화하기 위해 설계된 644개의 태스크로 구성된 "챌린징 세트(challenging set)"를 포함합니다.

3. 평가 프레임워크

OmniaBench는 부분 관측 가능한 마르코프 결정 과정(POMDP) 공식 내에서 통합된 궤적 기반(trajectory-based) 평가 프레임워크를 채택합니다.

  • 지표: 주요 지표는 Pass@1입니다.
  • 스코어링: 태스크는 10차원 역량 분류 체계(태스크 이해, 정보 수집, 계획 및 의사결정, 상태 관리, 도구 사용, 코드 및 프로그래밍 작업, 데이터 분석, 오피스 및 문서 처리, 대화형 협업, 신뢰성 및 안전성)를 사용하여 평가됩니다.
  • 검증: 일반적인 태스크에는 루브릭 기반 기준이 사용되며, 프로그램 기반 태스크에는 궤적과 최종 관찰을 바탕으로 이진 통과/실패 여부를 결정하는 VerifyCode가 사용됩니다.
  • 시뮬레이션: 다회차 상호작용은 선호도, 커뮤니케이션 스타일, 정보 공개 정도를 통해 난이도를 조절하는 페르소나 기반 사용자 시뮬레이터를 활용합니다.

주요 기여

본 논문은 네 가지 주요 기여를 설명합니다:

  1. OmniaBench 벤치마크: 실제 앱 스토어, PRD, 웹 검색을 통합하여 광범한 분류 체계(ToC/ToB/ToE)를 구축하고, 이를 실행 및 평가 가능한 에이전트 태스크로 구현한 시나리오 풍부한 챌린징 벤치마크입니다.
  2. 다차원 역량 분류 체계: 모델 역량을 10가지 별도 차원으로 특징짓는 프레임워크로, 총합 성공률을 넘어 미세한 진단 분석을 가능하게 합니다.
  3. 구성적 원자적 난이도 프레임워크(Compositional Atomic Difficulty Framework): 사용자 의도, 페르소나 제약, 환경 상태, 도구 실행, 다회차 상호작용, 오류 복구, 결과 검증을 중심으로 태스크의 난이도를 조직하는 설계입니다.
  4. 체계적 평가: 폐쇄형 및 오픈 소스 모델 모두에 대한 종합적인 평가를 수행하여, 역량의 경계, 도메인 특화, 오류 패턴에 대한 증거를 제공합니다.

결과

벤치마크는 현재의 프런티어 모델들에게 상당한 도전 과제를 제시합니다:

  • 성능 상한선: 테스트된 가장 진보된 모델인 Claude-Sonnet-5GPT-5.6-Sol조차 각각 **58.54%**와 **57.14%**의 전체 Pass@1 점수를 기록하는 데 그쳤습니다.
  • 역량 편차: 성능은 10가지 역량 차원에 따라 매우 불균일하게 나타납니다. 유사한 전체 점수를 가진 모델들도 (예: 태스크 이해 vs 상태 관리 측면에서) 현저히 다른 강점을 보입니다.
  • 도메인 편차: ToB, ToC, ToE 분할 간에 상당한 성능 차이가 존재합니다. 예를 들어, 어떤 모델은 ToB에서 우수하지만 ToE에서는 성능이 떨어질 수 있으며, 이는 단일 집계 지표가 실질적인 적용 가능성을 완전히 특징지을 수 없음을 나타냅니다.
  • 효율성: 성공률이 비슷한 모델이라도 도구 사용 효율성 면에서는 크게 다를 수 있습니다. 일부 모델은 불필요한 탐색과 우회적인 상호작용을 요구하는 반면, 다른 모델은 압축적이고 목표 지향적인 도구 시퀀스로 결과를 달성합니다.
  • 오류 분석: 추론 관련 실패가 오류의 **53.8%**를 차지했으며, 계획/분해(36.7%)와 제약 조건 위반(16.5%)이 주요 원인이었습니다. 직접적인 도구 사용 오류(예: 포맷팅)는 적은 비중을 차지하여, 병목 현상이 기본적인 호출보다는 장기적인 계획 수립 및 적응적 수정에 있음을 시사합니다.

의의

OmniaBench는 범용 에이전트의 역량 경계를 규명하기 위한 광범하고 진단적인 벤치마크를 제공합니다. 저자들은 전체 태스크 성공률이 향착됨에 따라 단일 집계 점수만으로는 불충분해진다고 주장합니다. 대신, 이 벤치마크는 특정 능력, 도메인 전문성 및 실패 패턴을 분석하기 위한 체계적인 토대를 제공합니다. 계획, 제약 유지 및 적응적 수정에서의 지속적인 한계를 드러냄으로써, OmniaBench는 다양한 실제 시나리오에서 작동할 수 있는 더 견고하고 효율적이며 신뢰할 수 있는 범용 AI 에이전트 개발을 가이드하는 중요한 도구 역할을 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →