← Nieuwste papers
💬 NLP

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

OmniaBench is een uitgebreide benchmark die is ontworpen om algemene AI-agenten te evalueren over diverse ToC-, ToB- en ToE-scenario's door gebruik te maken van een hiërarchische taxonomie afgeleid van real-world bronnen om 1.431 uitvoerbare taken met expliciete toestandsruimtes te creëren, wat significante beperkingen blootlegt in huidige frontier-modellen met betrekking tot planning, het handhaven van restricties en adaptieve correctie.

Oorspronkelijke auteurs: Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

Gepubliceerd 2026-07-17
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: OmniaBench

Probleemstelling

Large Language Models (LLM's) evolueren snel van statische tekstgeneratoren naar algemene agenten die in staat zijn om gebruikersintenties te begrijpen, externe tools aan te roepen en complexe taken te voltooien door middel van interactie. De huidige benchmarks voor het evalueren van deze agenten lijden echter onder aanzienlijke beperkingen: ze richten zich vaak op smalle scenario's, beperkte tool-ecosystemen of geïsoleerde interactieformaten. Dit gebrek aan diversiteit maakt het moeilijk om de capaciteiten van modellen systematisch te karakteriseren over de heterogene applicatiesettings die in de echte wereld worden aangetroffen. Er is een kritieke kloof tussen de huidige benchmarkdekking en de diverse, multi-turn, stateful en door restricties zware aard van real-world agent-use cases.

Methodologie

1. Taxonomie en Scenario Constructie

OmniaBench adresseert deze kloof door een hiërarchische taxonomie te construeren die geworteld is in real-world applicatie-ecosystemen. De auteurs afleiden scenario-kennis uit app stores, product requirement documents (PRD's), industriële bronnen, webretrieval en menselijke verfijning. Dit resulteert in een taxonomie die drie primaire settings beslaat:

  • ToC (Consumer): 22 Level-1 en 101 Level-2 domeinen.
  • ToB (Business): 38 Level-1 en 186 Level-2 domeinen.
  • ToE (Employee): 30 Level-1 en 67 Level-2 domeinen.
    De totale omvang beslaat 90 Level-1 en 354 Level-2 domeinen, wat een aanzienlijk bredere domeinruimte biedt dan benchmarks die gecentreerd zijn rond een enkel tool-ecosysteem.

2. Omgeving en Taak Synthese

Voor elk domein construeert het team uitvoerbare omgevingen met entiteiten, state variabelen, tools en initialisatieconfiguraties. Deze worden geïnstantieerd als Python-klassen met gecontroleerde sandbox-omgevingen voor bestands- en code-operaties. Taken worden gesynthetiseerd via vier complementaire routes om diverse interactievormen te waarborgen:

  • DAG (Directed Acyclic Graph): Richt zich op multi-turn stateful interactie en tool-chain executie.
  • DAG-S: Afgeleid van DAG-gebaseerde taken door middel van query-verfijning om single-turn taken te creëren.
  • Solver: Richt zich op selectie, planning, allocatie en optimalisatiescenario's met behulp van impliciete of expliciete solver-gestuurde synthese.
  • Program: Richt zich op complexe procedurele redenering met betrekking tot branching, iteratie, taak-programma synthese en debugging.

De resulterende dataset bevat 1.431 taken, met een gecureerde "challenging set" van 644 taken die ontwor af is om evaluatiekosten te verlagen en datacontaminatie te mitigeren.

3. Evaluatie Framework

OmniaBench hanteert een uniform trajectory-gebaseerd evaluatieframework binnen een Partially Observable Markov Decision Process (POMDP) formulering.

  • Metrics: De primaire metric is Pass@1.
  • Scoring: Taken worden geëvalueerd met behulp van een tien-dimensionale capaciteitstaxonomie (Taakbegrip, Informatieverzameling, Planning & Besluitvorming, State Management, Toolgebruik, Code & Programmatische Operaties, Data-analyse, Office & Documentafhandeling, Interactieve Samenwerking, Betrouwbaarheid & Veiligheid).
  • Verificatie: Rubriek-gebaseerde criteria worden gebruikt voor algemene taken, terwijl VerifyCode wordt ingezet voor programma-gebaseerde taken om binaire pass/fail uitkomsten te bepalen op basis van trajecten en finale observaties.
  • Simulatie: Multi-turn interacties maken gebruik van persona-gegronde gebruikerssimulatoren om moeilijkheidsgraad te controleren via voorkeuren, communicatiestijlen en informatie-onthulling.

Belangrijkste Bijdragen

Het paper beschrijft vier primaire bijdragen:

  1. OmniaBench Benchmark: Een scenario-rijke, uitdagende benchmark die real-world app stores, PRD's en webzoekopdrachten integreert om een brede taxonomie (ToC/ToB/ToE) te construeren, geïnstantieerd in uitvoerbare, evalueerbare agent-taken.
  2. Multi-Dimensionale Capaciteitstaxonomie: Een framework dat modelcapaciteiten karakteriseert over tien onderscheidende dimensies, wat fijnmazige diagnostische analyse mogelijk maakt buiten de geaggregeerde succesratio's.
  3. Compositioneel Atomaire Moeilijkheidsgraad Framework: Een ontwerp dat de uitdagingen van taken organiseert rond gebruikersintentie, persona-restricties, omgevingsstates, tool-executie, multi-turn interactie, foutherstel en resultaatverificatie.
  4. Systematische Evaluatie: Een uitgebreide evaluatie van zowel closed-source als open-source modellen, die bewijs levert over capaciteitsgrenzen, domeinspecialisatie en foutpatronen.

Resultaten

De benchmark presenteert substantiële uitdagingen voor huidige frontier-modellen:

  • Prestatieplafond: Zelfs de meest geavanceerde geteste modellen, Claude-Sonnet-5 en GPT-5.6-Sol, behaalden Overall Pass@1 scores van respectievelijk slechts 58,54% en 57,14%.
  • Capaciteitsvariantie: Prestaties zijn zeer niet-uniform over de tien capaciteitsdimensies. Modellen met vergelijkbare algemene scores vertonen opvallend verschillende sterktes (bijv. in Taakbegrip versus State Management).
  • Domeinvariantie: Significante prestatieverschillen bestaan tussen de ToB, ToC en ToE splits. Zo kunnen modellen die excelleren in ToB, hun prestaties zien dalen in ToE, wat aangeeft dat een enkele geaggregeerde metric de praktische toepasbaarheid niet volledig kan karakteriseren.
  • Efficiëntie: Modellen met vergelijkbare succesratio's verschillen vaak aanzienlijk in tool-use efficiëntie. Sommigen vereisen redundante exploratie en omwegen, terwijl anderen resultaten bereiken met compacte, gerichte tool-sequenties.
  • Foutanalyse: Redeneringsgerelateerde fouten verklaren 53,8% van de fouten, waarbij planning/decompositie (36,7%) en schendingen van restricties (16,5%) belangrijke bijdragers zijn. Directe tool-use fouten (bijv. formattering) vormen een kleiner deel, wat suggereert dat de bottlenecks liggen in long-horizon planning en adaptieve correctie in plaats van basis-invocatie.

Betekenis

OmniaBench biedt een brede en diagnostische benchmark voor het karakteriseren van de capaciteitsgrenzen van algemene agenten. De auteurs stellen dat naarmate de algemene taaksuccesratio's verbeteren, een enkele geaggregeerde score onvoldoende wordt. In plaats daarvan biedt de benchmark een systematische fundering voor het analyseren van specifieke vermogens, domeinspecialisaties en foutpatronen. Door aanhoudende beperkingen in planning, het handhaven van restricties en adaptieve correctie bloot te leggen, dient OmniaBench als een kritiek instrument voor het sturen van de ontwikkeling van meer robuuste, efficiënte en betrouwbare algemene AI-agenten die in staat zijn te opereren in diverse, real-world scenario's.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →