OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
OmniaBench es un benchmark exhaustivo diseñado para evaluar agentes de IA general a través de diversos escenarios ToC, ToB y ToE mediante el aprovechamiento de una taxonomía jerárquica derivada de recursos del mundo real para crear 1.431 tareas ejecutables con espacios de estados explícitos, revelando limitaciones significativas en los modelos de frontera actuales con respecto a la planificación, el mantenimiento de restricciones y la corrección adaptativa.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: OmniaBench
Declaración del Problema
Los Modelos de Lenguaje Extensos (LLMs) están evolucionando rápidamente de generadores de texto estáticos a agentes generales capaces de comprender las intenciones del usuario, invocar herramientas externas y completar tareas complejas mediante la interacción. Sin embargo, los benchmarks existentes para evaluar estos agentes sufren de limitaciones significativas: a menudo se centran en escenarios estrechos, ecosistemas de herramientas restringidos o formatos de interacción aislados. Esta falta de diversidad dificulta la caracterización sistemática de las capacidades de los modelos a través de los heterogéneos entornos de aplicación que se encuentran en el mundo real. Existe una brecha crítica entre la cobertura de los benchmarks actuales y la naturaleza diversa, de múltiples turnos, con estado y con alta carga de restricciones de los casos de uso de agentes en el mundo real.
Metodología
1. Taxonomía y Construcción de Escenarios
OmniaBench aborda esta brecha construyendo una taxonomía jerárquica fundamentada en ecosistemas de aplicaciones del mundo real. Los autores derivan el conocimiento de los escenarios de tiendas de aplicaciones, documentos de requisitos de producto (PRDs), recursos de la industria, recuperación web y refinamiento humano. Esto resulta en una taxonomía que abarca tres entornos principales:
- ToC (Consumo): 22 dominios de Nivel-1 y 101 de Nivel-2.
- ToB (Negocios): 38 dominios de Nivel-1 y 186 de Nivel-2.
- ToE (Empleado): 30 dominios de Nivel-1 y 67 de Nivel-2.
El alcance total cubre 90 dominios de Nivel-1 y 354 de Nivel-2, proporcionando un espacio de dominio significativamente más amplio que los benchmarks centrados en un único ecosistema de herramientas.
2. Síntesis de Entorno y Tareas
Para cada dominio, el equipo construye entornos ejecutables que contienen entidades, variables de estado, herramientas y configuraciones de inicialización. Estos se instancian como clases de Python con entornos de sandbox controlados para operaciones de archivos y código. Las tareas se sintetizan a través de cuatro rutas complementarias para asegurar formas de interacción diversas:
- DAG (Grafo Acíclico Dirigido): Se enfoca en la interacción con estado de múltiples turnos y la ejecución de cadenas de herramientas.
- DAG-S: Deriva tareas de un solo turno a partir de tareas basadas en DAG mediante el refinamiento de consultas.
- Solver (Solucionador): Apunta a escenarios de selección, programación, asignación y optimización utilizando síntesis guiada por un solver implícito o explícito.
- Program (Programa): Se enfoca en el razonamiento procedimental complejo que involucra ramificación, iteración, síntesis de tarea-programa y depuración.
El conjunto de datos resultante contiene 1,431 tareas, con un "conjunto desafiante" curado de 644 tareas diseñado para reducir los costos de evaluación y mitigar la contaminación de datos.
3. Marco de Evaluación
OmniaBench emplea un marco de evaluación basado en trayectorias unificado dentro de una formulación de Proceso de Decisión de Markov Parcialmente Observable (POMDP).
- Métricas: La métrica principal es Pass@1.
- Calificación: Las tareas se evalúan utilizando una taxonomía de capacidades de diez dimensiones (Comprensión de Tareas, Recopilación de Información, Planificación y Toma de Decisiones, Gestión de Estado, Uso de Herramientas, Operaciones de Código y Programáticas, Análisis de Datos, Manejo de Oficina y Documentos, Colaboración Interactiva, Fiabilidad y Seguridad).
- Verificación: Se utilizan criterios basados en rúbricas para tareas generales, mientras que se emplea VerifyCode para tareas basadas en programas para determinar resultados binarios de aprobado/reprobado basados en trayectorias y observaciones finales.
- Simulación: Las interacciones de múltiples turnos utilizan simuladores de usuario basados en la personalidad (persona-grounded) para controlar la dificultad mediante preferencias, estilos de comunicación y divulgación de información.
Contribuciones Clave
El artículo describe cuatro contribuciones primarias:
- Benchmark OmniaBench: Un benchmark rico en escenarios y desafiante que integra tiendas de aplicaciones, PRDs y búsqueda web del mundo real para construir una amplia taxonomía (ToC/ToB/ToE) instanciada en tareas de agentes ejecutables y evaluables.
- Taxonomía de Capacidades Multidimensional: Un marco que caracteriza las capacidades de los modelos a través de diez dimensiones distintas, permitiendo un análisis diagnóstico detallado más allá de las tasas de éxito agregadas.
m. Marco de Dificultad Atómica Composicional: Un diseño que organiza los desafíos de las tareas en torno a la intención del usuario, restricciones de la personalidad, estados del entorno, ejecución de herramientas, interacción de múltiples turnos, recuperación de errores y verificación de resultados. - Evaluación Sistemática: Una evaluación exhaustiva de modelos tanto de código abierto como de código cerrado, proporcionando evidencia sobre los límites de capacidad, la especialización de dominio y los patrones de error.
Resultados
El benchmark presenta desafíos sustanciales para los modelos de frontera actuales:
- Techo de Rendimiento: Incluso los modelos más avanzados probados, Claude-Sonnet-5 y GPT-5.6-Sol, lograron puntuaciones de Overall Pass@1 de solo 58.54% y 57.14%, respectivamente.
- Varianza de Capacidad: El rendimiento es altamente no uniforme a través de las diez dimensiones de capacidad. Los modelos con puntuaciones generales similares exhiben fortalezas marcadamente diferentes (por ejemplo, en Comprensión de Tareas frente a Gestión de Estado).
- Varianza de Dominio: Existen diferencias de rendimiento significativas entre las divisiones ToB, ToC y ToE. Por ejemplo, mientras que algunos modelos sobresalen en ToB, su rendimiento puede caer en ToE, lo que indica que una única métrica agregada no puede caracterizar completamente la aplicabilidad práctica.
- Eficiencia: Los modelos con tasas de éxito comparables a menudo difieren significeltivamente en la eficiencia del uso de herramientas. Algunos requieren una exploración redundante e interacciones circuitadas, mientras que otros logran resultados con secuencias de herramientas compactas y dirigidas.
- Análisis de Errores: Los fallos relacionados con el razonamiento representan el 53.8% de los errores, siendo la planificación/descomposición (36.7%) y las violaciones de restricciones (16.5%) los principales contribuyentes. Los errores directos de uso de herramientas (por ejemplo, formato) constituyen una proporción menor, lo que sugiere que los cuellos de botella residen en la planificación de largo alcance y la corrección adaptativa más que en la invocación básica.
Significado
OmniaBench proporciona un benchmark amplio y diagnóstico para caracterizar los límites de capacidad de los agentes generales. Los autores argumentan que a medida que las tasas de éxito de las tareas generales mejoran, una única puntuación agregada se vuelve insuficiente. En su lugar, el benchmark ofrece una base sistemática para analizar habilidades específicas, especializaciones de dominio y patrones de fallo. Al revelar las limitaciones persistentes en la planificación, el mantenimiento de restricciones y la corrección adaptativa, OmniaBench sirve como una herramienta crítica para guiar el desarrollo de agentes de IA generales más robustos, eficientes y fiables, capaces de operar en diversos escenarios del mundo real.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.