Resumen Técnico: DataSpace: Evaluación de Agentes de Datos para la Analítica Verificable en Espacios de Trabajo Heterogéneos
1. Planteamiento del Problema
Los agentes de datos están emergiendo como interfaces de lenguaje natural para los datos organizacionales, pero los entornos analíticos realistas presentan un desafío complejo: la evidencia necesaria para responder a una consulta rara vez se encuentra contenida dentro de una única tabla limpia. En su lugar, la información se encuentra dispersa en bases de datos relacionales, archivos estructurados/semiestructurados (CSV, JSON), documentos largos (PDF, Markdown) y artefactos multimedia (video), involucrando a menudo variaciones translingüísticas.
Los benchmarks existentes no logran unificar tres propiedades críticas del análisis de datos realista:
- Alcance del Espacio de Trabajo (Workspace Scope): A menudo aíslan la consulta estructurada (por ejemplo, Spider) o la recuperación no estructurada (por ejemplo, HotpotQA), fallando al no capturar tareas que requieren el descubrimiento e integración de evidencia a través de modalidades heterogéneas dentro de un espacio de trabajo local a la tarea.
- Contrato de Salida (Output Contract): Muchos benchmarks aceptan respuestas de tipo factoid, reportes abiertos o pipelines ejecutables. La analítica del mundo real a menudo demanda un resultado tabular completo y tipado que pueda ser consumido directamente.
- Semántica de Evaluación: Las evaluaciones actuales suelen depender de jueces basados en modelos o fallan al no manejar representaciones equivalentes (por ejemplo, diferentes órdenes de columnas, redacción de encabezados o precisión numérica) de manera determinista.
El artículo argumenta que, sin un benchmark unificado que imponga un contrato de salida tabular completo sobre espacios de trabajo translingüeros y heterogéneos con una evaluación determinista, no se puede medir con precisión el progreso en la fiabilidad de los agentes de datos.
2. Metodología
2.1 Benchmark DataSpace
DataSpace es un benchmark que comprende 410 tareas translingüeras y 7,439 artefactos que totalizan 15.01 GB.
- Modalidades: Los espacios de trabajo incluyen CSV, JSON, SQLite, Markdown, PDF y Video.
- Idiomas: Las tareas involucran escenarios translingüeros donde la pregunta y los artefactos del espacio de trabajo pueden mezclar chino e inglés.
- Formulación de la Tarea: Un agente recibe una pregunta en lenguaje natural y un espacio de trabajo local a la tarea. Debe descubrir autónomamente las fuentes, alinear entidades/esquemas, ejecutar computaciones de múltiples pasos (filtrado, unión, agregación) y devolver el resultado tabular completo solicitado como un archivo CSV.
- Dominios: Analítica financiera (fondos, acciones), datos macroeconómicos y analítica de salud.
2.2 DataSpace-Builder: Marco de Construcción
Para construir estas tareas complejas de manera fiable, los autores proponen DataSpace-Builder, un marco basado en la ejecución que transforma instancias de benchmarks existentes de Text-to-SQL (EHRSQL y BULL) en tareas de espacio de trabajo heterogéneo. El proceso consta de cuatro etapas:
- Transformación Translingüera (CLT - Cross-Language Transformation): Una migración conjunta de la pregunta, el estado de la base de datos y el SQL ejecutable. Asegura la consistencia referencial traduciendo nombres de entidades y valores mientras preserva identificadores y códigos. Un juez de LLM verifica la alineación semántica entre la pregunta traducida y el SQL.
- Muestreo Relacional Consciente de Restricciones: Para evitar espacios de trabajo repetitivos, el marco muestrea filas de la base de datos de origen manteniendo el esquema completo. Utiliza un conjunto de salvaguarda (claves primarias/foráneas, predicados de consulta) para asegurar la integridad relacional (por ejemplo, preservando rutas de unión) durante el muestreo.
- Enrutamiento de Modalidad y Renderizado de Artefactos:
- Enrutamiento Base: Las tablas se asignan a renderizadores (CSV, JSON, SQLite, Markdown, PDF) basados en las propiedades del esquema.
- Renderizado de Documentos: Se generan documentos de formato largo (Markdown/PDF) a partir de datos tabulares utilizando LLMs, asegurando una generación "fundamentada en hechos" donde celdas específicas son recuperables desde el texto.
- Renderizado de Video: Los datos tabulares se convierten en videos de insights de datos. Se utilizan dos estrategias: Abstracción de Predicados (trasladar las condiciones de filtrado a la narrativa del video) y Renderizado de Evidencia-Respuesta (distribuir las celdas del resultado a través de las escenas del video).
- Revisión Humana y Reparación de Tareas: Un panel de 11 expertos de dominio realiza revisiones ciegas e independientes. Ellos resuelven la tarea, verifican el estándar de oro (gold standard) y redactan la configuración de evaluación. Los desacuerdos activan reparaciones basadas en evidencia de la pregunta, el espacio de trabajo o la respuesta de oro.
2.3 Evaluador Determinista
El protocolo de evaluación no depende de modelos (model-free) y es invariante al encabezado:
- Alineación de Columnas: El evaluador encuentra un mapeo uno a uno entre las columnas predichas y las de referencia, independientemente de la redacción del encabezado o el orden.
- Normalización: Los valores se normalizan según tipos semánticos (texto, número, fecha, booleano) y reglas de precisión (por ejemplo, decimales, convenciones de porcentaje).
- Comparación de Filas: Las tareas que requieren orden se comparan como secuencias; otras se comparan como multiconjuntos no ordenados.
- Puntuación: Una tarea es correcta solo si la predicción tabular completa coincide con la referencia bajo estas semánticas.
3. Contribuciones Clave
- Un Benchmark de Espacio de Trabajo Heterogéneo: DataSpace introduce 410 tareas que requieren la síntesis de archivos estructurados, bases de datos, documentos largos y video en un único resultado tabular verificable.
- Un Marco de Construcción Basado en la Ejecución: DataSpace-Builder transforma recursos de Text-to-SQL ejecutables en tareas multimodales complejas, asegurando la consistencia de los datos mediante salvaguardas de muestreo y revisión de expertos.
- Un Evaluador Consciente de la Semántica: Un protocolo determinista que tolera representaciones equivalentes (reordenamiento de columnas, formato) mientras rechaza salidas incompletas o erróneas, eliminando la dependencia de jueces de LLM.
- Baselines Empíricos: El artículo establece líneas de base de rendimiento para seis modelos multimodales de frontera y cinco entornos de agentes (harnesses), identificando cuellos de botella específicos en las capacidades de los agentes.
4. Resultados Experimentales
Los autores evaluaron seis backbones multimodales (Grok 4.5, GPT-5.6 Sol, Kimi K3, MiMo-V2.5, Claude Sonnet 5, MiniMax M3) y cinco entornos de agentes (incluyendo su propio DataSpace-Agent).
- Rendimiento General: La configuración con mejor desempeño (Grok 4.5 con DataSpace-Agent) alcanzó una precisión del 66.34%. Esto indica que el benchmark está insaturado, ya que 76 tareas no fueron resueltas por ninguno de los seis backbones, mientras que solo 56 tareas fueron resueltas por todos los modelos.
- Impacto del Entorno (Harness): La elección del entorno de agente impacta significativamente el rendimiento. Con el backbone MiMo-V2.5 fijo, la precisión varió en 15.36 puntos porcentuales entre diferentes entornos (oscilando entre 30.98% y 46.34%).
- Desafíos Clave:
- Integración Multimodal: Las tareas que requieren evidencia multimodal redujeron consistentemente la precisión en todos los backbones entre 1.8 y 14.0 puntos en comparación con las tareas de un solo modo.
- Uniones (Joins): Las operaciones de unión redujeron la precisión entre 9.7 y 19.8 puntos.
- Eficiencia: GPT-5.6 Sol logró una precisión cercana a la máxima (64.63%) utilizando un 74.2% menos de tokens y un 50.3% menos de acciones que el máximo exponente, Grok 4.5.
- Análisis de Fallos: Una auditoría de 136 fallos de Grok 4.5 reveló que el 52.2% de los errores se originaron en la materialización de la respuesta (por ejemplo, añadir u omitir columnas o filas después de haber computado el resultado interno correcto), más que en el descubrimiento o la extracción de evidencia. Solo 5 de los 13 casos de "no envío" fueron fallos puros de terminación; la mayoría derivó de errores persistentes previos.
5. Significado y Reivindicaciones
El artículo afirma que DataSpace establece un banco de pruebas riguroso para avanzar en la fiabilidad de los agentes de datos. Su principal significancia radica en el cambio del paradigma de evaluación de habilidades aisladas (como la generación de SQL o la recuperación de documentos) hacia la resolución de espacios de trabajo de extremo a extremo con un contrato de salida estricto y verificable.
Los autores concluyen modestamente que, aunque los modelos de frontera actuales muestran potencial, persisten brechas significativas en la integración transmodal y las uniones. El benchmark destaca que la capacidad de "encontrar" datos es insuficiente; los agentes también deben materializar fielmente la estructura exacta de la salida solicitada. Los resultados sugieren que mejorar la fiabilidad de los agentes de datos requiere abordar el flujo completo, desde el descubrimiento de evidencia heterogénea hasta la serialización tabular precisa, en lugar de centrarse únicamente en las capacidades de razonamiento.
DataSpace sirve como el benchmark de evaluación oficial para la competencia KDD Cup 2026 Data Agents for Complex Data Analysis, proporcionando un entorno estandarizado y reproducible para la investigación futura en este dominio.