← Últimos artículos
💻 computer science

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

Este artículo presenta DataSpace, un benchmark integral y un marco de evaluación para la KDD Cup 2026 diseñado para evaluar la capacidad de los agentes de datos para generar resultados tabulares verificables a partir de espacios de trabajo heterogéneos y multimodales, revelando brechas de rendimiento significativas en la integración de evidencia multimodal y el impacto sustancial de las elecciones de arnés del agente en la fiabilidad.

Autores originales: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

Publicado 2026-08-05
📖 3 min de lectura☕ Lectura para el café

Autores originales: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando resolver un misterio, pero tus pistas están esparcidas por todas partes. Algunas están en una hoja de cálculo ordenada en tu computadora, otras están enterradas en un informe PDF de 50 páginas, otras están ocultas dentro de una base de datos, y la pista más importante podría ser un video de una cámara de seguridad. Esta es la realidad diaria de los "agentes de datos": programas informáticos inteligentes diseñados para responder preguntas buscando entre los desordenados archivos digitales de una organización. Durante mucho tiempo, los científicos probaron estos agentes en acertijos limpios y de un solo tipo, como buscar un nombre en una guía telefónica o hacerle una pregunta simple a una base de datos. Pero en el mundo real, los datos son una mezcla caótica de lenguajes, formatos y medios. La gran pregunta que se hacen los investigadores es: ¿Pueden estos detectives digitales realmente armar una historia completa a partir de un montón de evidencia desordenada, o se pierden cuando las pistas no se ven iguales?

Este artículo presenta una nueva prueba súper desafiante llamada DataSpace para ver exactamente qué tan buenos son estos agentes de datos resolviendo estos misterios desordenados del mundo real. Los investigadores construyeron un patio de juegos masivo que contiene 410 tareas diferentes y 7,439 artefactos digitales (archivos) que totalizan 15.01 GB de datos. No solo lanzaron archivos al azar; crearon un "espacio de trabajo heterogéneo" donde una sola pregunta podría requerir que leas un video, escanees un PDF, consultes una base de datos y cruces información con un archivo JSON, todo esto mientras lidias con pistas escritas tanto en inglés como en chino. El objetivo no es solo encontrar un dato único; el agente debe producir una tabla completa y verificable de respuestas, como una boleta de calificaciones final.

Los resultados de esta prueba son un poco un llamado de atención. Incluso los modelos de IA más inteligentes y avanzados probados (incluyendo gigantes como Grok 4.5 y GPT-5.6) solo lograron resolver aproximadamente el 66.34% de las tareas correctamente. Eso significa que fallaron en aproximadamente uno de cada tres acertijos. Los investigadores descubrieron que los agentes tienen más dificultades cuando tienen que combinar información de diferentes tipos de medios (como unir una pista de un video con una hoja de cálculo) o cuando necesitan realizar "uniones" complejas (conectar datos de dos fuentes distintas). Curiosamente, la elección del "harness" —el marco de software que le dice a la IA cómo usar sus herramientas— importó casi tanto como el propio cerebro de la IA, causando una diferencia de 15.36 puntos en las puntuaciones.

En última instancia, el artículo muestra que, si bien los agentes de datos están mejorando, están lejos de ser perfectos. A menudo obtienen los números correctos pero fallan al formatear la tabla final correctamente, o pasan por alto una pista crucial oculta en un video. Los autores concluyen que todavía nos queda un largo camino por recorrer antes de que estos agentes puedan ser plenamente confiables para manejar análisis de datos complejos y de múltiples formatos por sí solos, y han proporcionado este benchmark como un mapa para ayudar a futuros ingenieros a solucionar estas debilidades específicas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →