DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?
Este artículo presenta DSAgentBench, el primer benchmark diseñado para evaluar la capacidad de los agentes de IA para automatizar flujos de trabajo de ciencia de datos de extremo a extremo dentro de entornos informáticos reales, revelando una brecha de rendimiento significativa donde incluso los modelos más fuertes tienen dificultades con la orquestación de herramientas y el razonamiento de múltiples pasos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: DSAgentBench
Planteamiento del Problema
La ciencia de datos en el mundo real implica flujos de trabajo complejos y de largo alcance que abarcan la manipulación de datos, la exploración, el modelado, la visualización y la validación. Estas tareas requieren el uso coordinado de diversas herramientas —incluyendo notebooks, IDEs, terminales, navegadores y bases de datos— dentro de un sistema operativo funcional. Si bien los avances recientes en los modelos de lenguaje de gran tamaño (LLMs) han demostrado capacidades para generar código o realizar tareas analíticas aisladas, los benchmarks existentes no logran evaluar si los agentes pueden ejecutar de forma autónoma flujos de trabajo completos de ciencia de datos de extremo a extremo en entornos computacionales realistas.
Los benchmarks actuales se dividen en dos categorías: aquellos que evalúan la generación de código de forma aislada (por ejemplo, DS-1000, DSEval) sin requerir interacción con el sistema, y aquellos que evalúan el control general de la computadora (por ejemplo, OSWorld, WebArena) sin evaluar el razonamiento analítico específico del dominio. En consecuencia, existe una falta de marcos de evaluación que pongan a prueba la capacidad de un agente para navegar por sistemas de archivos, gestionar dependencias, interpretar errores y refinar análisis basados en salidas intermedias dentro de un entorno de sistema operativo real.
Metodología
Construcción del Benchmark (DSAgentBench)
Los autores presentan DSAgentBench, el primer benchmark diseñado para evaluar flujos de trabajo autónomos de ciencia de datos dentro de sistemas operativos reales. El benchmark consta de 275 tareas diversas, creadas por humanos, que cubren todo el ciclo de vida de la ciencia de datos.
- Formulación de Tareas: Las tareas se definen como tuplas , donde es la configuración inicial del sistema (conjuntos de datos, estructura de archivos, librerías instaladas), es una instrucción en lenguaje natural y es un evaluador de Python determinista.
- Obtención de Datos: Los conjuntos de datos se extraen de fuentes heterogéneas del mundo real, incluyendo Kaggle, OpenML, GitHub, bases de datos SQLite y APIs web. Los datos incluyen modalidades tabulares (95.3%), de imagen (3.6%) y de texto (1.1%).
- Categorías de Tareas: Las tareas están organizadas en seis categorías de capacidad: Adquisición de Datos, Análisis Exploratorio de Datos (EDA), Ingeniería de Características, Modelado, Evaluación/Despliegue y Visualización/Reporte.
- Protocolo de Evaluación: A diferencia de los benchmarks que califican la ejecución de código, DSAgentBench emplea evaluadores deterministas que verifican la corrección analítica, la calidad de la salida visual y el rendimiento del modelo. Una tarea se considera exitosa solo si las salidas finales del agente satisfacen los criterios del evaluador (puntuación ).
- Pipeline de Construcción: El benchmark se construyó mediante un proceso de tres etapas: obtención de conjuntos de datos, diseño colaborativo de tareas/evaluadores por parte de expertos humanos (utilizando LLMs solo para refinamiento) y verificación de doble anotador para asegurar la reproducibilidad y la corrección técnica.
Arquitectura del Entorno
DSAgentBench extiende el marco OSWorld para crear un entorno de ejecución realista:
- SO: Ubuntu con Python y librerías de ciencia de datos preinstaladas.
- Herramientas: Visual Studio Code, Jupyter Notebook, Chrome y acceso a las APIs de Kaggle/OpenML.
- Espacio de Observación: Los agentes reciben una captura de pantalla de 1920×1080 o una modalidad híbrida de Captura de Pantalla + Árbol de Accesibilidad (A11y), que proporciona metadatos estructurados de la interfaz de usuario (roles, cuadros delimitadores, estados de interacción).
- Espacio de Acción: Los agentes interactúan mediante acciones de GUI (clics de ratón, entrada de teclado) y meta-acciones (WAIT, DONE, FAIL). El entorno captura las transiciones de estado después de cada acción.
Modelos Evaluados
Los autores evaluaron 15 agentes de código abierto y cerrado, incluyendo:
- Código cerrado: GPT-4o, GPT-5 (y mini), O4-mini, Claude Sonnet 4/4.5/4.6, Gemini 2.5 Pro y el Agente de Computadora de OpenAI.
- Código abierto: UI-TARS (2B/7B), GUI-OWL-7B, OpenCUA-72B y modelos híbridos (Jedi emparejado con GPT-4o).
Resultados Clave
Rendimiento General
Los experimentos revelan una brecha sustancial de capacidad entre los sistemas agénticos actuales y las demandas de los flujos de trabajo reales de ciencia de datos:
- Agente más fuerte: Claude-4.6-Sonnet logró el mayor rendimiento con un 56.70% de éxito en las tareas bajo la configuración de Captura de Pantalla + Árbol A11y.
- Otros modelos de código cerrado: El rendimiento cayó significamente para otros modelos, con GPT-5 en 29.81% y otros (GPT-4o, Gemini-2.5-Pro) rondando el 20%.
- Modelos de código abierto: Todos los agentes de código abierto lograron menos del 1% de éxito, fallando frecuentemente en la orquestación de herramientas, el anclaje al SO (grounding) y el razonamiento de múltiples pasos.
- Línea base humana: Los expertos humanos lograron una tasa de éxito del 85.09%, resaltando la brecha restante incluso para los agentes de IA más fuertes.
Ablación y Análisis de Errores
- Complejidad de la Tarea: El rendimiento se degrada monótonamente con la dificultad. Las tareas "difíciles" (5+ pasos) siguen siendo las más desafiantes. Los flujos de trabajo de múltiples etapas (56.7% de las tareas) son significativamente más difíciles que las tareas de una sola etapa debido a la necesidad de mantenimiento de estado y recuperación de errores.
- Uso de Herramientas: Las tareas ejecutadas en Jupyter Notebooks tuvieron un mejor desempeño que aquellas en VS Code, debido principalmente a menos fallos relacionados con la terminal y el entorno.
- Modalidad de Observación: Agregar información del árbol A11y generalmente mejoró el rendimiento, sugiriendo que los metadatos estructurados de la UI ayudan al anclaje (grounding), aunque las ganancias variaron según el modelo.
- Modos de Fallo:
- Los agentes de código abierto fallaron casi exclusivamente (97–98%) debido a errores de anclaje (incapacidad para alinear las instrucciones con el estado del escritorio).
- Los agentes de código cerrado más fuertes exhibieron fallos mixtos, incluyendo errores de terminal, fallos en la generación de código y déficits de razonamiento.
- Estructura Temporal: Los modelos de código abierto y los más débiles solían fallar temprano (incapacidad para abrir terminales), mientras que los modelos más fuertes tendían a fallar en etapas posteriores tras una exploración prolongada e ineficaz.
- Sensibilidad al Presupuesto: Aumentar el presupuesto de interacción de 15 a 50 pasos produjo solo ganancias marginales (24.54% 25.81%), lo que indica que los fallos no se deben principalmente a los límites de pasos, sino a problemas fundamentales en la planificación y el razonamiento.
Significado y Reivindicaciones
El artículo posiciona a DSAgentBench como un recurso fundamental para desarrollar agentes de ciencia de datos anclados, verificables y autónomos. Sus principales contribuciones son:
- Primer Benchmark de SO Real: Es el primer benchmark que evalúa flujos de trabajo autónomos de ciencia de datos dentro de un sistema operativo funcional, cubriendo todo el ciclo de vida desde la adquisición de datos hasta la validación.
- Evaluación Basada en Ejecución: Cambia el paradigma de evaluación de la "corrección del código" a la "corrección analítica", requiriendo que los agentes produzcan artefactos válidos (visualizaciones, modelos, reportes) verificados por scripts deterministas.
- Revelación de la Brecha: Los resultados exponen una limitación significativa en los sistemas agénticos actuales, demostrando que incluso los modelos más fuertes luchan con la coordinación de herramientas, el razonamiento de largo alcance y el anclaje al SO requerido para la ciencia de datos del mundo real.
- Dirección Futura: Al identificar modos de fallo específicos (anclaje, planificación, orquestación de herramientas), el benchmark proporciona una hoja de ruta clara para la investigación futura orientada a construir agentes capaces de realizar tareas de ciencia de datos del mundo real.
Los autores lanzan el benchmark en https://github.com/vis-nlp/DSAgentBench para facilitar la investigación adicional en este dominio.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.