← Últimos artículos
🤖 AI

AgenticData: An Agentic Data Analytics System for Heterogeneous Data

AgenticData es un sistema agéntico innovador que permite el análisis autónomo de datos estructurados y no estructurados heterogéneos mediante consultas en lenguaje natural al aprovechar una estrategia de colaboración multiagente con planificación basada en retroalimentación y optimización semántica para lograr una precisión superior sobre los métodos existentes.

Autores originales: Ji Sun, Guoliang Li, Peiyao Zhou, Yihui Ma, Jingzhe Xu, Yuan Li

Publicado 2026-07-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ji Sun, Guoliang Li, Peiyao Zhou, Yihui Ma, Jingzhe Xu, Yuan Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un misterio masivo, pero las pistas están esparcidas por todas partes. Algunas pistas están ordenadamente escritas en libros de contabilidad con columnas claras como "Nombre", "Fecha" y "Monto". Otras son desordenadas, enterradas dentro de miles de entradas de diarios no organizadas, documentos escaneados y páginas web donde la información está oculta en párrafos de texto. Durante mucho tiempo, las computadoras han sido excelentes leyendo los libros de contabilidad ordenados pero terribles para dar sentido a los diarios desordenados. Usualmente, necesitan que un experto humano escriba instrucciones complejas (código) para conectar los puntos entre ambos. Esto es como pedirle a un bibliotecario que encuentre un dato específico, pero tienes que escribir tú mismo el código de todo el motor de búsqueda antes de que siquiera puedan empezar a buscar. Es lento, costoso y frustrante. La gran pregunta en este rincón de la informática es: ¿Podemos construir un sistema que actúe como un detective superinteligente, capaz de leer tanto los libros de contabilidad ordenados como los diarios desorderados, entender lo que queremos en lenguaje natural y resolver el misterio por sí solo?

Entra AgenticData, un nuevo sistema diseñado para ser ese detective superinteligente. Piensa en él como un equipo de agentes especializados trabajando juntos en una redacción bulliciosa. En lugar de un cerebro gigante tratando de hacer todo a la vez, AgenticData utiliza un enfoque de "multi-agentes". Tiene un Perfilador de Datos que escanea toda la biblioteca para entender qué libros y archivos existen y cómo podrían estar relacionados. Tiene un Planificador que figura la estrategia paso a paso para responder una pregunta. Tiene un Validador que actúa como un editor estricto, revisando el plan en busca de errores antes de que alguien comience a trabajar. Y tiene un Gestor de Memoria que guarda un cuaderno de éxitos y fracasos pasados para que el equipo no cometa los mismos errores dos veces. Cuando haces una pregunta en lenguaje natural —como "Muéstrame los salarios totales de todos los jugadores de baloncesto que ganaron más de 10 campeonatos"— este equipo trabaja en conjunto para encontrar los datos correctos, calcular las matemáticas y darte la respuesta sin que necesites escribir una sola línea de código.

Los investigadores detrás de AgenticData descubrieron que este enfoque de equipo funciona increíblemente bien. En sus experimentos, probaron el sistema en cinco diferentes benchmarks, que son como exámenes estandarizados para el análisis de datos. Los resultados mostraron que AgenticData es significativamente más preciso que los métodos actuales más destacados. En algunas tareas difíciles, mejoró la precisión casi un 30% en comparación con otros sistemas de alto nivel. Por ejemplo, en un conjunto de datos que involucra datos bancarios reales, fue casi un 20% más preciso que su competidor más cercano. El sistema no solo adivinó; utilizó un ingenioso ciclo de retroalimentación. Si el "Validador" encontraba un error en el plan, el sistema no simplemente se rendía. Almacenaba el error en su memoria, aprendía de él e intentaba un nuevo y mejor plan. Este proceso de "intentar, fallar, aprender e intentar de nuevo" le permitió resolver acertios complejos que desconcertaban a otros sistemas.

Uno de los hallazgos más emocionantes es cómo AgenticData maneja los datos "desordenados". Los sistemas tradicionales suelen tener dificultades cuando no pueden encontrar una estructura clara en un documento. AgenticData, sin embargo, utiliza sus agentes para descomponer el texto no estructurado en piezas útiles, encontrar conexiones entre diferentes documentos e incluso vincularlos con tablas estructuradas. En pruebas que involucraron artículos de Wikipedia y registros bancarios del mundo real, el sistema navegó con éxito por estas fuentes de datos caóticas para proporcionar respuestas precisas. Los investigadores también midieron el costo y la velocidad del sistema. Encontraron que, al optimizar cómo los agentes utilizaban su "potencia cerebral" (específicamente, cuántas veces invocaban modelos de lenguaje de gran tamaño), AgenticData podía lograr resultados de alta calidad por aproximadamente la mitad del costo de otros métodos.

El artículo argumenta explícitamente en contra de la idea de que un único modelo de IA masivo pueda manejar todas estas tareas por sí solo. Encontraron que confiar en un solo modelo para planificar, ejecutar y validar todo suele conducir a errores y "alucinaciones" (donde la IA inventa cosas). En cambio, sus experimentos sugieren que dividir el trabajo en un equipo colaborativo con roles específicos y un sistema de memoria robusto es la clave del éxito. También descartaron la idea de que los humanos necesiten escribir código para cada nuevo análisis; su sistema demostró que podía generar autónomamente los pasos necesarios. Si bien el sistema no es perfecto —todavía toma algunos minutos planificar consultas complejas y a veces puede tener dificultades con patrones de datos extremadamente raros— los resultados sugieren que es un gran paso adelante. El equipo ya ha desplegado este sistema en entornos del mundo real, incluyendo bancos y empresas de redes eléctricas, donde actualmente está ayudando a profesionales a analizar datos complejos sin necesidad de un equipo de científicos de datos que escriba código para cada pregunta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →