← Derniers articles
🤖 AI

AgenticData: An Agentic Data Analytics System for Heterogeneous Data

AgenticData est un système agentique innovant qui permet l'analyse autonome de données structurées et non structurées hétérogènes via des requêtes en langage naturel en s'appuyant sur une stratégie de collaboration multi-agents avec planification pilotée par rétroaction et optimisation sémantique pour atteindre une précision supérieure aux méthodes existantes.

Auteurs originaux : Ji Sun, Guoliang Li, Peiyao Zhou, Yihui Ma, Jingzhe Xu, Yuan Li

Publié 2026-07-17
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ji Sun, Guoliang Li, Peiyao Zhou, Yihui Ma, Jingzhe Xu, Yuan Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de résoudre un mystère colossal, mais que les indices soient éparpillés partout. Certains indices sont proprement inscrits dans des registres avec des colonnes claires comme « Nom », « Date » et « Montant ». D'autres sont désordonnés, enfouis dans des milliers de journaux intimes non organisés, de documents numérisés et de pages web où l'information est cachée au milieu de paragraphes de texte. Pendant longtemps, les ordinateurs ont été excellents pour lire les registres soignés mais terribles pour donner du sens aux journaux désordonnés. Ils nécessitent généralement l'intervention d'un expert humain pour écrire des instructions complexes (du code) afin de relier les points entre eux. C'est comme demander à un bibliothécaire de trouver un fait précis, mais vous devez écrire vous-même tout le code du moteur de recherche avant même qu'il ne puisse commencer à chercher. C'est lent, coûteux et frustrant. La grande question dans ce recoin de l'informatique est la suivante : pouvons-nous construire un système qui agisse comme un détective super intelligent, capable de lire à la fois les registres soignés et les journaux désordonnés, de comprendre ce que nous voulons en langage naturel et de résoudre le mystère tout seul ?

Entrez en scène AgenticData, un nouveau système conçu pour être ce détective super intelligent. Considérez-le comme une équipe d'agents spécialisés travaillant ensemble dans une salle de rédaction en pleine effervescence. Au lieu d'un seul cerveau géant essayant de tout faire à la fois, AgenticData utilise une approche « multi-agents ». Il possède un Profileur de Données qui scanne toute la bibliothèque pour comprendre quels livres et fichiers existent et comment ils pourraient être liés. Il possède un Planificateur qui élabore la stratégie étape par étape pour répondre à une question. Il possède un Validateur qui agit comme un éditeur strict, vérifiant le plan pour détecter des erreurs avant que quiconque ne commence le travail. Et il possède un Gestionnaire de Mémoire qui tient un carnet de notes sur les succès et les échecs passés afin que l'équipe ne commette pas deux fois la même erreur. Lorsque vous posez une question en langage naturel — comme « Montrez-moi le total des salaires de tous les joueurs de basket ayant remporté plus de 10 championnats » — cette équipe travaille ensemble pour trouver les bonnes données, élaborer le calcul mathématique et vous donner la réponse sans que vous ayez besoin d'écrire une seule ligne de code.

Les chercheurs derrière AgenticData ont découvert que cette approche par équipe fonctionne incroyablement bien. Dans leurs expériences, ils ont testé le système sur cinq benchmarks différents, qui sont comme des tests standardisés pour l'analyse de données. Les résultats ont montré qu'AgenticData était nettement plus précis que les méthodes actuelles les plus performantes. Sur certaines tâches difficiles, il a amélioré la précision de près de 30 % par rapport aux autres systèmes de pointe. Par exemple, sur un ensemble de données impliquant des données bancaires réelles, il était presque 20 % plus précis que le concurrent suivant. Le système ne s'est pas contenté de deviner ; il a utilisé une boucle de rétroaction intelligente. Si le « Validateur » trouvait une erreur dans le plan, le système ne renonçait pas. Il stockait l'erreur dans sa mémoire, apprenait de celle-ci et tentait un nouveau plan, meilleur. Ce processus de « essayer, échouer, apprendre et réessayer » lui a permis de résoudre des énigmes complexes qui déconcertaient les autres systèmes.

L'une des découvertes les plus passionnantes concerne la manière dont AgenticData gère les données « désordonnées ». Les systèmes traditionnels peinent souvent lorsqu'ils ne trouvent pas de structure claire dans un document. AgenticData, cependant, utilise ses agents pour décomposer le texte non structuré en morceaux utiles, trouver des connexions entre différents documents et même les lier à des tableaux structurés. Lors de tests impliquant des articles Wikipédia et des dossiers bancaires réels, le système a réussi à naviguer dans ces sources de données chaotiques pour fournir des réponses précises. Les chercheurs ont également mesuré le coût et la vitesse du système. Ils ont constaté qu'en optimisant la façon dont les agents utilisaient leur « puissance cérébrale » (plus précisément, le nombre de fois qu'ils sollicitaient des modèles de langage de grande taille), AgenticData pouvait obtenir des résultats de haute qualité pour environ la moitié du coût des autres méthodes.

L'article soutient explicitement l'idée selon laquelle un seul modèle d'IA massif ne peut pas gérer seul toutes ces tâches. Ils ont découvert que le fait de compter sur un seul modèle pour planifier, exécutire et valider tout à la fois conduit souvent à des erreurs et à des « hallucinations » (où l'IA invente des choses). Au lieu de cela, leurs expériences suggèrent que diviser le travail en une équipe collaborative avec des rôles spécifiques et un système de mémoire robuste est la clé du succès. Ils ont également écarté l'idée que les humains doivent écrire du code pour chaque nouvelle analyse ; leur système a démontré qu'il pouvait générer de manière autonome les étapes nécessaires. Bien que le système ne soit pas parfait — il prend encore quelques minutes pour planifier des requêtes complexes et peut parfois éprouver des difficultés avec des modèles de données extrêmement rares — les résultats suggèrent qu'il s'agit d'une avancée majeure. L'équipe a déjà déployé ce système dans des contextes réels, notamment dans des banques et des entreprises de réseaux électriques, où il aide actuellement des professionnels à analyser des données complexes sans avoir besoin d'une équipe de scientifiques de données pour écrire du code pour chaque question.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →