Résumé Technique : UrbanDS
Problématique
Les agents fondés sur les grands modèles de langage (LLM) ont montré un potentiel prometteur pour automatiser les flux de travail en science des données, pourtant les méthodes existantes font face à des limitations significatives dans les scénarios intensifs en données. Les approches actuelles s'appuient généralement sur un ensemble limité de jeux de données fournis directement avec une tâche. Cependant, les applications réelles, particulièrement en informatique urbaine, impliquent des référentiels à grande échelle et hétérogènes contenant des milliers de fichiers issus de domaines divers (ex. : mobilité, transport, utilisation des sols, économie).
Le défi central est double :
- Découverte de Datasets : Les agents doivent identifier les jeux de données pertinents au sein d'un réservoir massif où les noms de fichiers sont souvent ambigus ou anonymisés, et où la majeure partie des données est non pertinente par rapport à la requête spécifique.
- Intégration Complexe : Les jeux de données urbains présentent des relations spatiales, temporelles et sémantiques complexes. Les agents ne doivent pas seulement trouver les données, mais aussi comprendre comment joindre et intégrer ces sources hétérogènes (par exemple, faire correspondre un
region_id dans un jeu de données de population avec un id dans un jeu de données de limites administratives) afin d'effectuer l'analyse en aval.
Les benchmarks existants fournissent souvent les jeux de données nécessaires en amont, échouant ainsi à évaluer la capacité d'un agent à découvrir et connecter des sources de données au sein d'un référentiel bruyant et à grande échelle.
Méthodologie : Le cadre UrbanDS
Pour répondre à ces défis, les auteurs proposent UrbanDS, un système multi-agents guidé par un graphe conçu spécifiquement pour les tâches urbaines gourmandes en données. Le système opère en deux étapes distinctes : Construction du Graphe de Datasets et Exécution de la Tâche.
1. Construction du Graphe de Datasets
Avant toute exécution de tâche, UrbanDS organise le référentiel de données brutes en un graphe de connaissances structuré (G=(V,E)) afin d'éviter le coût d'une inspection systématique de chaque fichier pour chaque requête.
- Agent de Profilage de Données (Data Profiling Agent) : Cet agent explore chaque jeu de données une seule fois en utilisant du code Python pour générer une « Compétence de Jeu de Données » (Dataset Skill) réutilisable. Cette compétence résume le contenu, le schéma, les statistiques, la couverture spatio-temporelle et les instructions d'utilisation du jeu de données.
- Agent de Relation (Relation Agent) : Cet agent identifie les relations entre les jeux de données pour former les arêtes du graphe (E). Il modélise trois types de relations :
- Relations Spatiales et Temporelles : Déterminées par le chevauchement de la couverture géographique et des plages temporelles trouvées dans les compétences des datasets.
- Relations Sémantiques : Identifiées via un Codebook Sémantique. Le système construit un codebook incrémental d'identifiants d'entités (ex. : ID de régions) lors du profilage. Un Agent de Relation vérifie ensuite les connexions entre les champs assignés au même code, déterminant si elles peuvent être jointes malgré des noms de champs différents.
- Résultat : Un graphe de datasets où les nœuds représentent les jeux de données (avec leurs compétences/skills) et les arêtes représentent les connexions spatiales, temporelles ou sémantiques.
2. Exécution de la Tâche
Lorsqu'une requête utilisateur est reçue, le système exécute le flux suivant :
- Agent Planificateur (Planner Agent) : Récupère les jeux de données pertinents à partir du graphe. Il utilise une stratégie de récupération progressive :
- Il examine d'abord les noms et les descriptions courtes pour sélectionner des candidats prometteurs.
- Il lit ensuite l'intégralité des Compétences de Jeux de Données (Dataset Skills) des candidats.
- Il parcourt les arêtes du graphe pour découvrir les jeux de données voisins qui pourraient être pertinents, en vérifiant chaque choix par rapport à sa compétence avant de finaliser un Plan d'Analyse.
- Agents d'Exécution (Execution Agents) : Plusieurs agents collaborent pour exécuter le plan. Chaque agent gère une sous-tâche spécifique en écrivant et en exécutant du code. Ils partagent une mémoire commune contenant la progression de l'exécution, les résultats intermédiaires et les journaux (logs), permettant aux agents suivants de réutiliser les sorties sans recalcul. Si le plan initial manque de données suffisantes, les agents peuvent récupérer des jeux de données supplémentaires depuis le graphe.
- Agents de Rapport et de Révision (Report & Revision Agents) : Un Agent de Rapport synthétise les journaux expérimentaux en un rapport final. Un Agent de Révision permet un affinement itératif basé sur les retours de l'utilisateur, mettant à jour le rapport ou les artefacts sans redémarrer l'ensemble de la tâche.
Principales Contributions
- Système UrbanDS : La proposition d'un système multi-agents organisant les jeux de données urbains à grande échelle en un graphe de compétences et de relations réutilisables, permettant la découverte automatique, la planification, l'exécution et le reporting des données.
- Benchmark UrbanDS-Bench : La construction d'un benchmark complet pour la science des données urbaines. Il comprend :
- 94 jeux de données provenant de 10 grandes villes chinoises (couvrant les données géospatiales, de mobilité et socio-économiques).
- 450 tâches d'analyse de données (spatiales, temporelles et spatio-temporelles) et 8 tâches de modélisation de données.
- Un pool de données « plat » où les datasets sont anonymisés, obligeant les agents à se fier à l'inspection du contenu plutôt qu'au nom des fichiers.
- Validation Empirique : Des expériences approfondies démontrant que UrbanDS surpasse les agents de science des données existants et les agents de codage généraux dans les scénarios intensifs en données.
- Déploiement Réel : Déploiement réussi sur la plateforme d'opérations urbaines du district de Dongxihu, à Wuhan, supportant des analyses pratiques sur des données municipales réelles.
Résultats Expérimentaux
Les auteurs ont évalué UrbanDS contre plusieurs bases de référence incluant DS-Agent, Data Interpreter, DeepAnalyze, AutoGen et Claude Code sur UrbanDS-Bench et CoDA-Bench.
- Performance sur UrbanDS-Bench : UrbanDS a atteint une précision globale de 70,0 %, surpassant la base de référence la plus forte (Claude Code, 62,9 %) de 11,2 %. Il domine toutes les catégories de raisonnement : Spatiale (65,7 %), Temporelle (83,6 %) et Spatio-temporelle (73,9 %).
- Performance sur CoDA-Bench : UrbanDS a obtenu une précision de 46,2 %, soit une amélioration de 10,0 % par rapport à Claude Code, démontrant son efficacité dans les tâches générales de découverte de données.
- Modélisation de Données : UrbanDS obtient les meilleurs résultats sur les huit tâches de modélisation de données. Notamment, pour la prédiction de point d'intérêt (POI) check-in, il a atteint un R2 de 0,464, tandis que toutes les autres bases produisaient des valeurs R2 négatives, indiquant sa capacité supérieure à exploiter des jeux de données auxiliaires pour la construction de modèles.
- Étude d'Ablation : Supprimer les Relations de Datasets réduit la précision globale de 13,3 % en moyenne, soulignant l'importance de la découverte guidée par le graphe. Supprimer les Compétences de Datasets cause une chute plus importante (20,6 % en moyenne), particulièrement dans les tâches spatio-temporelles, confirmant que la connaissance structurée du contenu des données est critique pour une intégration correcte.
- Scalabilité : La performance de toutes les méthodes décline à mesure que le nombre de jeux de données requis augmente (les tâches nécessitant 4+ datasets voient leur précision descendre sous les 53 % pour toutes les méthodes), bien que UrbanDS maintienne la performance relative la plus élevée.
Signification et Revendications
L'article affirme qu'UrbanDS comble une lacune critique dans la recherche actuelle sur les agents LLM : la capacité à opérer dans des environnements intensifs en données où le principal goulot d'étranglement n'est pas la génération de code, mais la découverte et l'intégration de données.
- Au-delà des entrées prédéfinies : Contrairement aux précédents benchmarks qui fournissent les jeux de données nécessaires, UrbanDS-Bench évalue la capacité de l'agent à naviguer dans un référentiel vaste et hétérogène pour trouver « l'aiguille dans la botte de foin ».
- Efficacité Guidée par le Graphe : Le système démontre que la pré-organisation des données en un graphe de compétences et de relations réduit considérablement la charge sur la fenêtre de contexte des LLM et améliore la précision de la sélection des datasets.
- Utilité Pratique : Le déploiement à Wuhan et l'étude utilisateur (montrant une accélération de 5,6x du temps d'analyse) suggèrent que le système n'est pas seulement une amélioration théorique, mais un outil viable pour accélérer l'analyse de données urbaines réelles.
- Limites : Les auteurs notent modestement que le système se concentre actuellement sur l'exécution de requêtes spécifiées par l'utilisateur. Il ne possède pas encore la capacité d'explorer activement les référentiels sans questions prédéfinies ou de proposer de nouvelles hypothèses de recherche à partir de schémas de données. Les travaux futurs visent à étendre le système vers ces capacités plus ouvertes.