Résumé Technique : DataSpace : Évaluer les agents de données pour une analyse vérifiable sur des espaces de travail hétérogènes
1. Énoncé du Problème
Les agents de données émergent comme des interfaces en langage naturel pour les données organisationnelles, pourtant les contextes analytiques réalistes présentent un défi complexe : la preuve requise pour répondre à une requête est rarement contenue dans un tableau unique et propre. Au contraire, l'information est dispersée entre des bases de données relationnelles, des fichiers structurés/semi-structurés (CSV, JSON), des documents longs (PDF, Markdown) et des artefacts multimédias (vidéo), impliquant souvent des variations translinguistiques.
Les benchmarks existants échouent à unifier trois propriétés critiques de l'analyse de données réaliste :
- Portée de l'espace de travail (Workspace Scope) : Ils isolent souvent l'interrogation structurée (ex. : Spider) ou la recherche non structurée (ex. : HotpotQA), échouant ainsi à capturer les tâches nécessitant la découverte et l'intégration de preuves à travers des modalités hétérogènes au sein d'un espace de travail local à la tâche.
- Contrat de sortie (Output Contract) : De nombreux benchmarks acceptent des réponses factuelles, des rapports ouverts ou des pipelines exécutables. L'analyse réelle exige souvent un résultat tabulaire complet et typé qui peut être directement consommé.
- Sémantique d'évaluation : Les évaluations actuelles reposent souvent sur des juges basés sur des modèles ou ne parviennent pas à gérer de manière déterministe les représentations équivalentes (ex. : ordres de colonnes différents, formulation des en-têtes ou précision numérique).
L'article soutient que sans un benchmark unifié imposant un contrat de sortie tabulaire complet sur des espaces de travail translinguistiques et hétérogènes avec une évaluation déterministe, le progrès de la fiabilité des agents de données ne peut être mesuré avec précision.
2. Méthodologie
2.1 Benchmark DataSpace
DataSpace est un benchmark comprenant 410 tâches translinguistiques et 7 439 artefacts totalisant 15,01 Go.
- Modalités : Les espaces de travail incluent CSV, JSON, SQLite, Markdown, PDF et Vidéo.
- Langues : Les tâches impliquent des scénarios translinguistiques où la question et les artefacts de l'espace de travail peuvent mélanger le chinois et l'anglais.
- Formulation de la tâche : Un agent reçoit une question en langage naturel et un espace de travail local à la tâche. Il doit découvrir de manière autonome les sources, aligner les entités/schémas, exécuter des calculs multi-étapes (filtrage, jointure, agrégation) et retourner le résultat tabulaire complet demandé sous forme de fichier CSV.
- Domaines : Analyse financière (fonds, actions), données macroéconomiques et analyse de santé.
2.1 DataSpace-Builder : Cadre de construction
Pour construire ces tâches complexes de manière fiable, les auteurs proposent DataSpace-Builder, un cadre fondé sur l'exécution qui transforme des instances issues de benchmarks Text-to-SQL existants (EHRSQL et BULL) en tâches d'espaces de travail hétérogènes. Le processus comprend quatre étapes :
- Transformation Translinguistique (CLT) : Une migration conjointe de la question, de l'état de la base de données et du SQL exécutable. Elle assure la cohérence référentielle en traduisant les noms d'entités et les valeurs tout en préservant les identifiants et les codes. Un juge LLM vérifie l'alignement sémantique entre la question traduite et le SQL.
- Échantillonnage Relationnel Sensible aux Contraintes : Pour éviter des espaces de travail répétitifs, le cadre échantillonne des lignes de la base de données source tout en conservant le schéma complet. Il utilise un ensemble de sauvegarde (clés primaires/étrangères, prédicats de requête) pour garantir l'intégrité relationnelle (ex. : préservation des chemins de jointure) lors de l'échantillonnage.
- Routage de Modalité et Rendu d'Artefact :
- Routage de Base : Les tableaux sont assignés à des rendus (CSV, JSON, SQLite, Markdown, PDF) basés sur les propriétés du schéma.
- Rendu de Document : Des documents longs (Markdown/PDF) sont générés à partir de données tabulaires via des LLM, garantissant une génération "fondée sur les faits" où des cellules spécifiques sont récupérables dans le texte.
- Rendu Vidéo : Les données tabulaires sont converties en vidéos d'insights de données. Deux stratégies sont utilisées : l'Abstraction de Prédicat (déplacement des conditions de filtrage dans la narration vidéo) et le Rendu de Preuve-Réponse (distribution des cellules de résultat à travers les scènes vidéo).
- Revue Humaine et Réparation de Tâche : Un panel de 11 experts du domaine effectue des revues aveugles et indépendantes. Ils résolvent la tâche, vérifient la référence (gold standard) et rédigent la configuration d'évaluation. Les désaccords déclenchent des réparations fondées sur des preuves concernant la question, l'espace de travail ou la réponse de référence.
2.3 Évaluateur Déterministe
Le protocole d'évaluation est sans modèle (model-free) et invariant par rapport aux en-têtes :
- Alignement des Colonnes : L'évaluateur trouve une correspondance un-à-un entre les colonnes prédites et de référence, indépendamment de la formulation ou de l'ordre des en-têtes.
- Normalisation : Les valeurs sont normalisées selon les types sémantiques (texte, nombre, date, booléen) et les règles de précision (ex. : décimales, conventions de pourcentage).
- Comparaison de Lignes : Les tâches nécessitant un ordre sont comparées comme des séquences ; les autres sont comparées comme des multiensembles non ordonnés.
- Scoring : Une tâche est correcte uniquement si la prédiction tabulaire complète correspond à la référence selon ces sémantiques.
3. Contributions Clés
- Un Benchmark d'Espace de Travail Hétérogène : DataSpace introduit 410 tâches nécessitant la synthèse de fichiers structurés, de bases de données, de documents longs et de vidéos en un seul résultat tabulaire vérifiable.
- Un Cadre de Construction Fondé sur l'Exécution : DataSpace-Builder transforme des ressources Text-to-SQL exécutables en tâches multimodales complexes, garantissant la cohérence des données grâce à des sauvegardes d'échantillonnage et une revue d'experts.
- Un Évaluateur Sensible à la Sémantique : Un protocole déterministe qui tolère les représentations équivalentes (réordonnancement des colonnes, formatage) tout en rejetant les sorties incomplètes ou erronées, éliminant ainsi le recours aux juges LLM.
- Résultats Empiriques : L'article établit des lignes de base de performance pour six modèles multimodaux de pointe et cinq harnais d'agents, identifiant les goulots d'étranglement spécifiques des capacités actuelles des agents.
4. Résultats Expérimentaux
Les auteurs ont évalué six backbones multimodaux (Grok 4.5, GPT-5.6 Sol, Kimi K3, MiMo-V2.5, Claude Sonnet 5, MiniMax M3) et cinq harnais d'agents (incluant leur propre DataSpace-Agent).
- Performance Globale : La configuration la plus performante (Grok 4.5 avec DataSpace-Agent) a atteint 66,34 % de précision. Cela indique que le benchmark est non saturé, puisque 76 tâches ont été manquées par les six backbones, tandis que seulement 56 tâches ont été résolues par tous les modèles.
- Impact du Harnais : Le choix du harnais d'agent impacte significativement la performance. Avec le backbone MiMo-V2.5 fixé, la précision varie de 15,36 points de pourcentage selon les harnais (allant de 30,98 % à 46,34 %).
- Défis Clés :
- Intégration Multimodale : Les tâches nécessitant des preuves multimodales ont systématiquement réduit la précision de 1,8 à 14,0 points par rapport aux tâches unimodales.
- Jointures : Les opérations de jointure ont réduit la précision de 9,7 à 19,8 points.
- Efficacité : GPT-5.6 Sol a atteint une précision proche du sommet (64,63 %) en utilisant 74,2 % de tokens en moins et 50,3 % d'actions en moins que le meilleur performeur, Grok 4.5.
- Analyse d'Échec : Un audit de 136 échecs de Grok 4.5 a révélé que 52,2 % des erreurs provenaient de la matérialisation de la réponse (ex. : ajout ou omission de colonnes ou de lignes après le calcul correct du résultat interne), plutôt que de la découverte ou de l'extraction de preuves. Seuls 5 cas de "non-soumission" étaient des échements de terminaison pure ; la plupart découlaient d'erreurs persistantes antérieures.
5. Signification et Revendications
L'article affirme que DataSpace établit un banc d'essai rigoureux pour faire progresser les agents de données fiables. Sa principale importance réside dans le passage d'une évaluation de compétences isolées (ex. : génération SQL ou recherche documentaire) à une résolution d'espace de travail de bout en bout avec un contrat de sortie strict et vérifiable.
Les auteurs concluent modestement que bien que les modèles de pointe actuels soient prometteurs, des lacunes importantes subsistent dans l'intégration cross-modalité et les jointures. Le benchmark souligne que la capacité à "trouver" des données est insuffisante ; les agents doivent également matérialiser fidèlement la structure exacte de la sortie demandée. Les résultats suggèrent que l'amélioration de la fiabilité des agents de données nécessite d'adresser l'intégralité du pipeline, de la découverte de preuves hétérogènes à la sérialisation tabulaire précise, plutôt que de se concentrer uniquement sur les capacités de raisonnement.
DataSpace sert de benchmark d'évaluation officiel pour la compétition KDD Cup 2026 Data Agents for Complex Data Analysis, fournissant un environnement standardisé et reproductible pour la recherche future dans ce domaine.