← Derniers articles
💻 computer science

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

Cet article présente DataSpace, un benchmark complet et un cadre d'évaluation pour la KDD Cup 2026 conçu pour évaluer la capacité des agents de données à générer des résultats tabulaires vérifiables à partir d'espaces de travail hétérogènes et multimodaux, révélant des écarts de performance significatifs dans l'intégration de preuves multimodales ainsi que l'impact substantiel des choix de harnais d'agents sur la fiabilité.

Auteurs originaux : Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

Publié 2026-08-05
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective tentant de résoudre un mystère, mais que vos indices sont éparpillés partout. Certains se trouvent dans un tableur bien ordonné sur votre ordinateur, d'autres sont enfouis dans un rapport PDF de 50 pages, certains sont cachés à l'intérieur d'une base de données, et l'indice le plus important pourrait être une vidéo d'une caméra de surveillance. C'est la réalité quotidienne des « agents de données » — des programmes informatiques intelligents conçus pour répondre à des questions en traquant les fichiers numériques désordonnés d'une organisation. Pendant longtemps, les scientifiques ont testé ces agents sur des puzzles propres et de type unique, comme chercher un nom dans un annuaire ou poser une question simple à une base de données. Mais dans le monde réel, les données sont un mélange chaotique de langues, de formats et de supports. La grande question que se posent les chercheurs est la suivante : ces détectives numériques peuvent-ils réellement reconstituer une histoire complète à partir d'un tas d'indices désordonnés, ou se perdent-ils lorsque les indices ne se ressemblent pas ?

Cet article présente un nouveau test super exigeant appelé DataSpace pour voir exactement à quel point ces agents de données sont performants pour résoudre ces mystères désordonnés du monde réel. Les chercheurs ont construit un terrain de jeu massif contenant 410 tâches différentes et 7 439 artefacts numériques (fichiers) totalisant 15,01 Go de données. Ils n'ont pas simplement jeté des fichiers au hasard ; ils ont créé un « espace de travail hétérogène » où une seule question pourrait nécessiter de regarder une vidéo, de parcourir un PDF, d'interroger une base de données et de croiser un fichier JSON, tout en gérant des indices écrits à la fois en anglais et en chinois. L'objectif n'est pas seulement de trouver un fait isolé ; l'agent doit produire un tableau complet et vérifiable de réponses, tel un bulletin de notes final.

Les résultats de ce test sont un peu un signal d'alarme. Même les modèles d'IA les plus intelligents et les plus avancés testés (incluant des géants comme Grok 4.5 et GPT-5.6) n'ont réussi à résoudre qu'environ 66,34 % des tâches correctement. Cela signifie qu'ils ont raté environ un puzzle sur trois. Les chercheurs ont constaté que les agents éprouvent le plus de difficultés lorsqu'ils doivent combiner des informations provenant de différents types de médias (comme joindre un indice vidéo à un tableur) ou lorsqu'ils doivent effectuer des « jointures » complexes (connecter des données provenant de deux sources différentes). Curieusement, le choix du « harness » — le cadre logiciel qui indique à l'IA comment utiliser ses outils — importait presque autant que le cerveau de l'IA lui-même, provoquant une différence de 15,36 points dans les scores.

En fin de compte, l'article montre que si les agents de données s'améliorent, ils sont loin d'être parfaits. Ils obtiennent souvent les bons chiffres mais échouent à formater correctement le tableau final, ou passent à côté d'un indice crucial caché dans une vidéo. Les auteurs concluent qu'il nous reste encore un long chemin à parcourir avant que ces agents ne puissent être pleinement dignes de confiance pour gérer l'analyse de données multi-formats complexes de manière autonome, et ils ont fourni ce benchmark comme une carte pour aider les futurs ingénieurs à corriger ces faiblesses spécifiques.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →