← Nieuwste papers
💻 computer science

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

Dit artikel introduceert DataSpace, een uitgebreide benchmark en KDD Cup 2026-evaluatiekader ontworpen om het vermogen van data-agenten te beoordelen om verifieerbare tabelgegevens te genereren uit heterogene, multimodale werkruimten, waarbij significante prestatiekloven in multimodale bewijsintegratie en de substantiële impact van keuzes in de harness van de agent op de betrouwbaarheid worden onthuld.

Oorspronkelijke auteurs: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

Gepubliceerd 2026-08-05
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar je aanwijzingen liggen overal verspreid. Sommige staan in een net overzichtelijk spreadsheet op je computer, andere zijn begraven in een PDF-rapport van 50 pagina's, weer andere zitten verborgen in een database, en de belangrijkste aanwijzing zou wel eens een video van een beveiligingscamera kunnen zijn. Dit is de dagelijkheid van "data agents"—slimme computerprogramma's die zijn ontworben om vragen te beantwoorden door te zoeken door de rommelige digitale bestanden van een organisatie. Lange tijd testten wetenschappers deze agents op schone, enkelvoudige puzzels, zoals het vinden van een naam in een telefoonboek of het stellen van een eenvoudige vraag aan een database. Maar in de echte wereld is data een chaotische mix van talen, formaten en media. De grote vraag die onderzoekers stellen is: kunnen deze digitale detectives daadwerkelijk een compleet verhaal in elkaar puzzelen uit een rommelige stapel bewijsmateriaal, of raken ze verdwaald wanneer de aanwijzingen er niet allemaal hetzelfde uitzien?

Dit artikel introduceert een nieuwe, super uitdagende test genaamd DataSpace om precies te zien hoe goed deze data agents zijn in het oplossen van deze rommelige, echte mysteries. De onderzoekers bouwden een enorme speeltuin met 410 verschillende taken en 7.439 digitale artefacten (bestanden) met een totaal van 15,01 GB aan data. Ze hebben niet zomaar willekeurige bestanden bij elkaar gegooid; ze creëerden een "heterogene werkruimte" waar een enkele vraag je kan vereisen om een video te bekijken, een PDF te scannen, een database te bevragen en een JSON-bestand te kruisverwijzen, terwijl je tegelijkertijd werkt met aanwijzingen geschreven in zowel het Engels als het Chinees. Het doel is niet alleen om één enkel feit te vinden; de agent moet een volledige, verifieerbare tabel met antwoorden produceren, zoals een definitief rapportcijfer.

De resultaten van deze test zijn een beetje een waarschuwing. Zelfs de slimste, meest geavanceerde AI-modellen die werden getest (inclusief reuzen zoals Grok 4.5 en GPT-5.6) slaagden er slechts in om ongeveer 66,34% van de taken correct op te lossen. Dat betekent dat ze ongeveer één op de drie puzzels fout hadden. De onderzoekers ontdekten dat de agents het moeilijkst hebben wanneer ze informatie uit verschillende soorten media moeten combineren (zoals een aanwijzing uit een video koppelen aan een spreadsheet) of wanneer ze complexe "joins" moeten uitvoeren (het verbinden van gegevens uit twee verschillende bronnen). Interessant genoeg deed de keuze van de "harness"—het softwareframework dat de AI vertelt hoe hij zijn tools moet gebruiken—er bijna evenveel toe als het AI-brein zelf, wat zorgde voor een verschil van 15,36 punten in de scores.

Uiteindelijk laat het artikel zien dat hoewel data agents steeds beter worden, ze nog lang niet perfect zijn. Ze krijgen vaak de juiste getallen, maar falen in het correct formatteren van de uiteindelijke tabel, of ze missen een cruciale aanwijzing die verborgen zit in een video. De auteurs concluderen dat we nog een lange weg te gaan hebben voordat we deze agents volledig kunnen vertrouwen om complexe, multi-format data-analyses zelfstandig af te handelen, en zij hebben deze benchmark geleverd als een kaart om toekomstige ingenieurs te helpen deze specifieke zwakheden aan te pakken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →