← Nieuwste papers
🤖 AI

Towards Verifiable Agentic Data Science: Solving Irregular TSQA Via Tool-Grounded Reasoning

Dit artikel introduceert IRTS-ToolBench, een uitgebreide benchmark bestaande uit 1.700 vragen over 13 domeinen, ontworpen om de prestaties van grote taalmodellen en AI-agenten bij taken met betrekking tot onregelmatige tijdreeksbeantwoording te evalueren en te verbeteren, waarmee het kritieke gat wordt opgevuld dat wordt achtergelaten door bestaande benchmarks die uitgaan van regelmatige bemonstering.

Oorspronkelijke auteurs: Sanhorn Chen, Xiaoyang Chen, Boyu Liu, Roy Zhao

Gepubliceerd 2026-06-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sanhorn Chen, Xiaoyang Chen, Boyu Liu, Roy Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed onderlegde robot probeert te leren hoe hij het ritme van de wereld kan begrijpen. Meestal, wanneer we robots over tijd leren, geven we ze data die tikt als een perfecte klok: één seconde, twee seconden, drie seconden. Het is netjes, ordelijk en voorspelbaar.

Maar in de echte wereld tikt het leven niet als een klok. Soms slaat een hartmonitor een slag over omdat een verpleegkundige het druk heeft. Soms stuurt een weersensor geen gegevens omdat er een vogel op is geland. Soms pauzeert een beursfeed omdat het internet een hapering heeft. Dit is onregelmatige tijdreeksdata: informatie die op willekeurige tijden binnenkomt, met gaten, en soms ontbrekende stukjes die eigenlijk een verhaal vertellen over waarom ze ontbreken.

Het paper dat je hebt gedeeld, "Towards Verifiable Agentic Data Science," gaat over het bouwen van een nieuwe trainingsgrond (een benchmark) om te zien of onze slimste AI-robots met deze rommelige, chaotische echte wereld kunnen omgaan.

Hier is de uitsplitsing van hun werk met behulp van eenvoudige analogieën:

1. Het Probleem: De "Perfecte Klok" versus Het "Rommelige Dagboek"

De meeste eerdere tests voor AI gingen ervan uit dat de data een perfecte klok was. De auteurs zeggen: "Dat is niet hoe de echte wereld werkt."

  • De Oude Manier: Stel je voor dat je een student vraagt een verhaal te lezen waarbij elke zin precies even lang is en perfect uit elkaar staat.
  • De Echte Wereld: Stel je voor dat je diezelfde student vraagt een dagboek te lezen waarbij sommige pagina's zijn uitgescheurd, sommige inzendingen in een haast zijn geschreven, en sommige dagen zijn overgeslagen omdat de schrijver ziek was.
  • De Kloof: De auteurs merkten op dat niemand een eerlijke test had gebouwd om te zien of AI dit "rommelige dagboek" kon lezen. Bestaande tests waren te makkelijk omdat ze alleen de "perfecte klok"-data gebruikten.

2. De Oplossing: IRTS-ToolBench (De Nieuwe Trainingsgrond)

Het team heeft een enorme nieuwe test gebouwd genaamd IRTS-ToolBench. Zie dit als een "Gym voor AI" die specifiek is ontworig voor onregelmatige data.

  • De Omvang: Het bevat 1.700 vragen verspreid over 13 verschillende werelden (zoals de gezondheidszorg, financiën en het weer) en 10 verschillende soorten puzzels.
  • Het Doel: Om te zien of een AI naar een rommelige, gatentijdlijn kan kijken en vragen kan beantwoorden als: "Was er hier een piek in de hartslag?" of "Waarom stopte de sensor met werken?"

3. Hoe Ze Het Gebouwd Hebben: De "Magische Transformatie"-machine

Je kunt niet zomaar een perfecte klok nemen en willekeurig getallen verwijderen; dat creëert valse, onzinnige data. De auteurs hebben een speciale driestaps-pipeline gemaakt om perfecte data om te zetten in realistische, rommelige data:

  1. Contextverrijking: Ze vroegen een AI om zich het verhaal achter de data voor te stellen (bijv. "Dit is een hartmonitor in een druk ziekenhuis").
  2. Taxonomie Selectie: Op basis van dat verhaal besloot de AI hoe de data rommelig zou worden. Heeft een verpleegkundige een meting gemist? Is een sensor kapotgegaan? Ze gebruikten een specifieke "menukaart" van 9 realistische redenen voor ontbrekende data.
  3. Parametergeneratie: De AI paste vervolgens die specifieke "rommelige" regels wiskundig toe op de data, waardoor een realistische simulatie van een defecte of onregelmatige tijdlijn ontstond.

4. De Toolkit: De AI "Handen" Geven

Het paper introduceert een cruciaal idee: Tool-Grounded Reasoning.
In plaats van de AI alleen maar te vragen om een antwoord uit zijn brein te "raden", hebben ze het een gereedschapskist van 30 digitale instrumenten gegeven.

  • De Analogie: Stel je voor dat je een detective vraagt een misdaad op te lossen.
    • Zonder gereedschap: De detective moet het antwoord raden door alleen naar de scène te kijken.
    • Met gereedschap: De detective heeft een vergrootglas, een vingerafdrukkit en een rekenmachine.
  • De Gereedschappen: De AI kan gereedschap gebruiken om verschillende tijdstempels te "alignen", gaten "in te vullen", of te "tellen" hoe vaak een sensor een slag heeft gemist. De benchmark bevat een "Golden Tool Set" voor elke vraag—de exacte lijst met gereedschappen die de AI zou moeten hebben gebruikt om het juiste antwoord te krijgen.

5. De Test: Wat Er Gebeurde?

Ze hebben verschillende top-tier AI-modellen (zowel commerciële zoals Claude als open-source zoals Qwen) getest in deze nieuwe gym.

  • Het Goede Nieuws: Wanneer de AI werd toegestaan om zijn gereedschappen te gebruiken, werd hij veel beter in het oplossen van de puzzels. Het was alsof je de detective het vergrootglas gaf; plotseling kon hij de aanwijzingen zien die hij eerder miste.
  • Het Slechte Nieuws: Zelfs met gereedschap worstelde de AI nog steeds met de moeilijkste puzzels, zoals het achterhalen van de diepe "oorzaak" van waarom data ontbrak of het voorspellen van wat er gebeurt in een chaotische sequentie.
  • Het Verdict: De AI wordt slimmer, maar heeft nog veel hulp nodig (scaffolding) om met de rommelige, onregelmatige data van de echte wereld om te gaan.

Samenvatting

De auteurs hebben een nieuwe, realistische test gebouwd om te zien of AI kan omgaan met data die niet perfect is. Ze kwamen tot de conclusie dat, hoewel AI beter wordt, het echt een "gereedschapskist" nodig heeft om betekenis te geven aan de gaten en onregelmatigheden in real-world data. Zonder deze tools is de AI als een student die een gescheurd boek probeert te lezen zonder vergrootglas—hij kan wel gokken, maar hij krijgt het vaak fout.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →