← Nieuwste papers
💬 NLP

TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning

Dit artikel introduceert TimeSage-MT, een multi-turn benchmark bestaande uit 240 taken over acht real-world domeinen om het agentische tijdreeksredeneren te evalueren, waarbij significante prestatiekloven in huidige LLM's met betrekking tot geheugen, onzekerheidshantering en besluitvorming worden onthuld, terwijl het een fundament biedt voor toekomstige ontwikkeling.

Oorspronkelijke auteurs: Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe financieel analist, een weervoorspeller of een specialist in ziekenhuisdata inhuurt. Je wilt niet alleen dat ze naar een spreadsheet kijken en een getal raden. Je wilt dat ze bij je gaan zitten, verhelderende vragen stellen, hun werk controleren, van gedachten veranderen als je ze nieuwe informatie geeft, en je uiteindelijk een solide plan geven op basis van bewijs.

Dit artikel introduceert TimeSage-MT, een "eindexamen" ontworpen om te testen of AI-agenten (slimme computerprogramma's) dit soort realistische, meerstaps tijdreeksanalyse daadwerkelijk kunnen uitvoeren.

Hier is de uitsplitsing in eenvoudige termen:

1. Het Problek: De "One-Shot" Valstrik

De meeste AI-tests van vandaag zijn als een onverwachte toets: "Hier is een grafiek van aandelenkoersen. Wat wordt het morgen?" De AI raadt een getal, krijgt een score, en de test is voorbij.

  • De Realiteit: Het echte leven is geen onverwachte toets. Een echte analist zegt: "Wacht even, de data ziet er vreemd uit. Laat me controleren op fouten. Oh, er is een effect door een feestdag. Laten we dat aanpassen. Gezien dat, moeten we kopen of verkopen?"
  • De Kloof: Huidige AI-modellen zijn erg goed in de "onverwachte toets", maar falen vaak wanneer het gesprek lang, complex wordt of wanneer het vereist is om te onthouden wat er vijf minuten geleden is gezegd. Ze kunnen getallen hallucineren of de data die ze net hebben bekeken, vergeten.

2. De Oplossing: Het "TimeSage-MT" Examen

De auteurs hebben een enorme, realistische testsuite gebouwd genaamd TimeSage-MT. Zie het als een simulatiespel waarbij de AI de rol van een datadetective moet aannemen.

  • De Opzet: Het bevat 240 verschillende scenario's verspreid over 8 echte werelden (zoals finance, gezondheidszorg, energie en retail).
  • Het Gesprek: In plaats van één vraag, is elk scenario een multi-turn gesprek (zoals een chat) variërend van 3 tot 20 berichten lang.
  • De Moeilijkheidsgraden:
    • Niveau 1 (Open Exploratie): "Hé, hoe ziet deze data eruit?" (Basale profilering).
    • Niveau 2 (Multi-Skill): "Zoek de vreemde pieken en voorspel dan de volgende week." (Taken ketenen).
    • Niveau 3 (Gegronde Synthese): "Combineer de voorspelling en de anomaliecheck om een rapport te schrijven." (Alles samenvoegen).
    • Niveau 4 (Volledige Besluitvorming): "Op basis van dit alles, moeten we het elektriciteitsnet afsluiten of juist aan laten staan?" (Beslissingen nemen met hoge inzet).

3. Hoe Ze Het Gebouwd Hebben (De "Fabriek")

Het creëren van een test waarbij de antwoorden 100% correct zijn, is moeilijk. Als je een AI vraagt om de test te maken, kan deze liegen.

  • De Fabriek: De auteurs bouwden een "reproduceerbare pipeline". Ze namen echte data, gebruikten strikte computercode om de ware antwoorden te berekenen (de "gouden standaard"), en gebruikten vervolgens een AI om het gesprek rondom die antwoorden te genereren.
  • Het Veiligheidsnet: Ze hebben een "Quality Control"-team (zowel menselijk als geautomatiseerd) dat elke test controleert om er zeker van te zijn dat de AI het antwoord niet per ongeluk in de vraag heeft gelekt of feiten heeft verzonnen.

4. De "TimeSage" Agent

Om te laten zien hoe de test werkt, bouwden ze hun eigen AI-agent genaamd TimeSage.

  • De Gereedschapskist: In plaats van alleen te raden, heeft TimeSage een bibliotheek van 226 specifieke tools (vaardigheden) voor tijdreeks wiskunde. Het is alsoك een monteur een volledige set moersleutels geven in plaats van alleen te vragen om "de auto te repareren" met de blote handen.
  • Het Proces: TimeSage plant zijn stappen, controleert zijn werk en spreekt alleen wanneer hij beschikt over bewijs ondersteund door code.

5. De Resultaten: Wat Er Gebeurde?

Ze testten de slimste AI-modellen ter wereld (zoals GPT-5, Claude en anderen) tegen dit examen. Dit is wat ze vonden:

  • Het "Code" Voordeel: Wanneer de AI werd toegestaan om Python-code te schrijven en uit te voeren om de wiskunde te doen, werd hij veel beter. Wanneer de AI probeerde getallen uit zijn geheugen te "raden", faalde het hopeloos.
  • De "Geheugen" Daling: Naarmate de gesprekken langer werden (van Niveau 1 naar Niveau 4), daalde de prestatie van de AI scherp. Ze waren goed in de eerste paar beurten, maar begonnen eerdere feiten te vergeten of verzonnen getallen naarmate de chat voortduurde.
  • De "Besluitvormings" Kloof: De AI was redelijk in het beschrijven van data, maar slecht in het nemen van beslissingen. Het had moeite met zeggen: "Omdat X gebeurde, moeten we Y doen," vooral wanneer er sprake was van onzekerheid.
  • De "Tool" Trade-off: Het geven van een gestructureerd "TimeSage" systeem (met strikte regels en een planner) hielp de AI om nauwkeuriger te zijn met getallen, maar maakte het soms slechter in het schrijven van natuurlijke, flexibele rapporten. Het is een afweging tussen een rigide rekenmachine en een flexibele gesprekspartner zijn.

6. De Belangrijkste Conclusie

Het artikel concludeert dat hoewel AI slimmer wordt, het nog steeds moeite heeft met betrouwbare, langetermijnredenering in tijdreeksdata.

  • Het kan niet altijd de context onthouden.
  • Het kan niet altijd omgaan met onzekerheid (zeggen "Ik weet het niet zeker" versus het verzinnen van een getal).
  • Het heeft moeite om data om te zetten in een echte wereldwijde beslissing.

TimeSage-MT is nu een publieke leaderboard waar iedereen zijn AI-agenten kan testen om te zien of ze daadwerkelijk een echt beroep kunnen uitoefenen, en niet alleen een onverwachte toets kunnen maken. Het dwingt ontwikkelaars om niet alleen naar het uiteindelijke antwoord te kijken, maar naar hoe de AI daar gekomen is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →