Agentic Time Machine as an Infrastructure for Future-Event Forecasting
Dit artikel introduceert de Agentic Time Machine, een infrastructuur die historische webtoestanden reconstrueert om een efficiënte en realistische evaluatie van voorspellende agenten mogelijk te maken, naast een multi-agent framework dat state-of-the-art prestaties behaalt op zowel retrospectieve benchmarks als live FutureX leaderboards.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je de winnaar van een voetbalwedstrijd probeert te voorspellen die aanstaande zaterdag plaatsvindt. Je hebt een superintelligente AI-assistent (een Large Language Model) om je te helpen. Maar er is een addertje onder het gras: als je de AI vandaag een vraag stelt, kan het zijn dat de AI per ongeluk een sportwebsite bekijkt waar de einduitslag al op staat, omdat het internet nooit vergeet.
Dit artikel introduceert twee belangrijke zaken om dit probleem op te lossen en de AI een betere voorspeller te maken: een Tijdsmachine en een Team van Experts.
1. Het Probleem: Het "Spoiler"-internet
Het testen van hoe goed een AI is in het voorspellen van de toekomst, is momenteel als een spelletje "Simon Says" met een kapot regelboek.
- Het "Live" Spel: Je wacht tot de echte gebeurtenis heeft plaatsgevonden, en vraagt het de AI daarna. Dit is eerlijk, maar het duurt weken of maanden voordat je resultaten hebt. Het is alsof je wacht tot een film is afgelopen voordat je er een recensie over kunt schrijven.
- Het "Bevroren" Spel: Je gebruikt oude, statische data. Dit is snel, maar de AI kan niet op het live web surfen, dus het is geen realistische test.
- Het "Lekkage"-probleen: Als je probeert de AI te testen op gebeurtenissen uit het verleden met behulp van het live web van vandaag, zal de AI valsspelen. De AI vindt het antwoord in een nieuwsartikel van gisteren dat zegt: "Team A won met 2-1." De test gaat dan niet meer over voorspellen; het is slechts het opzoeken van het antwoord.
2. De Oplossing: De Agentic Tijdsmachine
De auteurs hebben een digitale Tijdsmachine gebouwd. Denk aan een zeer strikte bibliothecaris die de toegang van de AI tot het internet bewaakt.
- Hoe het werkt: Wanneer de AI een vraag stelt over een gebeurtenis die op 17 januari plaatsvond, onderschept de Tijdsmachine elk zoekresultaat.
- De Filter: De bibliothecaris (een AI-filter) leest elk zoekresultaat en stelt twee vragen:
- Zegt deze pagina het antwoord direct? (bijv. "Coventry won met 2-1"). Zo ja, Verbieden!
- Heeft deze pagina een datum later dan 17 januari? (bijv. een interview na de wedstrijd van 19 januari). Zo ja, Verbieden!
- Het Resultaat: De AI ziet alleen het web precies zoals het was op 17 januari. De AI moet een voorspelling doen op basis van aanwijzingen die beschikbaar waren voordat de wedstrijd begon, precies zoals een menselijke voorspeller dat zou doen.
Dit stelt onderzoekers in staat om de AI direct te testen (snelle feedback) zonder dat de AI in de toekomst kijkt door te spieken (hoge getrouwheid).
3. De Strategie: Het Planner-Solver-Aggregator Team
Zodra ze een eerlijk testveld hadden, moesten ze een betere manier vinden voor de AI om na te denken. In plaats van één AI al het werk te laten doen, creëerden ze een driepersoons-team:
- De Planner (De Coach): Deze AI bekijkt de vraag (bijv. "Krijgt deze film een Oscar?") en breekt deze af. Hij zegt: "Oké, laten we hier vanuit drie hoeken naar kijken: 1. Wat zeggen de critici? 2. Wat zijn de box office-cijfers? 3. Wat is het campagnebudget?" Hij wijst deze taken toe aan verschillende teamgenoten.
- De Solvers (De Verkenners): Dit zijn drie aparte AI-agenten. Elke één gaat op pad om bewijs te verzamelen alleen voor hun specifieke invalshoek. De een kijkt naar recensies, de ander naar geld, de derde naar nieuws. Ze werken parallel, zoals verkenners die in verschillende richtingen rennen.
- De Aggregator (De Generaal): Deze AI verzamelt alle rapporten van de verkenners. Hij zoekt naar tegenstrijdigheden. Als Verkenner A "Ja" zegt en Verkenner B "Nee", graaft de Generaal dieper om uit te zoeken wie er gelijk heeft. Hij combineert al het bewijs tot één uiteindelijke, goed onderbouwde voorspelling.
4. De Resultaten: Werkt het?
Het artikel beweert dat dit systeem een groot succes is:
- Op de Test: Wanneer ze de Tijdsmachine gebruikten om hun systeem te testen op gebeurtenissen uit het verleden, scoorde het hoger dan elke andere methode, inclusclusief systemen die simpelweg dezelfde vraag vijf keer stelden en een stemming hielden.
- In de echte wereld: Ze namen deel aan een live, real-time voorspellingscompetitie genaamd FutureX.
- Ze bezetten de 1e plaats in de eerste week van mei.
- Ze behielden de 1e plaats op de algemene ranglijst gedurende acht weken achter elkaar (per 17 juni 2026).
- De Connectie: Het artikel bewijst dat als een AI goed presteert op hun "Tijdsmachine"-test, het ook goed zal presteren in de echte, live wereld. Dit betekent dat onderzoekers nu snel nieuwe ideeën kunnen testen zonder maanden te moeten wachten op echte wereldresultaten.
Samenvattende Analogie
Stel je voor dat je de winnaar van een paardenrace probeert te raden.
- De Oude Manier: Je vraagt het aan een slimme vriend, maar hij staat naast de finishlijn en leest de uitslagen. Hij vertelt je de winnaar, maar hij is niet echt aan het voorspellen; hij is gewoon aan het lezen.
- De Tijdsmachine: Je plaatst je vriend in een geluidsdichte kamer met een tv die is bevroren op het moment voordat de race begint. Hij kan de finishlijn niet zien.
- Het Team: In plaats van één vriend, heb je een Coach die drie andere vrienden vertelt om naar de benen van de paarden, de jockeys en het weer te kijken. Zij schrijven allemaal rapporten, en een vierde vriend (de Generaal) leest ze allemaal om de definitieve beslissing te nemen.
Het artikel laat zien dat deze "Tijdsmachine"-opstelling een eerlijke, snelle en nauwkeurige manier creëert om AI-agenten te trainen en te testen om betere voorspellers van de toekomst te worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.