WorldReasoner: Evaluating Whether Language Model Agents Forecast Events with Valid Reasoning
Dit artikel introduceert WorldReasoner, een nieuw evaluatiekader dat de capaciteiten van taalmodelagenten op het gebied van gebeurtenisvoorspelling beoordeelt door rigoureus hun vermogen te testen om nauwkeurige, onderbouwde en causaal redeneerde voorspellingen te genereren met uitsluitend informatie die beschikbaar was vóór de voorspellingsdatum, waarbij wordt onthuld dat hoewel temporele extractie en causale graafconstructie de prestaties verbeteren, agenten nog steeds moeite hebben met het vertalen van gegrond evidence naar goed gekalibreerde waarschijnlijkheden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar het je strikt verboden is om de volgende dag de krant te lezen of het dossier "opgeloste zaken" in te kijken. Je hebt alleen toegang tot de aanwijzingen die op dit moment beschikbaar zijn op het moment dat je een gok doet.
Dit is de kern van de uitdaging van het papier WORLDREASONER. Het introduceert een nieuwe manier om te testen of AI-agenten (slimme computerprogramma's) daadwerkelijk aan het voorspellen zijn van de toekomst of dat ze gewoon aan het bedriegen zijn door feiten te onthouden die ze hebben geleerd tijdens hun training.
Hier is een uitsplitsing van het papier met behulp van eenvoudige analogieën:
1. Het Probleem: De "Bedriegende" Detective
Momenteel worden veel AI-modellen getest op vragen over gebeurtenissen uit het verleden (zoals "Wie won de verkiezingen van 2022?").
- Het probleem: Als een AI is getraind op gegevens die de verkiezingsuitslagen van 2022 bevatten, is het niet "voorspellen" van het antwoord; het is simpelweg het opzeggen van een feit dat het heeft onthouden. Het is als een student die een toets maakt waarbij hij het antwoordblad al heeft gezien.
- De lek: Zelfs als de test over de toekomst gaat, als de trainingsdata van de AI tot 2025 loopt en je vraagt het iets over een gebeurtenis in 2024, kan het zijn dat de AI het antwoord gewoon "herinnert" in plaats van te redeneren op basis van de aanwijzingen die op dat moment beschikbaar waren.
2. De Oplossing: De "Tijdreismethode"
De auteurs hebben WORLDREASONER gebouwd, een framework dat fungeert als een strikte tijdmachine.
- De opzet: Ze kiezen een echte wereldvraag (bijv. "Zal Netflix Warner Bros kopen tegen het einde van 2026?").
- De simulatie: Ze vertellen de AI: "Je bent in december 2025."
- De regel: De AI mag alleen nieuwsartikelen en gegevens bekijken die vóór december 2025 zijn gepubliceerd. Het kan niets uit 2026 zien.
- Het doel: De AI moet een gok doen (een voorspelling) op basis van alleen wat het op dat specifieke moment weet.
3. De Scorekaart met Drie Delen
De meeste tests controleren alleen: "Heb je het juiste antwoord?"
WORLDREASONER zegt dat dat niet genoeg is. Je zou het juiste antwoord kunnen krijgen door geluk te hebben, of door te hallucineren (nepbewijs te verzinnen). Daarom beoordelen ze de AI op drie afzonderlijke assen:
- Kwaliteit van de Uitkomst (De Score): Heb je het juiste antwoord gekregen? (bijv. Zei je "Nee" terwijl de deal inderdaad niet doorging?)
- Kwaliteit van het Bewijs (De Aanwijzingen): Heb je echte, tijdgebonden aanwijzingen gebruikt?
- Slecht: Een nieuwsartikel uit 2026 citeren om een beslissing uit 2025 te verklaren.
- Goed: Een artikel uit 2025 citeren dat op dat moment daadwerkelijk beschikbaar was.
- Kwaliteit van het Redeneren (De Logische Kaart): Heb je een correcte kaart getekend van waarom dingen gebeurden?
- De AI wordt gevraagd een "causaal diagram" te tekenen (een stroomdiagram dat laat zien hoe Gebeurtenis A leidde tot Gebeurtenis B).
- Het systeem controleert of de kaart van de AI overeenkomt met de "Hindsight Map" (de werkelijke keten van gebeurtenissen die historici later als de waarheid hebben vastgesteld).
4. Hoe ze de Test hebben Gebouwd
Ze hebben de vragen niet handmatig geschreven. Ze hebben een geautomatiseerde fabriek gebouwd:
- Forward Pipeline: Een AI scant het nieuws en voorspellingsmarkten om interessante vragen te vinden en stelt een "voorspellingsdatum" vast.
- Backward Pipeline: Nadat de gebeurtenis daadwerkelijk heeft plaatsgevonden, kijkt een "Hindsight Agent" naar al het nieuws dat na de feiten naar buiten kwam om het "Antwoordblad" en de "Werkelijke Logische Kaart" op te stellen.
- Het resultaat: Een enorme dataset van 345 echte scenario's, compleet met "de aanwijzingen die op dat moment beschikbaar waren" en de "uiteindelijke waarheid".
5. Wat ze Vonden (De Resultaten)
Ze hebben verschillende top AI-modellen getest onder deze strikte regels en vonden enkele interessante zaken:
- Retrieval is King: De grootste factor in het krijgen van het juiste antwoord was simpelweg het vinden van de juiste aanwijzingen op het juiste moment. Als de AI in staat was om te zoeken naar nieuws dat beschikbaar was vóór de voorspellingsdatum, werd het veel beter in het voorspellen.
- Het Tekenen van Kaarten Helpt, Maar Garandeert Succes Niet: Wanneer de AI werd gedwongen om een "causaal diagram" te tekenen (Redeneerkwaliteit), werd het beter in het identificeren van de sleutelgebeurtenissen die er daadwerkelijk toe deden. Echter, het tekenen van een goede kaart betekende niet automatisch dat de AI het juiste uiteindelijke antwoord koos.
- De "Kalibratie"-bottleneck: De grootste strijd voor de AI was het omzetten van goed bewijs naar een correcte waarschijnlijkheid.
- Analogie: Stel je een AI voor die alle juiste aanwijzingen vindt en een perfecte kaart van de misdaad tekent, maar dan zegt: "Ik ben voor 90% zeker dat de butler het heeft gedaan," terwijl de aanwijzingen eigenlijk wijzen op een kans van 10%. Het heeft de feiten, maar kan de kansen niet correct inschatten.
6. Waarom Dit Belangrijk Is
Dit papier betoogt dat we moeten stoppen met alleen te vragen: "Heeft de AI gelijk?" en moeten beginnen met vragen:
- "Wist het de antwoord vooraf al?"
- "Gebruikte het echt bewijs?"
- "Begreep het de oorzaak-gevolgrelatie?"
Door deze drie zaken van elkaar te scheiden, helpt WORLDREASONER ons te zien of een AI een echte voorspeller is (redenerend onder onzekerheid) of slechts een nabootser (het opzeggen van onthouden feiten).
Kortom: WORLDREASONER is een rigoureus examen dat AI dwingt te bewijzen dat het kan denken als een detective in het verleden, gebruikmakend van alleen de aanwijzingen die op dat moment beschikbaar waren, in plaats van simpelweg het antwoordblad uit de toekomst te lezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.