Measuring Iterative Temporal Reasoning with Time Puzzles
Dit paper introduceert Time Puzzles, een nieuwe benchmark voor het evalueren van iteratief temporair redeneren met hulpmiddelen, en onthult dat zelfs de beste taalmodellen moeite hebben met deze taak ondanks de beschikbaarheid van zoekfuncties.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een vergadering moet plannen. Je hebt een lijst met regels: "Het moet zijn in de zomer," "Het moet een dinsdag zijn," en "Het moet op dezelfde dag zijn als de dag dat de vorige burgemeester van Wenen zijn ambt verliet."
Om dit op te lossen, moet je niet alleen weten wat een zomer is, maar ook even opzoeken (bijvoorbeeld via Google) wie die burgemeester was en wanneer hij stopte. Dan moet je die twee stukjes informatie samenvoegen om de juiste datum te vinden.
Dit is precies wat onderzoekers van de Stony Brook University hebben onderzocht met hun nieuwe test, genaamd "Time Puzzles" (Tijdpuzzels). Hier is een uitleg in simpele taal:
1. Het Probleem: Slimme robots, maar slechte planners
Vandaag de dag zijn grote AI-modellen (zoals de slimme chatbots die we kennen) heel goed in het beantwoorden van vragen. Maar als het gaat om tijd en het gebruik van hulpmiddelen (zoals zoeken op internet), gaan ze vaak de mist in.
De onderzoekers zeggen: "De meeste tests kijken alleen of een robot een vraag in één keer goed kan beantwoorden. Maar in het echte leven werken we anders. We zoeken iets op, lezen het, denken na, zoeken weer iets anders op, en passen onze gedachten aan."
2. De Oplossing: De Tijdpuzzel
De onderzoekers hebben een nieuwe test bedacht, een soort digitale kruiswoordraadsel voor tijd.
- De regels: Een puzzel bestaat uit een paar zinnen met regels. Bijvoorbeeld: "Het is de tweede zondag van de maand," "Het is in de 6e maand van de Chinese maankalender," en "Het is het jaar dat Hanns Blaschke burgemeester was."
- De taak: De AI moet alle regels combineren en de juiste datum (of data) vinden.
- Het hulpmiddel: Soms moet de AI even op Google zoeken om te weten wie die burgemeester was. Soms moet het een kalender raadplegen.
3. Wat ontdekten ze? (De verrassende resultaten)
Ze hebben 13 verschillende slimme AI-modellen laten proberen deze puzzels op te lossen. De resultaten waren best schokkend:
- Zonder hulpmiddelen (alleen maar "in het hoofd"): Zelfs de allerbeste AI (GPT-5) haalde maar 55% goed. Dat betekent dat hij in bijna de helft van de gevallen de verkeerde datum gaf, zelfs als het antwoord makkelijk te vinden was. Het is alsof iemand die heel goed kan lezen, vergeet dat hij een kalender nodig heeft om een afspraak te maken.
- Met hulpmiddelen (internet): Toen ze de AI toestonden om te zoeken, werd het beter. Maar... het was nog steeds niet perfect.
- De grote ontdekking: De AI werd veel beter als de puzzelregels niet zeiden "Het jaar dat X burgemeester was", maar gewoon "Het jaar 1945".
- Wat betekent dit? De AI is goed in rekenen en logisch denken als de feiten al bekend zijn. Maar het is slecht in het combineren van zoeken en denken. Het kan wel zoeken, en het kan wel denken, maar het lukt hen niet goed om die twee dingen naadloos samen te laten werken.
4. De Analogie: De Chef-kok zonder recept
Stel je een super-slimme chef-kok voor (de AI).
- Als je hem zegt: "Maak een taart met aardbeien en suiker," maakt hij een heerlijke taart.
- Maar als je zegt: "Zoek uit welke aardbeien dit jaar het zoetst zijn, en maak dan een taart," faalt hij. Hij zoekt misschien wel, maar hij vergeet de suiker toe te voegen, of hij gebruikt de verkeerde aardbeien.
- De onderzoekers zeggen: "Onze AI's zijn geweldige kokken, maar ze zijn nog geen goede planners die een recept kunnen volgen terwijl ze tegelijkertijd de supermarkt inlopen."
5. Waarom is dit belangrijk?
We denken dat AI's in de toekomst onze planners, onderzoekers en assistenten zullen zijn. Als we een AI vragen: "Plan een reis naar Parijs voor de volgende volle maan, maar alleen als het niet regent en als de treinprijs onder de 50 euro is," dan moet de AI:
- Zoeken naar de datum van de volle maan.
- Zoeken naar het weer.
- Zoeken naar treinprijzen.
- Alles samenvoegen tot een goed plan.
Deze studie laat zien dat AI's hier nog niet goed in zijn. Ze kunnen de losse stukjes vinden, maar ze raken de draad kwijt als ze die stukjes moeten samenvoegen tot een logisch geheel.
Kortom: De AI's zijn slim, maar ze zijn nog niet slim genoeg om te werken als een echte detective die feiten zoekt en die feiten slim combineert. De onderzoekers hopen dat hun "Tijdpuzzels" helpen om AI's te trainen om beter te worden in dit soort dagelijkse, logische taken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.