Can LLMs Perceive Time? An Empirical Investigation
Dit empirische onderzoek toont aan dat grote taalmodellen, ondanks hun theoretische kennis, geen realistisch tijdsbesef hebben voor hun eigen taken, wat leidt tot systematische overschattingen en fouten in planning en agent-gestuurde scenario's.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Titel: Kunnen AI's hun eigen tijd voelen? (En het antwoord is: nee)
Stel je voor dat je een superintelligente robot hebt die alles kan doen: code schrijven, verhalen bedenken, en complexe problemen oplossen. Maar er is één groot probleem: deze robot heeft geen idee hoe lang het duurt om iets te doen. Het is alsof je een chef-kok hebt die fantastisch kookt, maar als je vraagt: "Hoe lang duurt het om dit gerecht te maken?", hij antwoordt: "Twee uur," terwijl het gerecht in werkelijkheid maar 5 minuten nodig heeft.
Dit is precies wat deze nieuwe studie over Large Language Models (LLM's) – de slimme AI's zoals wij ze nu kennen – ontdekt. Hier is de uitleg in gewone taal, met een paar leuke vergelijkingen.
1. Het Probleem: De "Blinde" Robot
Mensen leren hoe lang dingen duren door het te doen. Als je een taart bakt, voel je de tijd verstrijken, ruik je de geur, en zie je de taart rijzen. Je hebt een "tijd-gevoel" (een soort interne klok).
AI's hebben dit gevoel niet. Ze zien alleen tekst. Ze zien woorden op een scherm, maar ze voelen niet hoe lang het duurt om die woorden te genereren.
- De Analogie: Stel je voor dat je een boek leest in het donker. Je kunt de woorden zien, maar je hebt geen idee hoe snel je bladzijde voor bladzijde draait. Je weet alleen dat het verhaal er is. Voor een AI is het genereren van een antwoord alsof ze in een volledig donkere kamer zitten en raden hoe lang het duurt om een zin te schrijven, zonder een klok of een stopwatch.
2. Wat hebben ze getest?
De onderzoekers gaven vier verschillende tests aan verschillende AI-modellen (zoals de nieuwste GPT-versies en open-source modellen) met 68 verschillende taken, van "schrijf 'hallo wereld'" tot "bouw een ingewikkelde software".
Hier zijn de vier tests die ze deden:
Test A: "Hoe lang denk je dat het duurt?" (Voorspellen)
Voor ze iets deden, vroegen ze de AI: "Hoe lang duurt dit?"
- Het Resultaat: De AI's waren enorm optimistisch (of beter gezegd: enorm verkeerd). Ze schatten dat taken die in 5 seconden klaar waren, 30 tot 60 seconden duurden.
- De Vergelijking: Het is alsof je vraagt aan iemand: "Hoe lang duurt het om een glas water te drinken?" en die persoon antwoordt: "Ongeveer een uur." Ze denken dat het een enorme inspanning is, terwijl het in werkelijkheid een fluitje van een cent is. Ze schatten het 4 tot 7 keer te lang in!
Test B: "Wat duurt langer?" (Vergelijken)
Ze gaven de AI twee taken en vroegen: "Welke van deze twee duurt langer?" Ze maakten dit lastig door taken te kiezen die er "moeilijk" uitzagen, maar in werkelijkheid snel waren, en vice versa.
- Het Resultaat: De AI's deden het slechter dan een muntje opgooien. Ze vertrouwden op oppervlakkige hints. Als een taak "moeilijk" leek (bijvoorbeeld "schrijf een complex programma"), dachten ze: "Dat duurt lang!" Zelfs als het programma in 3 seconden klaar was.
- De Vergelijking: Het is alsof je vraagt aan iemand: "Duurt het langer om een fiets te repareren of een auto?" Als de auto een oude, kapotte schroef heeft die in 1 minuut vastzit, en de fiets een compleet nieuwe ketting nodig heeft die uren duurt, zegt de AI: "De auto, want dat is zwaarder!" Ze kijken naar het label, niet naar de werkelijkheid.
Test C: "Hoe lang duurde het nou echt?" (Terugkijken)
Na het maken van de taak vroegen ze: "Hoe lang duurde het net?"
- Het Resultaat: Geen idee. Soms dachten ze dat het 10 minuten duurde, terwijl het 10 seconden was. Soms dachten ze dat het 1 seconde duurde, terwijl het 1 minuut was.
- De Vergelijking: Het is alsof je net een film hebt gezien en iemand vraagt: "Hoe lang duurde de film?" en jij antwoordt: "Ik denk ongeveer een uur," terwijl het een 20-minuten kortfilm was. Je hebt geen geheugen voor de tijd die je hebt doorgebracht.
Test D: De "Agent" Test (Meerdere stappen)
Ze lieten de AI een complexe taak doen die meerdere stappen vereiste (zoals een website bouwen).
- Het Resultaat: Dezelfde fouten, maar dan erger. De AI's dachten dat ze snel waren, maar in werkelijkheid zaten ze vast in lussen of wachtten ze op tools.
- De Vergelijking: Stel je voor dat je een kok bent die een diner voor 100 mensen moet bereiden. Je denkt: "Ik doe dit in 10 minuten!" Maar omdat je geen idee hebt hoe lang het koken van de aardappelen duurt, brandt je eten en duurt het uren. De AI kan niet plannen omdat ze de tijd niet "voelen".
3. Waarom gebeurt dit?
De reden is simpel: AI's zijn getraind op tekst, niet op tijd.
Ze weten uit hun training dat "een mens een taak X minuten doet". Maar ze weten niet hoe snel zijzelf denken.
- Als je een AI vraagt op een snelle computer, is het antwoord snel.
- Als je het vraagt op een trage computer, is het antwoord traag.
De AI ziet alleen de tekst, niet de computer. Ze hebben geen "sensor" voor hun eigen snelheid. Het is alsof je een speler in een computerspel vraagt hoe lang het duurt om een level te halen, terwijl de speler geen idee heeft of de computer van de gebruiker traag of snel is.
4. Wat betekent dit voor de toekomst?
Dit is belangrijk voor als we AI's gaan gebruiken als managers of planners.
- Het Gevaar: Als je een AI vraagt om een plan te maken voor een noodsituatie (bijvoorbeeld in een ziekenhuis of bij een brand), en de AI denkt dat een taak 5 minuten duurt terwijl het 30 minuten duurt, kan dat rampzalig zijn. Ze kunnen plannen maken die onmogelijk haalbaar zijn binnen de tijdslimiet.
- De Oplossing: We kunnen niet vertrouwen op de AI om te zeggen: "Ik heb 10 minuten nodig." We moeten externe klokken en timers gebruiken. De AI moet zeggen: "Ik heb een plan," en jij (of het systeem) moet zeggen: "Oké, je hebt 10 minuten, begin maar!"
Conclusie
Deze studie laat zien dat AI's slimme tekstschrijvers zijn, maar slechte tijdwaarnemers. Ze hebben een boek vol kennis over hoe de wereld werkt, maar ze hebben geen eigen klok in hun hoofd. Ze kunnen niet voelen hoe lang ze bezig zijn.
Totdat we dit oplossen, moeten we AI's niet laten plannen op basis van hun eigen inschatting van de tijd. We moeten de klok zelf in handen houden!
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.