Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time Perception
Dit paper introduceert het concept van 'temporale blindheid' bij LLM-agents, waarbij een nieuw dataset (TicToc) en evaluaties aantonen dat bestaande modellen slecht aansluiten bij de menselijke tijdsperceptie bij toolgebruik, maar dat post-training alignment een veelbelovende oplossing biedt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Titel: Waarom je AI-assistent geen gevoel voor tijd heeft (en waarom dat gevaarlijk is)
Stel je voor dat je een zeer slimme, maar ietwat vergetelijke assistent hebt. Deze assistent kan alles voor je regelen: hij boekt vluchten, checkt het weer, zoekt prijzen op en zelfs de treinroosters. Hij is razendsnel en kent bijna alles uit zijn hoofd.
Maar er is één groot probleem: deze assistent heeft geen idee hoe lang het geleden is dat hij iets heeft gedaan. Hij is "tijdsblind".
In het onderzoekspapier "Your LLM Agents are Temporally Blind" (Jouw LLM-agenten zijn tijdsblind) van onderzoekers van de Universiteit van Maryland en RELAI.ai, wordt dit probleem onderzocht. Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen.
1. Het Probleem: De "Stale Sandwich"
Stel je voor dat je je assistent vraagt: "Is de boter nog goed?"
Hij kijkt in zijn notitieboekje en zegt: "Ja, gisteren was hij nog goed."
- Scenario A (Korte tijd): Je vraagt dit 5 minuten later. De boter is nog steeds goed. Je assistent heeft gelijk.
- Scenario B (Lange tijd): Je vraagt dit 3 dagen later. De boter is nu rot. Maar omdat je assistent geen gevoel voor tijd heeft, denkt hij nog steeds dat de boter goed is, omdat hij "gisteren" (in zijn hoofd) keek.
Dit is wat de onderzoekers tijdsblindheid noemen. De AI ziet de tijd niet als een vloeiende stroom, maar als een statische foto. Ze weten niet dat er uren, dagen of minuten zijn verstreken tussen twee gesprekken.
2. De Twee Fouten: Te Vertrouwen of Te Twijfelen
Omdat de AI geen tijd voelt, maakt ze twee soorten fouten:
Fout 1: Te veel vertrouwen (Over-reliance)
- Vergelijking: Het is alsof je kijkt naar een weerbericht van gisterenochtend om te beslissen of je een paraplu meeneemt, terwijl het nu een uur geleden is gaan regenen.
- Wat gebeurt er: De AI gebruikt oude informatie die nu verouderd is. Bijvoorbeeld: ze zeggen dat er nog plek is op een concert, terwijl de kaarten 10 minuten geleden al uitverkocht waren. Dit leidt tot verkeerde antwoorden.
Fout 2: Te weinig vertrouwen (Under-reliance)
- Vergelijking: Het is alsof je elke keer dat je de koelkast opent, de temperatuur meet met een thermometer, ook al heb je hem 5 minuten geleden al gemeten.
- Wat gebeurt er: De AI denkt dat alles verandert en doet elke keer een nieuwe check (een "tool call"), zelfs als de informatie (zoals de omvang van de Aarde of een statische wet) al jaren hetzelfde blijft. Dit kost tijd, geld en energie.
3. De Proef: TicToc (De "Tik-Tak" Test)
Om dit te testen, hebben de onderzoekers een nieuwe dataset gemaakt genaamd TicToc.
- Het idee: Ze hebben duizenden gesprekken nagebootst tussen een mens en een AI.
- De variatie: Ze hebben scenario's bedacht waarbij tijd belangrijk is (zoals beurskoersen die elke seconde veranderen) en scenario's waarbij tijd niet uitmaakt (zoals de geschiedenis van een stad).
- De test: Ze keken of de AI wist wanneer ze een nieuwe check moesten doen en wanneer ze gewoon het oude antwoord mochten geven.
4. De Resultaten: De AI is nog niet klaar
De resultaten waren niet bemoedigend:
- Zelfs de slimste AI-modellen (zoals GPT-4o of Qwen) scoorden slecht. Ze deden vaak net zo goed als iemand die blind gissen doet.
- Zelfs als je de AI expliciet vertelt: "Hé, er is 3 uur verstreken", reageren ze er nog steeds niet goed op. Ze lijken de tijd niet echt te begrijpen, maar alleen te lezen.
- Interessant detail: Als de AI begon na te denken (redeneren), werd het soms zelfs erger! Ze dachten hard na, maar kwamen tot de verkeerde conclusie omdat hun "tijdsgevoel" ontbrak.
5. De Oplossing: Oefening baart kunst (Post-training)
De onderzoekers probeerden twee dingen:
- Gewone tips geven (Prompting): Ze zeiden tegen de AI: "Vergeet niet dat de tijd voorbijgaat!" Dit hielp bijna niets. Het is alsof je tegen een kind zegt "pas op voor het verkeer" zonder dat het kind ooit op straat heeft gelopen.
- Specifiek trainen (Post-training/DPO): Ze hebben de AI specifiek getraind op de TicToc-data. Ze hebben de AI laten zien: "Als er 5 minuten zijn verstreken en het gaat om beurskoersen, check dan opnieuw. Als er 5 minuten zijn verstreken en het gaat om de hoofdstad van Frankrijk, hoef je niet te checken."
Het resultaat: Na deze specifieke training verbeterde de prestatie enorm! De AI leerde eindelijk het juiste gevoel voor tijd te ontwikkelen.
Conclusie
Deze studie laat zien dat onze slimme digitale helpers nog een groot gebrek hebben: ze leven in een wereld zonder klok. Ze weten niet dat informatie oud kan worden.
Om echte, betrouwbare AI-assistenten te maken die ons helpen in de echte wereld, moeten we ze niet alleen leren wat ze moeten doen, maar ook wanneer ze het moeten doen. Ze moeten leren om te voelen of een informatiebroodje nog vers is, of dat het al een week in de koelkast heeft gelegen.
Kortom: AI is slim, maar ze hebben nog een uurwerk nodig om echt menselijk te kunnen meedenken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.