← Nieuwste papers
💬 NLP

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents

Dit artikel definieert de "horizon gap" als het falen van geavanceerde taalmodellen bij taken met meerdere stappen, onderzoekt 1.547 recente studies om onderscheid te maken tussen taak-, model- en systeemkenmerken, en betoogt dat de verschuiving in het vakgebied naar dichtere signalen op stapniveau een noodzakelijke reactie is op de afnemende informatieve waarde van uitsluitend resultaatgerichte feedback naarmate de taakhorizonten langer worden.

Oorspronkelijke auteurs: Mingguang Chen, Licheng Wang, Bo Qu

Gepubliceerd 2026-08-10
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mingguang Chen, Licheng Wang, Bo Qu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Lange-Afstandsprobleem: Wanneer AI de weg kwijtraakt

Stel je voor dat je een briljante, hyper-snelle robot leert om een verhaal te schrijven. Als je het vraagt om één zin te schrijven, doet hij dat misschien perfect in een fractie van een seconde. Maar wat gebeurt er als je hem vraagt om een hele roman te schrijven, of om een complex project te beheren dat uren duurt? Dit is de wereld van AI-agenten. In tegen tegenstelling tot een eenvoudige chatbot die slechts één vraag beantwoordt, is een agent een robot die kan denken, acties kan ondernemen (zoals op knoppen klikken of code schrijven), kan zien wat er gebeurt, en vervolgens kan beslissen wat de volgende stap is. Het is als een digitale werknemer.

De grote uitdaging waar wetenschappers nu voor staan, is de "horizon". In alledaagse termen is de horizon simpelweg hoe ver je vooruit moet kijken. Een korte horizon is als het bestellen van een pizza: je belt, ze leveren, jij eet. Een lange horizon is als het bouwen van een huis: je moet de fundering leggen, de muren optrekken, het dak plaatsen en de muren schilderen, terwijl je tegelijkertijd moet onthouden wat je drie dagen geleden hebt gedaan. Het probleem is dat zelfs de slimste AI-modellen, die complexe wiskundige problemen direct kunnen oplossen, vaak de weg kwijtraken wanneer de taak lang wordt. Ze kunnen een eerdere beslissing vergeten, verklaren dat de klus geklaard is terwijl deze pas half af is, of stilletjes afdwalen van het doel. Deze kloof tussen wat een AI in één snelle stap kan doen en wat hij betrouwbaar over een lange periode kan voltooien, wordt de Horizon Gap genoemd. Begrijpen hoe we dit kunnen oplossen is cruciaal, want als we willen dat AI ons helpt bij echte banen die uren of dagen duren, moeten we weten waarom ze falen en hoe we voorkomen dat ze crashen.


De Grote AI-Roadtrip: Het Dichten van de Horizon Gap

In dit artikel treden de auteurs op als een enorm team van detectives dat meer dan 1.500 onderzoeksartikelen heeft doorzocht die gepubliceerd zijn tussen 2024 en 2026. Hun missie? Ontdekken waarom AI-agenten precies verdwalen op lange reizen en wat onderzoekers proberen te doen om dit op te lossen. Ze noemen de afstand tussen de intelligentie van een model in één enkele stap en de capaciteit om een lange taak te voltooien de "Horizon Gap."

Om de chaos te ordenen, moesten de auteurs eerst drie woorden ontwarren die mensen vaak door elkaar halen, zoals het verwarren van de motor van een auto met de brandstoftank:

  1. Long-Horizon (Lange horizon): Dit gaat over de taak. Het betekent dat de klus veel stappen vereist, zoals een lange autorit.
  2. Long-Context (Lange context): Dit gaat over het brein van het model. Het is hoeveel informatie de AI op één enkel moment in zijn hoofd kan vasthouden.
  3. Long-Term Memory (Langetermijngeheugen): Dit gaat over het notitieblok van het systeem. Het is of de AI dingen van gisteren kan onthouden om vandaag te gebruiken, zelfs nadat de huidige "conversatie" is beëindigd.

Het artikel betoogt dat je een superlang notitieblok (geheugen) kunt hebben maar een kort brein (context), of een enorm brein maar helemaal geen notitieblok. Dit zijn verschillende problemen die verschillende oplossingen vereisen.

De auteurs hebben hun bevindingen georganiseerd in zes hoofdstukken, waarbij ze het leven van een lange taak van begin tot eind volgen:

1. Planning: De Kaart versus het Kompas
Wanneer een AI aan een lange taak begint, heeft hij een plan nodig. Sommige onderzoekers proberen een perfecte kaart van de hele reis te maken voordat er ook maar één stap wordt gezet. Maar het artikel stelt dat dit vaak mislukt omdat de wereld onvoorspelbaar is. Als je een hele roadtrip vooraf plant, kun je vast komen te zitten in een file die je niet zag aankomen. De trend verschuift naar interleaving: één stap zetten, om je heen kijken en dan de volgende stap plannen. Het is als rijden met een kompas in plaats van een vaste kaart. Je past je aan terwijl je onderweg bent.

2. Geheugen: De Rugzak versus de Bibliotheek
Terwijl de AI meer stappen zet, genereert hij veel informatie. Als hij probeert alles in zijn directe brein (de "context") te houden, raakt hij uiteindelijk de ruimte kwit of vergeet hij het begin van het verhaal. Het artikel laat zien dat de meeste onderzoekers nu externe bibliotheken bouwen (zoals een rugzak of een archiefkast) waar de AI aantekeningen kan opslaan en er wanneer nodig weer bij kan. Er is echter een addertje onder het gras: als de bibliotheek te rommelig wordt, kan de AI de verkeerde aantekening erbij pakken of vergeten oude aantekeningen bij te werken. Het artikel suggereert dat "vergeten" eigenlijk een functie kan zijn, en geen fout, om de bibliotheek bruikbaar te houden.

3. Executie: Het Veiligheidsnet
Dit is het deel waar de AI daadwerkelijk het werk doet. Het artikel vindt dat het geheim van succes niet alleen het hebben van een slimmer AI-model is, maar het hebben van een betere harness (de softwarematige omlijsting rondom het model). Denk aan het model als de motor en de harness als de ophanging en de remmen van de auto. Als de motor afslaat, vangt een goede harness dit op, herstelt de fout en houdt de auto in beweging. Het onderzoek laat zien dat systemen met sterke "recovery" logica—manieren om een fout op te merken en direct te herstellen—veel beter zijn in lange taken dan systemen die er simpelweg vanuit gaan dat de AI nooit een fout maakt.

4. Training: Leren van Elke Stap
Normaal gesproken trainen we AI door het pas aan het einde van een taak een cijfer te geven (zoals een A of een F op een eindexamen). Maar voor een lange taak is wachten tot het einde om te zeggen "je bent gefaald" te laat. Het artikel benadrukt een verschuiving naar process rewards. In plaats van alleen het eindresultaat te beoordelen, proberen onderzoekers de AI feedback te geven op elke stap die hij zet. Het is als een coach die tijdens de training tips geeft, en niet pas aan het einde van het seizoen. Dit helpt de AI om te leren hoe hij beter wordt, en niet alleen wat het antwoord is.

5. Evaluatie: Meten we wel het juiste?
Hier wordt het artikel kritisch. De auteurs wijzen erop dat veel van de tests die we gebruiken om te zien of AI goed is in lange taken, gebrekkig zijn. Bijvoorbeeld: sommige tests kunnen zeggen dat een AI een programmeerprobleem heeft "opgelost" simpelweg omdat hij een patch heeft gevonden die een simpele test doorstaat, zelfs als de code eigenlijk fout is. Het artikel betoogt dat we moeten stoppen met alleen naar de eindscore (Geslaagd/Gezakt) te kijken en moeten gaan kijken naar de trajectorie—het hele pad dat de AI heeft afgelegd. Is hij verdwaald? Is hij hersteld? Is hij afgedwaald? Het artikel suggereert dat veel huidige "successcores" illusies zijn veroorzaakt door zwakke tests of het feit dat de AI antwoorden uit het hoofd heeft geleerd.

6. Het Fundament: Waarom het allemaal misgaat
Ten slotte kijkt het artikel naar de theorie. Het suggereert dat fouten niet simpelweg lineair optellen. Soms werkt een AI een lange tijd prima en stort hij dan plotseling in een "meltdown". Andere keren verandert hij stilletjes van doel (goal drift) zonder dat iemand het merkt. De auteurs geven toe dat we nog geen perfecte theorie hebben om precies te voorspellen wanneer of waarom deze fouten optreden. We weten dat ze gebeuren, maar het voorspellen van wanneer blijft een mysterie.

De Belangrijkste Conclusie

Het belangrijkste wat dit artikel suggereert, is dat de "harness" (de instrumenten en veiligheidsnetten die we rondom de AI bouwen) misschien wel net zo belangrijk is als het AI-model zelf. Een slim model met een slechte harness zal falen bij lange taken, terwijl een redelijk model met een geweldige harness succesvol kan zijn.

De auteurs waarschuwen ons ook voor een verborgen valstrik: Correlated Measurement Bias. Dit is een chique manier om te zeggen dat als we dezelfde soort "goede stap"-signalen gebruiken om de AI te trainen én om hem te testen, we onszelf voor de gek kunnen houden. Het is alsoals een student die alleen de oefenvragen bestudeert die de docent ook voor de toets gebruikt; hij kan een perfect cijfer halen, maar begrijpt het onderwerp nog steeds niet.

Kortom, het artikel beweert niet dat we het lange-afstandsprobleem hebben opgelost. In plaats daarvan brengt het het slagveld in kaart. Het vertelt ons dat de toekomst van AI niet alleen gaat over grotere breinen; het gaat over het bouwen van betere rugzakken, betere kaarten, betere veiligheidsnetten en betere manieren om te meten of de AI daadwerkelijk een goede baan doet, stap voor stap. De reis is lang, en de AI is nog steeds aan het leren hoe hij deze kan lopen zonder te vallen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →