← Nieuwste papers
💬 NLP

From Plan to Action: How Well Do Agents Follow the Plan?

Deze paper presenteert een systematische analyse van de planopvolging door programmeringsagenten, waarbij wordt vastgesteld dat hoewel instructies en herinneringen de prestaties kunnen verbeteren, een slecht plan of een plan dat niet aansluit bij het interne redeneerproces van het model de prestaties juist verslechtert, wat wijst op de noodzaak om modellen te trainen in adaptief redeneren in plaats van het memoriseren van specifieke workflows.

Oorspronkelijke auteurs: Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

Gepubliceerd 2026-04-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Van Plan naar Actie: Hoe goed volgen agents hun instructies?

Stel je voor dat je een zeer slimme, maar soms wat verstrooide assistent hebt die je helpt om complexe softwareproblemen op te lossen. Je geeft hem een duidelijk stappenplan: "Eerst zoek je de fout, dan maak je een test om de fout te reproduceren, daarna repareer je de code, en tot slot controleer je of het werkt."

Deze nieuwe studie van onderzoekers van de Universiteit van Illinois en IBM vraagt zich af: Volgt deze assistent daadwerkelijk dat stappenplan, of doet hij gewoon wat hij zelf denkt dat het beste is?

Hier is een uitleg van de bevindingen, vertaald naar alledaagse taal met een paar creatieve vergelijkingen.

1. Het Probleem: De "Vlieger" en de "Wind"

In de wereld van kunstmatige intelligentie (AI) voor programmeren, geven mensen vaak een "plan" mee in de instructies. Dit is als een vlieger die je vasthoudt. Maar de AI (de wind) kan soms zo hard waaien of zo afgeleid raken door de omgeving (zoals foutmeldingen en lange bestandslijsten) dat het touw van het plan loslaat.

De onderzoekers keken naar bijna 17.000 pogingen van verschillende AI-modellen om softwarebugs te fixen. Ze wilden weten:

  • Hoe vaak houden ze zich aan het plan?
  • Wat gebeurt er als je het plan helemaal weghaalt?
  • Wat als je het plan verandert (bijvoorbeeld stappen verwisselen of extra stappen toevoegen)?

2. De Metingen: Een "Compliance-Score"

Om dit te meten, bedachten de onderzoekers een slim systeem. Ze kijken niet alleen naar of het probleem opgelost is, maar hoe het opgelost is. Ze gebruiken drie maatstaven:

  1. Hebben ze alle stappen gedaan? (Zoals een kok die alle ingrediënten gebruikt).
  2. Hebben ze de stappen in de juiste volgorde gedaan? (Eerst bakken, dan bakken, niet andersom).
  3. Hebben ze geen rare, extra dingen gedaan? (Zoals een kok die ineens ijs maakt terwijl hij een soep moet koken).

Als een AI alles perfect doet, krijgt hij een score van 100%.

3. De Belangrijkste Ontdekkingen

A. Het Plan helpt, maar niet iedereen luistert

  • De "Voorbeeldleerling": Sommige AI-modellen (zoals Devstral-small) houden zich bijna perfect aan het plan. Ze volgen de instructies als een trouwe soldaat.
  • De "Creatieve Reiziger": Andere modellen (zoals GPT-5 mini) zijn slimmer, maar luisteren minder. Als het probleem makkelijk is, slaan ze stappen over (bijvoorbeeld het maken van een test overslaan omdat ze denken dat ze de fout al snappen). Als het moeilijk is, houden ze zich beter aan het plan.
  • De "Verwarden": Sommige modellen (zoals DeepSeek-R1) houden zich het minst aan het plan en maken vaak technische fouten in hun uitvoering.

B. Wat gebeurt er zonder plan?

Als je het stappenplan volledig weghaalt, gedragen de AI's zich alsof ze een "innerlijk kompas" hebben. Ze doen wat ze tijdens hun training hebben geleerd.

  • Het resultaat: De meeste AI's doen nog steeds ongeveer wat het plan voorschreef (zoals zoeken en repareren), maar de succesrate daalt. Zonder plan raken ze sneller de weg kwijt, vooral bij moeilijke problemen. Het plan werkt als een anker dat ze op koers houdt.

C. Een slecht plan is erger dan geen plan

Dit is misschien wel het meest verrassende: Als je een slecht plan geeft, gaat het slechter dan als je helemaal geen plan geeft.

  • Vergelijking: Stel je voor dat je iemand de weg wijst naar een restaurant, maar je zegt: "Ga eerst naar het noorden, dan naar het zuiden, en sla dan linksaf." Als de persoon dit plan volgt, loopt hij in de war. Als hij geen plan had, had hij misschien gewoon zijn intuïtie gevolgd en was hij toch bij het restaurant gekomen.
  • In de studie bleek dat als je een stap uit het plan haalt (bijvoorbeeld "maak geen test"), de AI's die gewend waren om die stap te doen, in de problemen komen. Hun interne strategie botst met het gebrekkige plan.

D. Extra stappen kunnen hinderlijk zijn

De onderzoekers dachten: "Laten we extra, nuttige stappen toevoegen, zoals het uitvoeren van extra tests of het schrijven van een samenvatting."

  • Het resultaat: Voor sommige AI's werkte dit niet. Het was alsof je een kok die al een soep maakt, vraagt om ook nog een taart te bakken voordat hij de soep serveert. Het verstoort hun focus. Als een AI niet gewend is aan die extra stap, wordt hij er alleen maar minder goed in.

E. Herinneringen werken wonderen

Een van de beste oplossingen bleek: Periodieke herinneringen.

  • Vergelijking: Stel je voor dat je een lange wandeling maakt en je vergeet je bestemming. Als iemand je elke 10 minuten even zegt: "Onthoud, we gaan naar de bergtop!", blijf je op koers.
  • De onderzoekers lieten het plan elke paar stappen opnieuw in het geheugen van de AI verschijnen. Dit zorgde ervoor dat de AI's minder afwezig werden en meer problemen oplosten.

4. Waarom is dit belangrijk?

De conclusie is dat we AI's niet alleen moeten "leren" om een specifiek plan te onthouden (zoals een parate tekst). In plaats daarvan moeten we ze leren hoe ze een plan moeten volgen en aanpassen.

Huidige AI's lijken vaak te "leren" door voorbeelden te kopiëren (overfitting) in plaats van echt te redeneren. Als we ze leren om adaptief te denken en instructies te volgen, zelfs als ze moeilijk zijn, worden ze veel betere software-engineers.

Kortom: Een plan is essentieel, maar het moet kloppen met hoe de AI denkt. En als de AI begint te afdwalen, helpt een vriendelijke herinnering om weer op het juiste spoor te komen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →