← Nieuwste papers
🤖 AI

Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents

Dit position paper betoogt dat het vooruithelpen van Software Engineering-agenten een overgang vereist van reactieve ontwerpen naar gestructureerde, toe-aan-toestand-bewuste en op uitvoering gegronde redenering om langdurige taken effectief te kunnen afhandelen en een coherente begripsvorming te behouden over evoluerend bewijsmateriaal.

Oorspronkelijke auteurs: Tse-Hsun, Chen

Gepubliceerd 2026-02-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tse-Hsun, Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Van "Vergeetachtige Chatbots" naar "Georganiseerde Ingenieurs"

Stel je voor dat je een zeer slimme assistent inhuurt om een complexe machine te repareren, zoals een automotor. Momenteel gedragen de "Software Engineering Agents" (AI-bots die code schrijven) zich als een vergeetachtige gesprekspartner.

Hoe ze nu werken (Het "Reactieve" Probleem):
Elke keer dat je ze een vraag stelt of ze een test laten draaien, kijken ze alleen naar het allerlaatste wat je hebt gezegd en de directe geschiedenis van de chat. Ze hebben geen notitieblok waarin ze hun plan, hun vermoedens of wat ze hebben geleerd, opschrijven.

  • De Analogie: Het is alsof je een mysterie probeert op te lossen door elke dag een nieuwe pagina uit een boek te lezen, maar elke keer als je de pagina omslaat, verdwijnen de vorige pagina's. Als het verhaal lang wordt, vergeet de detective (de AI) wie de schurk was, welke aanwijzingen ze gisteren vonden, of waarom ze een specifieke gok maakten. Ze kunnen een probleem oplossen, om vervolgens direct hun eigen werk ongedaan te maken omdat ze vergeten zijn dat ze het al hadden opgelost.

Het Voorstel van de Auteur (De "Gestructureerde" Oplossing):
Tse-Hsun (Peter) Chen betoogt dat we, om dit op te lossen, moeten stoppen met deze AI-agents te behandelen als simpele chatbots en ze moeten gaan behandelen als menselijke ingenieurs met een gestructureerd mentaal model.

Hij stelt drie belangrijke upgrades voor:

1. Expliciete Structuur (De "Blauwdruk")

In plaats van alleen maar te chatten, moet de agent een formeel "blauwdruk" of "kaart" van zijn gedachten bijhouden.

  • De Analogie: Stel je een detective voor die niet alleen hardop praat, maar ook een fysiek bewijsstukkenbord bijhoudt. Op dit bord prikt hij het volgende:
    • Hypotheses (Veronderstellingen): "Ik denk dat de remleiding kapot is."
    • Invariants (Onveranderlijke wetten): "De motor moet altijd koel blijven."
    • Dependencies (Afhankelijkheden): "Als ik de remmen repareer, moet ik daarna de banden controleren."
    • State (Status): "Huidige status: Wachten op testresultaten."
    • Waarom het helpt: Wanneer de agent nieuwe informatie krijgt, hoeft hij niet de hele conversatie opnieuw te lezen. Hij hoeft alleen de specifieke speld op het bord bij te werken. Dit houdt de logica helder en voorkomt dat de agent in de war raakt.

2. State-Awareness (Het "Levende Geheugen")

De agent moet zijn huidige begrip onthouden als iets levends dat verandert, en niet alleen als een lijst met voorbije woorden.

  • De Analogie: Denk aan een personage in een videogame. In een slecht spel vergeet het spel telkens wanneer het personage beweegt dat hij een sleutel vasthoudt, waardoor hij hem opnieuw moet vinden. In een goed spel heeft het personage een "State" (Inventaris: Sleutel, Kaart, Gezondheid: 80%).
  • De Claim van het Papier: Huidige AI-agents verliezen hun "Inventaris". Ze vergeten hun aannames. Chen zegt dat de agent een persistente "State" nodig heeft die zijn huidige overtuigingen vasthoudt. Als een nieuwe test een overtuiging weerlegt, moet de agent die specifieke overtuiging in zijn "Inventaris" bijwerken, in plaats van in paniek te raken en het hele spel vanaf level één opnieuw te beginnen.

3. Execution-Grounded Reasoning (Redeneren gebaseerd op Uitvoering)

Wanneer de agent probeert code uit te voeren, krijgt hij feedback (zoals een foutmelding of een testresultaat). Momenteel behandelt de AI deze feedback als slechts een andere zin in een chat.

  • De Analogie: Stel je een chefkok voor die een soep proeft.
    • Huidige AI: De chef proeft de soep, hoort "Het is te zout", en vergeet dan onmiddellijk waarom hij überhaupt zout heeft toegevoegd. Hij kan dan willekeurig suiker toevoegen.
    • Voorgestelde AI: De chef heeft een receptenkaart (de structuur). Hij ziet de feedback "Te zout" en streept direct de stap door waar hij te veel zout heeft toegevoegd. Hij werkt zijn mentale model van het gerecht bij: "Oké, de soep is zout, dus ik moet water toevoegen, niet suiker."
  • De Claim van het Papier: De agent moet de "feedback" (de foutmelding) direct koppelen aan de specifieken "hypothese" (de gok) die het veroorzaakte. Dit voorkomt dat de agent blindelings gokt en helpt hem precies te leren waar het misging.

Waarom is dit belangrijk?

Het artikel stelt dat naarmate softwaretaken langer en complexer worden, de huidige "alleen chat"-stijl van AI tekortschiet. Dit leidt tot:

  • Inconsistentie: Twee keer hetzelfde doen en verschillende resultaten krijgen.
  • Vergeten: Een bug oplossen, om vervolgens per ongeluk de bug opnieuw te introduceren omdat de AI vergeten is dat het al opgelost was.
  • Tijdverlies: Het hele proces vanaf het begin opnieuw starten wanneer er een kleine fout optreedt, in plaats van alleen die ene stap te herstellen.

Het Stappenplan

Chen zegt niet dat we al een perfecte oplossing hebben. Hij stelt een roadmap voor. Hij wil dat onderzoekers AI-agents bouwen die:

  1. Niet langer alleen vertrouwen op de conversatiegeschiedenis.
  2. Beginnen met het gebruik van gestructureerd geheugen (zoals een database van hypothesen en statussen).
  3. Uitvoeringsfeedback (testresultaten) behandelen als data die hun interne model bijwerken, in plaats van alleen als tekst om te lezen.

Kortom: We moeten AI-agents transformeren van "reactieve chatbots" die alles vergeten na een paar beurten, naar "gestructureerde ingenieurs" die een lopend, georganiseerd mentaal model van het project bijhouden, zodat ze complexe, langdurige problemen kunnen oplossen zonder hun plek te verliezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →