← Nieuwste papers
🤖 machine learning

ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning

ANNEAL is een neuro-symbolisch agent dat veilige, persistente eliminatie van terugkerende uitvoeringsfouten garandeert door fouten om te zetten in beheerde, gevalideerde bewerkingen van een symbolische proceskennisgraf zonder de gewichten van het fundamentele model te wijzigen.

Oorspronkelijke auteurs: Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer slimme, behulpzame robotassistent (een LLM-agent) voor die hotels kan boeken, IT-tickets kan beheren of bestellingen kan verwerken. Soms maakt deze robot een fout.

Het Probleem: De "Hetzelfde Fout"-Lus
De meeste huidige robotassistenten lijken op een persoon die vergeet waarom ze faalden. Als ze proberen een hotel te boeken met een bedrijfskaart tijdens een "blackout-datum" en worden afgewezen, proberen ze het misschien direct opnieuw met een andere kaart. Als dat werkt, gaan ze verder. Maar als je hen de volgende week opnieuw vraagt een hotel te boeken met dezelfde bedrijfskaart op dezelfde data, maken ze exact dezelfde fout opnieuw. Ze hebben de regel niet echt geleerd; ze hadden deze keer gewoon geluk. Ze blijven falen op dezelfde onderliggende logische fout, omdat de "instructiehandleiding" die ze volgen niet is opgelost.

De Oplossing: ANNEAL (De "Regelboek-Repelaar")
Het paper introduceert een nieuw systeem genaamd ANNEAL. In plaats van te proberen het brein van de robot opnieuw te trainen (wat traag en riskant is), treedt ANNEAL op als een strenge redacteur die de instructiehandleiding van de robot (zijn symbolische proceskennis) corrigeert telkens wanneer een terugkerende fout optreedt.

Hier is hoe ANNEAL werkt, met behulp van een creatieve analogie:

1. De "Detective"-Fase (Lokalisatie)

Wanneer de robot faalt, zegt ANNEAL niet zomaar: "Probeer het opnieuw." Het treedt op als een detective. Het bekijkt de fout en vraagt zich af: "Welke specifieke regel in de instructiehandleiding heeft dit veroorzaakt?"

  • Analogie: Stel je een chef-kok voor die een taart verbrandt. In plaats van de chef alleen te vertellen om "harder te proberen", wijst ANNEAL op de specifieke stap in het recept: "Je hebt de taart bij 500 graden in de oven gedaan, maar de regel zegt 350."

2. De "Tekenaar"-Fase (Gelimiteerde Generatie)

Zodra de slechte regel is gevonden, vraagt ANNEAL de robot om een nieuwe regel te schrijven om het op te lossen. Maar hier zit de adder onder het gras: de robot mag geen gedicht schrijven of een vage suggestie doen. Het moet een strikt, getypeerde code-patch schrijven (zoals een specifieke regel code) die past in de bestaande handleiding.

  • Analogie: De robot is als een junior architect. Het kan niet zomaar een nieuw gebouw tekenen; het moet een specifieke, blauwdruk-gebaseerde wijziging indienen voor de funderingsplannen, zoals "Voeg hier een steunbalk toe."

3. De "Veiligheidsraad"-Fase (Bestuur)

Dit is het meest unieke deel. Voordat de nieuwe regel daadwerkelijk aan de handleiding wordt toegevoegd, moet het een strenge veiligheidsinspectie doorstaan. ANNEAL gebruikt een meerlagige "Veiligheidsraad" om de nieuwe regel te controleren:

  • De Logische Check: Breekt deze nieuwe regel iets anders? (Bijv. "Als we bedrijfskaarten toestaan, breekt dat dan het budget?")
  • De Ethische Check: Schendt dit enige morele of bedrijfsbeleid? (Bijv. "Is deze regel wettelijk toegestaan?")
  • De Kanaaltest: Het systeem probeert de nieuwe regel in een veilige, gesimuleerde zandbak (zoals een vluchtsimulator) om te zien of het werkt zonder te crashen.
  • Analogie: Denk hieraan als een nieuwe wet die wordt voorgesteld. Het wordt niet pas wet omdat de President het tekent. Het moet de Senaat passeren (Logica), het Hooggerechtshof (Ethiek) en een publieke proefloop (Kanaaltest) voordat het officieel wordt ingevoerd.

4. De "Permanente Reparatie" (Commit)

Als de nieuwe regel alle tests doorstaat, commit ANNEAL het. Dit betekent dat de instructiehandleiding permanent wordt bijgewerkt.

  • Het Resultaat: De volgende keer dat de robot probeert dat hotel te boeken, probeert het niet eens het verkeerde pad. Het ziet de nieuwe regel ("Geen bedrijfskaarten op deze data") en kiest automatisch een ander pad. De fout is voor altijd weg.
  • Analogie: Het is als het repareren van een kuil op een weg. Voorheen reden auto's er steeds tegenaan. Nu is de weg over de kuil geplaveid. Niemand rijdt er meer tegenaan.

Waarom is dit speciaal?

Het paper vergelijkt ANNEAL met andere systemen (zoals ReAct en Reflexion):

  • Andere Systemen: Ze lijken op een student die hard studeert voor een toets, slaagt, maar de les de volgende dag vergeet. Ze kunnen zich herstellen tijdens een enkele taak, maar als je ze later dezelfde gebroken taak geeft, falen ze opnieuw.
  • ANNEAL: Het is als een student die, na het falen van een wiskundeprobleem, een correctie in zijn leerboek schrijft zodat hij die specifieke fout nooit meer maakt.

De Resultaten
In tests over vier verschillende gebieden (reizen, e-commerce, IT, enz.) was ANNEAL het enige systeem dat de onderliggende regels permanent oploste.

  • Andere systemen hadden een 72% tot 100% faalpercentage op terugkerende fouten (ze bleven dezelfde fout keer op keer maken).
  • ANNEAL reduceerde dit tot 0%. Zodra het een regel had opgelost, gebeurde de fout nooit meer.

Samenvattend
ANNEAL is een systeem dat "oeps, ik heb een fout gemaakt" omzet in "ik heb het regelboek bijgewerkt zodat deze fout onmogelijk is". Dit doet het zonder het brein van de robot te veranderen, maar door zorgvuldig de instructiehandleiding te bewerken met strenge veiligheidscontroles, zodat de robot na verloop van tijd slimmer en veiliger wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →