← Nieuwste papers
🤖 AI

When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems

Dit artikel introduceert de Epistemische Planning Kalibratie Agent Workflow (EPC-AW) om epistemische mis-calibratie in op LLM gebaseerde multi-agent systemen aan te pakken—waarbij agenten de haalbaarheid van kennis verkeerd inschatten ondanks correcte uitvoering—door het toepassen van informatie-consistente planselectie en dynamische state-verfijning om het systeemniveau succes met gemiddeld 9,75% te verbeteren.

Oorspronkelijke auteurs: Zehao Wang, Shilong Jin, Zhao Cao, Lanjun Wang

Gepubliceerd 2026-05-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zehao Wang, Shilong Jin, Zhao Cao, Lanjun Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Kernprobleem: "Zeker Verkeerde" Plannen

Stel je voor dat je een team van drie experts leidt (een Planner, een Uitvoerder en een Controleur) om een complex mysterie op te lossen.

Meestal, wanneer deze teams falen, is het omdat iemand een fout heeft gemaakt tijdens het uitvoeren van het werk. Misschien gebruikte de Uitvoerder het verkeerde gereedschap, of miste de Controleur een typefout. We weten hoe we die fouten kunnen oplossen: zeg ze gewoon, "Hé, dat werkte niet, probeer het opnieuw."

Maar dit artikel ontdekte een sluwe nieuwe type falen. Soms volgt het team het plan perfect. De Uitvoerder gebruikt de juiste tools, de Controleur ziet geen fouten, en de acties worden precies zoals geschreven uitgevoerd. Toch slaagt het team er niet in het mysterie op te lossen.

Waarom? Omdat de Planner te zelfverzekerd was.

De Planner keek naar de informatie die ze hadden en zei: "Ik ben 100% zeker dat dit plan zal werken!" Maar ze hadden het verkeerd. Ze beseften niet dat ze een cruciaal stukje van de puzzel misten. Het plan zag er goed uit op papier, maar het was eigenlijk onmogelijk om te voltooien met de beschikbare informatie.

De auteurs noemen dit "Epistemische Miscalibratie". In gewone taal: Het team is er zeker van dat ze het weten, maar ze hebben het verkeerd.

De Analogie: De Blinde Wandeltoeristen

Stel je het team voor als wandelaars die proberen een bergketen over te steken in de mist.

  • De Planner tekent een kaart op basis van wat ze op dit moment kunnen zien.
  • De Uitvoerder loopt het pad.
  • De Controleur zorgt ervoor dat de Uitvoerder niet struikelt.

De Oude Manier (Uitvoeringsfouten):
Als de Uitvoerder in een gat valt, zegt de Controleur: "Stop! Je bent gevallen." Het team repareert het pad en gaat verder.

Het Nieuwe Probleem (Epistemische Miscalibratie):
De Planner tekent een pad dat er helder uitziet. De Uitvoerder loopt het perfect. De Controleur ziet geen gaten. Maar het pad leidt naar een afgrond die de Planner niet kon zien in de mist. Het team loopt helemaal naar de rand en valt erin, zelfs al liepen ze perfect.

Het probleem is niet dat ze slecht liepen; het is dat de kaart gebrekkig was omdat de Planner te zelfverzekerd was over wat ze konden zien.

De Oplossing: EPC-AW (Het "Realiteitscheck"-Team)

De auteurs hebben een nieuwe workflow bedacht genaamd EPC-AW om dit op te lossen. In plaats van alleen te controleren of de Uitvoerder correct liep, controleren ze of het Plan voor iedereen zinvol is, zelfs wanneer ze verschillende informatie hebben.

Ze gebruiken twee belangrijkste trucs:

1. De "Groepsconsensus" Check (Informatie-Consistentie Gebaseerde Plankaart Selectie)

In plaats van de Planner het beste pad alleen te laten kiezen, vraagt het systeem: "Als we dit plan aan drie verschillende mensen zouden tonen die iets verschillende dingen weten, zouden ze dan allemaal nog steeds denken dat het een goed idee is?"

  • De Truc: Het systeem simuleert verschillende versies van het team, elk met iets verschillende "herinneringen" of informatie.
  • De Test: Als de Planner denkt dat een pad geweldig is, maar de "andere versies" van het team denken dat het een slecht idee is omdat ze iets weten wat de Planner niet weet, dan verwerpt het systeem dat plan.
  • Het Resultaat: Ze kiezen alleen plannen waar iedereen het over eens is, ongeacht wie welke informatie heeft. Dit filtert de "zeker verkeerde" plannen eruit.

2. Het "Lessen Geleerd" Notitieboekje (Consistentie-Gestuurde Epistemische State Verfijning)

Soms maakt het team steeds dezelfde fout. Misschien probeert de Planner steeds een tool te gebruiken die niet werkt voor een bepaald type vraag.

  • De Truc: Het systeem houdt een speciaal notitieboekje bij. Elke keer dat de Planner een plan kiest dat door de "Groepsconsensus" check wordt afgewezen, schrijft het systeem op waarom het een slecht idee was.
  • Het Resultaat: De volgende keer kijkt de Planner in het notitieboekje en zegt: "Oh, ik herinner me dat ik dat eerder probeerde en het mislukte omdat ik informatie miste." Dit voorkomt dat het team twee keer dezelfde zelfverzekerde fout maakt.

Wat Vonden Ze?

De onderzoekers testten deze nieuwe methode op zes verschillende "mysterie-oplossende" uitdagingen (zoals het beantwoorden van moeilijke vragen die zoeken op internet of wiskunde vereisen).

  • Het Resultaat: Door deze "Groepsconsensus" en "Lessen Geleerd" aanpak te gebruiken, loste het team 9,75% meer problemen op dan daarvoor.
  • De Leerervaring: Zelfs als je de slimste AI en de beste tools hebt, zul je nog steeds falen als de AI te zelfverzekerd is over wat het weet. Je hebt een systeem nodig dat constant vraagt: "Zijn we zeker van dit?" voordat er actie wordt ondernomen.

Samenvatting

Dit artikel leert ons dat in AI-teams verkeerd zijn niet altijd een fout in de uitvoering is; soms is het een fout in het zelfvertrouwen. Door de AI te dwingen zijn plannen te controleren tegen verschillende perspectieven en te leren van vroegere zelfverzekerdheid, kunnen we systemen bouwen die veel moeilijker te misleiden zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →