← Nieuwste papers
🤖 AI

MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs

Het artikel stelt MAR (Multi-Agent Reflexion) voor, een methode die gebruikmaakt van multi-persona debaters om diverse reflecties te genereren en de gedachte-degeneratie te overwinnen die wordt gezien bij single-agent zelfreflectie, waardoor de redeneerprestaties op taken zoals HotPot QA en HumanEval aanzienlijk worden verbeterd.

Oorspronkelijke auteurs: Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Echo Chamber" van AI

Stel je voor dat je probeert een zeer moeilijke puzzel op te lossen. Je maakt een fout, maar in plaats van een vriend om hulp te vragen, ben je gedwongen om naar je eigen fout te kijken, een briefje aan jezelf te schrijven over wat er misging, en het dan opnieuw te proberen.

Dit is hoe het oorspronkelijke Reflexion-systeem werkt. Het is als een student die alleen in een kamer een toets maakt. Als ze een vraag fout hebben, schrijven ze een briefje: "Ik had dit fout omdat ik een detail heb gemist," en dan proberen ze het opnieuw.

De onderzoekers ontdekten een groot gebrek in deze aanpak: De student zit te erg vast in zijn eigen manier van denken.

  • Als de student een fout maakte omdat hij de regels verkeerd begreep, herhaalt zijn zelfreflectie vaak diezelfde misvatting.
  • Ze belanden in een "echo chamber" (echo-kamer), waar ze steeds dezelfde fout maken, waarbij ze deze telkens met net andere woorden rechtvaardigen.
  • In technische termen uit het paper wordt dit "degeneration of thought" genoemd. De AI komt vast te zitten in een lus van slechte redeneringen.

De Oplossing: De "Panel of Experts"

Om dit op te lossen, creëerden de auteurs Multi-Agent Reflexion (MAR).

In plaats van één student die tegen zichzelf praat, stel je je nu voor dat de AI een team van experts is dat rond een tafel zit om het probleem op te lossen. Wanneer het team een fout maakt, schrijven ze niet alleen een briefje; ze houden een gestructureerd debat.

Zo werkt het nieuwe systeem, stap voor stap:

  1. De Actor (De Doener): Eén AI probeert eerst het probleem op te lossen.
  2. De Fout: Als het antwoord fout is, vraagt het systeem niet simpelweg aan de "Doer" om het te herstellen.
  3. Het Debat (De Critici): Het systeem roept een team van verschillende "persona's" aan (gespecialiseerde AI-karakters). Denk aan:
    • De Scepticus: Iemand die aan alles twijfelt en zoekt naar verborgen vallen.
    • De Logicus: Iemand die controleert of de stappen wiskundig gezien wel logisch zijn.
    • De Creatieveling: Iemand die wilde, alternatieve ideeën suggereert.
    • De Verifieerder: Iemand die controleert of het antwoord precies aan de regels voldoet.
  4. De Rechter: Een "Judge" AI luistert naar al deze verschillende experts die met elkaar in debat gaan. Het kiest niet zomaar een winnaar; het synthetiseert hun argumenten tot één duidelijke, hoogwaardige les.
  5. De Herhaling: De "Doer" AI krijgt deze nieuwe, rijke les en probeert het opnieuw. Omdat de les afkomstig is van een diverse groep, is de kans veel groter dat de werkelijke fout wordt ontdekt in plaats van dat de oude fout wordt herhaald.

De Resultaten: Werkt het?

De onderzoekers testten dit op twee zeer verschillende soorten uitdagingen:

  • De "Detective" Test (HotPotQA): Dit houdt in dat er vragen worden beantwoord die vereisen dat je aanwijzingen uit meerdere verschillende documenten aan elkaar koppelt.

    • Het resultaat: Het enkele-AI-systeem (Reflexion) had ongeveer 44% van de antwoorden goed. Het nieuwe "Panel of Experts"-systeem (MAR) had 47% goed.
    • Opmerking: De auteurs geven toe dat deze verbetering kleiner was dan gehoopt, deels omdat het beoordelingssysteem voor deze vragen erg streng is wat betreft kleine details in de opmaak (zoals een ontbrekende punt), wat soms correcte redeneringen bestrafde.
  • De "Coder" Test (HumanEval): Dit houdt in dat er computercode geschreven moet worden die moet voldoen aan verborgen tests.

    • Het result resultaat: Het enkele-AI-systeem kreeg 76,4% van de code werkend. Het nieuwe "Panel of Experts"-systeem kreeg 82,6% werkend.
    • Waarom het hier beter werkte: Codefouten zijn vaak logische lussen of "off-by-one" fouten. De persona's "Scepticus" en "Logicus" waren erg goed in het opsporen van dit specifieke type fouten die een enkele AI bleef missen.

Het Nadeel: Het Kost Meer

Het paper is eerlijk over de nadelen.

  • De Prijs van het Debat: Een heel team dat met elkaar debatteert, kost veel meer energie en tijd dan één persoon die alleen nadenkt.
  • De Kosten: Het nieuwe systeem gebruikt ongeveer 3 keer meer rekenkracht (en kost 3 keer zoveel geld aan API-kosten) dan het oorspronkelijke systeem, omdat het meerdere AI-modellen moet draaien om het debat te voeren.

De Kern van het Verhaal

Het paper betoogt dat hoewel AI slimmer wordt, het nog steeds moeite heeft om te leren van zijn eigen fouten omdat het vast komt te zitten in zijn eigen gewoontes. Door de AI te dwingen te discussiëren met verschillende versies van zichzelf, doorbreekt het deze slechte gewoontes, vindt het betere oplossingen en wordt het betrouwbaarder — al doet het dat tegen een hogere prijs.

Het is het verschil tussen een solo-kunstenaar die probeert een schilderij alleen te repareren, versus een heel team van kunstcritici die precies aanwijzen wat er mis is en hoe het opgelost moet worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →