← Nieuwste papers
🤖 AI

ReM-MoA: Reasoning Memory Sustains Mixture-of-Agents Scaling

Het artikel introduceert ReM-MoA, een geheugenversterkt Mixture-of-Agents-framework dat schaling tijdens de inferentie handhaaft over toenemende dieptes door gebruik te maken van een Ranked Reasoning Memory en Curated Diversified Memory Routing om exploratie-diversiteit te behouden en hoogwaardige redeneersporen te propageren.

Oorspronkelijke auteurs: Heng Ping, Arijit Bhattacharjee, Peiyu Zhang, Shixuan Li, Wei Yang, Ali Jannesari, Nesreen Ahmed, Paul Bogdan

Gepubliceerd 2026-06-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Heng Ping, Arijit Bhattacharjee, Peiyu Zhang, Shixuan Li, Wei Yang, Ali Jannesari, Nesreen Ahmed, Paul Bogdan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een zeer moeilijke puzzel op te lossen, zoals een complex wiskundig probleem of een lastige logische raadsel. Je besluit een groep slimme vrienden (AI-agenten) te vragen om te helpen.

In het verleden probeerden onderzoekers twee belangrijke manieren om deze vrienden te organiseren:

  1. De "Groepschat"-methode: Iedereen roept zijn ideeën naar buiten en jij kiest het beste ervan.
  2. De "Gelaagde Team"-methode: Je plaatst de vrienden in rijen. Rij 1 denkt na, geeft hun aantekeningen door aan Rij 2, Rij 2 verbetert ze, geeft ze door aan Rij 3, enzovoort.

Het Probleem:
Het onderzoekers vonden dat de "Gelaagde Team"-methode een gebrek heeft. Naarmate je meer rijen toevoegt (het team dieper maakt), worden de antwoorden eigenlijk slechter of stoppen ze met verbeteren. Het is als een spelletje "Telefoontje" waarbij de boodschap vervormd raakt, of een team waar iedereen begint op dezelfde manier te denken en geen nieuwe ideeën meer naar voren brengt. Het team komt vast te zitten in een sleur, herhaalt fouten of convergeert naar één enkele, middelmatige oplossing.

De Oplossing: ReM-MoA
De auteurs stellen een nieuw systeem voor genaamd ReM-MoA (Reasoning Memory Mixture-of-Agents). Denk hierbij aan het geven van een superkrachtige, georganiseerde archiefkast en een slimme redacteur aan het team.

Zo werkt het, met behulp van eenvoudige analogieën:

1. De "Slimme Archiefkast" (Ranked Reasoning Memory)

In oude systemen, wanneer Rij 2 de aantekeningen doorgaf aan Rij 3, dumpden ze simpelweg alles wat ze hadden geschreven. Dit bevatte zowel briljante ideeën als stomme fouten, allemaal door elkaar gemengd.

In ReM-MoA kijkt, nadat elke rij zijn werk heeft voltooid, een Slimme Redacteur (een Reviewer Agent) naar alle aantekeningen.

  • De Redacteur beoordeelt elk idee, van "Gouden Ster" tot "Verbeterpunt".
  • De Redacteur schrijft een kort briefje waarin wordt uitgelegd waarom een idee goed of slecht was.
  • Al deze beoordeelde aantekeningen worden opgeborgen in een speciale kast die elke toekomstige rij kan inzien.

Waarom dit helpt: In plaats van te verdrinken in een zee van ongeorganiseerde aantekeningen, kunnen de volgende teamleden naar de kast kijken en zien: "Oh, dit specifieke pad werkte geweldig," of "Oh, dat pad leidde tot een doodlopende weg." Ze hoeven het wiel niet opnieuw uit te vinden of dezelfde fouten te herhalen.

2. De "Gecureerde Menukaart" (Diversified Memory Routing)

Hier komt de tweede slimme truc. Als je elk lid van Rij 3 exact dezelfde set "Beste Ideeën" uit de kast zou geven, zouden ze allemaal op dezelfde manier gaan denken en zou het team zijn creativiteit verliezen.

ReM-MoA gebruikt een Gecureerde Menukaart-systeem:

  • Agent A krijgt een menu met voornamelijk "Gouden Ster"-ideeën (om hen te laten zien hoe succes eruitziet).
  • Agent B krijgt een menu met voornamelijk "Verbeterpunt"-ideeën (om hen te laten zien welke valkuilen ze moeten vermijden).
  • Agent C krijgt een mix van beide (om succes en falen naast elkaar te vergelijken).

Waarom dit helpt: Dit houdt het team divers. Hoewel ze allemaal naar dezelfde kast kijken, krijgen ze elk een ander perspectief. Dit voorkomt dat de hele groep inzakt tot één enkele, repetitieve manier van denken.

3. De "Super-Redacteur" (Optionele Distillatie)

Het artikel vermeldt ook dat de "Slimme Redacteur" getraind kan worden om nog beter te worden. Ze kunnen een superintelligent AI (zoals een genie professor) nemen en een kleinere, snellere AI leren om de aantekeningen precies zoals die professor te beoordelen. Dit maakt de beoordeling nog nauwkeuriger, wat het team helpt om beter te presteren bij verschillende soorten puzzels (wiskunde, code, logica, enz.).

De Resultaten

De onderzoekers hebben dit systeem getest op vijf verschillende soorten moeilijke puzzels (wiskunde, logica, coderen, algemene kennis en gezond verstand).

  • Oude Systemen: Naarmate ze meer lagen (rijen) toevoegden, stortte de prestatie in, vlakte deze af of stopte deze met verbeteren.
  • ReM-MoA: Naarmate ze meer lagen toevoegden, bleven de prestaties blijven verbeteren. Hoe dieper het team ging, hoe slimmer de antwoorden werden.

Samenvattend:
ReM-MoA lost het "Telefoontje"-probleem van AI-teams op door ze een beoordeeld geheugen te geven van eerdere pogingen en ervoor te zorgen dat ze niet allemaal naar exact dezelfde voorbeelden kijken. Dit stelt grote groepen AI-agenten in staat om effectief samen te werken, waardoor ze steeds slimmer worden naarmate ze dieper graven, in plaats van in de war te raken of vast te lopen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →