← Nieuwste papers
🤖 AI

TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

Dit artikel introduceert TMAS, een multi-agent synergiekader dat de schaalbaarheid van compute tijdens het testen voor grote taalmodellen verbetert door hiërarchische geheugens te gebruiken voor gestructureerde samenwerking over trajecten heen en een hybride beloningsversterkingsleerplan om exploratie en exploitatie in redeneertaken effectief in evenwicht te brengen.

Oorspronkelijke auteurs: George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een ongelooflijk moeilijke puzzel op te lossen, zoals een complex wiskundeprobleem of een lastige logische raadsel. Je hebt een zeer slimme assistent (een AI) die kan proberen het op te lossen.

De Oude Manier: De Eenzame Wolf versus de Menigte
Voorheen, als de AI vastliep, vertelden onderzoekers haar gewoon om "harder na te denken" of "het opnieuw te proberen".

  • De Eenzame Wolf: De AI bleef gewoon met zichzelf praten en schreef een lange keten van gedachten. Soms bleef ze in een lus hangen en herhaalde ze dezelfde fout keer op keer.
  • De Menigte: Andere methoden lieten de AI veel verschillende antwoorden tegelijk genereren, de populairste kiezen, of één versie een andere laten controleren. Maar deze versies werkten vaak in silo's. Als één versie een briljante truc vond, wisten de anderen het niet. Als één versie op een doodspoor liep, wisten de anderen niet dat ze dat pad moesten vermijden. Ze waren als een groep mensen in een kamer die allemaal verschillende ideeën schreeuwden, maar niemand luisterde echt naar elkaar of hield een gedeeld notitieboek bij.

De Nieuwe Manier: TMAS (Het Team met een Gedeeld Brein)
Het artikel introduceert TMAS (Test-time Multi-Agent Synergy). Denk hierbij niet aan één AI, maar aan een gespecialiseerd team dat samenwerkt met een gedeeld geheugensysteem.

Hier is hoe TMAS werkt, met een eenvoudige analogie:

1. Het Team van Specialisten

In plaats van dat één AI alles doet, verdeelt TMAS het werk onder vijf specifieke "agenten" (teamleden):

  • De Oplosser: Probeert antwoorden te bedenken.
  • De Controleur: Beoordeelt het werk van de Oplosser om fouten te vinden.
  • De Samenvatter: Neemt de notities van de Controleur en zet ze om in een duidelijke "les geleerd".
  • De Ervaringsbewaarder: Dit is cruciaal. Hij kijkt naar de lessen en schrijft ze in een "Laag-Niveau Notitieboek". Dit notitieboek bevat specifieke, concrete feiten zoals: "Hé, we hebben geprobeerd deze tegel verticaal te leggen en dat mislukte. Doe dat niet nog eens," of "We hebben bewezen dat dit specifieke getal 3 is, dus we kunnen dat feit later gebruiken."
  • De Strategie Gids: Deze agent schrijft in een "Hoog-Niveau Kaart". Deze kaart noemt geen specifieke feiten; hij noemt aanpakken. Hij zegt: "We hebben dit al geprobeerd op te lossen met algebra. We hebben het ook geprobeerd met meetkunde. Verspil geen tijd door die nog eens te proberen; probeer iets totaal nieuws."

2. Het Iteratieve Proces (De Lus)

Het team werkt in rondes:

  1. Verkennen: De Oplosser genereert verschillende pogingen voor het probleem.
  2. Verifiëren: De Controleurs beoordelen ze.
  3. Leren: De Ervaringsbewaarder en de Strategie Gids updaten hun notitieboeken en kaarten op basis van wat er is gebeurd.
  4. Verfijnen: De volgende ronde van Oplossers leest de notitieboeken en kaarten. Ze gebruiken het "Laag-Niveau Notitieboek" om specifieke eerdere fouten te vermijden en gebruiken de "Hoog-Niveau Kaart" om ervoor te zorgen dat ze niet gewoon oude strategieën herhalen.

3. De "Hybride Beloning" (De Trainer's Stimulans)

Om de AI te leren hoe ze dit team effectief moet gebruiken, creëerden de onderzoekers een speciaal trainingssysteem (Versterkend Leren). Stel je een trainer voor die het team drie soorten beloningen geeft:

  • Beloning 1 (Het goed doen): Als je de puzzel oplost, krijg je een punt. (Basisvaardigheid).
  • Beloning 2 (Gebruik het Notitieboek): Als je de puzzel oplost specifiek omdat je een feit uit het "Laag-Niveau Notitieboek" hebt gebruikt, krijg je een bonus. Dit leert de AI om het gedeelde geheugen daadwerkelijk te lezen en te vertrouwen, in plaats van het te negeren.
  • Beloning 3 (Wees Creatief): Als je de puzzel oplost met een nieuwe strategie die niet op de "Hoog-Niveau Kaart" staat, krijg je een bonus. Dit voorkomt dat het team lui wordt en gewoon dezelfde oude trucs herhaalt. Als je gewoon een oude strategie kopieert en plakt, krijg je een straf.

De Resultaten

Het artikel testte dit op zeer moeilijke wiskundebenchmarks (zoals de Internationale Wiskunde Olympiade).

  • De Bevinding: Naarmate het team meer tijd krijgt om na te denken (meer "iteraties"), wordt TMAS steeds slimmer en slimmer. Andere methoden lopen vaak tegen een muur op waar ze stoppen met verbeteren of zelfs meer fouten gaan maken omdat ze in de war raken door hun eigen geschiedenis.
  • De Analogie: Het is als het verschil tussen een student die maar blijft herlezen uit een schoolboek (en moe en in de war raakt) versus een student die een tutor heeft, een studiegroep en een gedeelde set flashcards. De student met het systeem leert sneller, herhaalt geen fouten en probeert nieuwe hoeken als hij vastzit.

Samenvattend:
TMAS verandert een enkele AI in een gecoördineerd team met een gedeeld geheugen. Het dwingt de AI om specifieke feiten te onthouden (Ervaringsbank) en bij te houden welke grote ideeën al zijn mislukt (Richtlijnbank). Door de AI te trainen om waarde te hechten aan het gebruik van deze herinneringen en het proberen van nieuwe paden, kan ze veel moeilijkere problemen oplossen dan voorheen door haar "denktijd" effectief op te schalen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →