← Nieuwste papers
💬 NLP

MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning

Het artikel introduceert MARS, een nieuw multi-agent reinforcement learning-framework dat twee cognitieve systemen (snelle intuïtie en weloverwogen redeneren) co-evolueert om de token-inefficiëntie en kennisbeperkingen van Large Reasoning Models te overwinnen, waarmee het de beste prestaties bereikt op kennisintensieve taken zonder supervised fine-tuning.

Oorspronkelijke auteurs: Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

Gepubliceerd 2026-02-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Overdenker" en de "Verouderde" Bibliotheek

Stel je voor dat je een briljante, superintelligente assistent hebt (een AI) die geweldig is in het oplossen van moeilijke puzzels. Deze assistent heeft echter twee grote gebreken:

  1. De Overdenker: Wanneer je hem vraagt om een simpel nieuwsartikel te lezen of een webpagina samen te vatten, raakt hij soms in een "diepe denkmodus" verstrikt. Hij analyseert elk afzonderlijk woord en verspilt tijd en energie aan zaken die geen diepe analyse nodig hebben. Het is alsof je een sloophamer gebruikt om een noot te kraken.
  2. De Verouderde Bibliotheek: De kennis van deze assistent stopt op de dag waarop hij is getraind. Als je hem iets vraagt over iets dat gisteren is gebeurd, is hij er hulpeloos bij. Hij kan niet zelf dingen opzoeken zonder in de war te raken door de enorme hoeveelheid nieuwe informatie.

De Oplossing: MARS (Het Twee-Hersenen-Team)

De onderzoekers hebben een nieuw systeem ontwikkeld genaamd MARS. In plaats van één brein dat alles probeert te doen, hebben ze een team gebouwd van twee verschillende "persoonlijkheden" die binnen dezelfde AI werken, geïnspireerd door hoe menselijke hersenen werken:

  • Systeem 1 (De Snelle Verkenner): Dit is het "intuïtieve" brein. Het is snel, efficiënt en goed in scannen. Zijn taak is om naar een berg nieuwe informatie te kijken (zoals 10 verschillende webpagina's of onderzoeksartikelen) en snel alleen de belangrijkste feiten eruit te halen. Het is als een verkenner die voorop rent, de nuttige voorraden grijpt en de rommel achterlaat.
  • Systeem 2 (De Diepe Denker): Dit is het "doordachte" brein. Het is traag, voorzichtig en uitstekend in het oplossen van complexe logische puzzels. Het neemt de schone, gedestilleerde feiten van Systeem 1 en gebruikt deze om het eigenlijke probleem op te lossen.

De Magische Truk:
In eerdere systemen werden de "Verkenner" en de "Denker" apart getraind. De Verkenner wist niet wat de Denker nodig had, waardoor hij zaken samenvatte waar de Denker niet om vroeg, of cruciale details miste die de Denker wél hard nodig had.

In MARS co-evolueren ze. Ze worden samen getraind. De Verkenner leert precies welke soort informatie de Denker helpt om de puzzel op te lossen, en de Denker leert hoe hij de Verkenner om de juiste zaken kan vragen. Ze delen dezelfde "score" (beloning), zodat ze als een perfect team werken in plaats van als twee vreemden.

Hoe Ze Trainen: Het "Groepsspel"

Om deze twee systemen te leren samenwerken zonder een menselijke leraar (een methode genaamd "Zero RL", wat betekent dat ze vanaf nul beginnen zonder vooraf geschreven voorbeelden), gebruikten de onderzoekers een slim trainingsspel gebaseerd op Group Relative Policy Optimization (GRPO).

Beschouw dit als een sportteam dat oefent voor een kampioenschap:

  1. De Teamoverleg (Bin-Packing): Wanneer het team op pad gaat om informatie te verzamelen, komen ze misschien 10 verschillende webpagina's tegen. Dat is te veel om in één keer te lezen. Het systeem gebruikt een "Bin-Packing"-strategie (zoals boodschappen in tassen stoppen). Het organiseert deze rommelige, verschillend grote pagina's in nette, hanteerbare brokken, zodat de Verkenner ze allemaal tegelijk kan lezen zonder overweldigd te raken.
  2. De Scorebord (Gedeelde Beloningen): Het team gaat op pad om een probleem op te lossen. Als ze het antwoord goed hebben, krijgt zowel de Verkenner als de Denker een punt. Als ze falen, krijgt niemand een punt. Dit dwingt hen tot samenwerking.
  3. Eerlijk Spel (Ontkoppelde Gradiënten): Hier zit de lastige stap. Hoewel ze de score delen, zorgden de onderzoekers ervoor dat de Verkender credit krijgt voor het goed samenvatten en de Denker voor het goed redeneren. Het is als een estafette: als het team wint, krijgen beide hardlopers een medaille, maar de coach weet precies wie het eerste deel van de race heeft gelopen en wie het tweede deel. Dit zorgt ervoor dat de Verkenner leert een betere Verkenner te zijn, en niet alleen een betere Denker.
  4. Het Team in Balans Brengen (Gebalanceerde Sampling): Soms moet de Verkenner 5 pagina's lezen, en op andere momenten slechts 1. Dit creëert een onbalans in de trainingsdata. Het systeem gebruikt een speciale samplingmethode om ervoor te zorgen dat de Verkenner en de Denker evenveel oefentijd krijgen, zodat de een het leerproces niet domineert.

De Resultaten: Klein Team, Grote Winsten

De onderzoekers testten MARS op een zeer moeilijk examen genaamd HLE (Humanity's Last Exam), dat geavanceerde onderwerpen behandelt in wetenschap, wiskunde en geschiedenis.

  • De Underdog: MARS gebruikte een relatief klein model (8 miljard parameters).
  • De Giganten: Ze vergeleken het met veel grotere modellen (32 miljard of 72 miljard parameters) en zelfs met enkele dure, commerciële "superintelligentie"-modellen van grote techbedrijven.
  • De Uitkomst: MARS versloeg de grotere modellen die met menselijke voorbeelden waren getraind (Supervised Fine-Tuning). Het kwam zelfs heel dicht in de buurt van de prestaties van de meest geavanceerde commerciële modellen die momenteel beschikbaar zijn, ondanks het feit dat het begon met nul menselijke begeleiding en een veel kleiner brein gebruikte.

Waarom Dit Er Toe Doet (Volgens het Paper)

Het paper beweert dat het geheime ingrediënt niet alleen het hebben van meer tools is (zoals zoekmachines of rekenmachines); het is de partnerschap.

  • Zonder de "Verkenner" (Systeem 1) raakt de "Denker" (Systeem 2) overweldigd door te veel ruwe data en maakt hij fouten.
  • Zonder de "Denker" (Systeem 2) vat de "Verkenner" (Systeem 1) zaken alleen samen zonder het eigenlijke probleem op te lossen.
  • Samen creëren ze een systeem dat een enorme hoeveelheid actuele informatie kan lezen en deze kan gebruiken om complexe, meerstaps redeneerproblemen efficiënt op te lossen.

Kortom, MARS leert een AI om te weten wanneer hij "snel moet scannen" en wanneer hij "diep moet nadenken", en hoe hij beide samen kan doen zonder in de war te raken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →