← Nieuwste papers
🤖 AI

RMA: an Agentic System for Research-Level Mathematical Problems

Het artikel introduceert Research Math Agents (RMA), een agentiek kader dat sterke baselines zoals GPT-5.2R overtreft op onderzoeksniveau wiskundige problemen door gebruik te maken van een meerrollige, iteratieve workflow om taken op te splitsen in gespecialiseerde modules voor literatuurbasis, bewijsgeneratie en verificatie.

Oorspronkelijke auteurs: Zelin Zhao, Bo Yuan, Jaemoo Choi, Yongxin Chen

Gepubliceerd 2026-05-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zelin Zhao, Bo Yuan, Jaemoo Choi, Yongxin Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een gloednieuw, onopgelost mysterie op te lossen in de wereld van de wiskunde. Het is niet zoals een puzzel uit een middelbareschoolboekje, waar het antwoord achterin het boek staat verstopt en je alleen een bekend recept hoeft te volgen. In plaats daarvan is het als het proberen te schrijven van een nieuw hoofdstuk voor een woordenboek dat nog niet geschreven is. Je moet de regels uitvinden, de juiste woorden vinden en bewijzen dat je ideeën waar zijn, terwijl je tegelijkertijd moet zorgen dat je niet per ongeluk iemands werk hebt gekopieerd.

Dit artikel introduceert RMA (Research Math Agents), een nieuw team van AI-"robots" dat specifiek is ontworpen om deze moeilijke, onopgeloste wiskundige mysteries aan te pakken.

Hier is hoe RMA werkt, uitgelegd via een eenvoudige analogie:

Het Probleem: De "Eenzame Genie" versus het "Onderzoeksteam"

Eerdere AI-systemen waren als eenzame genieën. Ze waren uitstekend in het oplossen van wiskundewedstrijdproblemen (zoals de Internationale Wiskunde Olympiade), omdat die problemen bekende antwoorden en duidelijke paden hebben. Maar wanneer ze werden geconfronteerd met echte, open-ended onderzoekswiskunde, bleven ze vaak steken, verzonnen ze feiten (hallucinaties) of gaven ze op.

RMA verandert het spel door te fungeren als een professioneel onderzoeksteam in een universitair laboratorium. In plaats van dat één robot alles alleen probeert te doen, breekt RMA het werk op in een gestructureerde teaminspanning.

Het RMA-Team: Een Taakverdeling

Beschouw RMA als een bouwteam dat een wolkenkrabber (het bewijs) van scratch bouwt. Ze gokken niet zomaar; ze volgen een strikt workflow met drie hoofdrollen:

  1. De Initializer (De Architect):

    • Taak: Deze agent bekijkt de rommelige, verwarrende probleemstelling en zet deze om in een duidelijk blauwdruk. Het breekt het grote probleem op in kleinere, hanteerbare doelen.
    • Analogie: Net als een architect die het vage idee van een klant ("Ik wil een gebouw dat drijft") neemt en de eerste set blauwdrukken tekent, waarbij precies wordt gedefinieerd wat er moet worden gebouwd.
  2. De Proposers (De Bouwers & Ingenieurs):

    • Taak: Deze agents nemen het blauwdruk en proberen het bewijs te bouwen. Als ze tegen een muur lopen (een logische kloof), geven ze niet zomaar op. Ze gaan terug naar de "bibliotheek", vinden een nieuw gereedschap of een vergelijkbaar bouwontwerp (een stelling uit een leerboek) en proberen een andere constructiemethode.
    • Analogie: Net als een team ingenieurs dat verschillende materialen en ontwerpen uitprobeert. Als een balk breekt, zeggen ze niet zomaar "het is onmogelijk"; ze controleren de bibliotheek op een sterkere staallegering en proberen het opnieuw.
  3. De Verifiers (De Inspecteurs):

    • Taak: Deze agents fungeren als strenge bouwinspecteurs. Ze bouwen niets; ze controleren alleen het werk. Ze zoeken naar scheuren in de logica, ontbrekende stappen of nepmaterialen. Als ze een fout vinden, sturen ze de bouwers terug om het te herstellen.
    • Analogie: Net als een veiligheidsinspecteur die door het gebouw loopt, tegen de muren tikt en de blauwdrukken controleert. Als ze een gebrek vinden, geven ze een "repereer"-bon af, en moeten de bouwers het corrigeren voordat ze verder gaan.

Het "Gedeelde Notitieboek" (Gestructureerd Geheugen)

Een belangrijk onderdeel van RMA is dat iedereen een digitaal notitieboek (een gedeeld geheugen) deelt.

  • De Architect schrijft het blauwdruk.
  • De Bouwers voegen hun constructienotities en nieuwe ideeën toe.
  • De Inspecteurs schrijven hun kritieknotities.
  • Cruciaal: Niemand wist wat er eerder kwam. Ze voegen gewoon nieuwe pagina's toe. Dit betekent dat het team elke fout die ze maakten en elk gereedschap dat ze vonden, onthoudt, zodat ze geen fouten herhalen.

De "Fair Play"-Regels

Om ervoor te zorgen dat de AI niet cheat door het antwoord op te zoeken, heeft RMA een Fair Comparison Module.

  • Het fungeert als een strenge scheidsrechter die de deuren naar elke website die de oplossing zou kunnen hebben, op slot doet.
  • Het zorgt ervoor dat de AI alleen kijkt naar oude leerboeken en papers die zijn gepubliceerd voordat het probleem zelfs maar was bedacht, waardoor de AI wordt gedwongen om daadwerkelijk te denken en te ontdekken in plaats van gewoon te kopiëren en plakken.

De Resultaten: Heeft het gewerkt?

De onderzoekers testten RMA op de "First Proof"-benchmark, die bestaat uit 10 echte, onopgeloste wiskundige problemen bijgedragen door beroemde wiskundigen.

  • De Wedstrijd: Ze vergeleken RMA met andere top-AI-systemen, waaronder "GPT-5.2R" (van OpenAI) en "Aletheia" (van Google DeepMind).
  • De Uitkomst:
    • Aletheia kon geen enkel probleem oplossen.
    • GPT-5.2R loste 3 van de 10 op, maar maakte soms kleine logische fouten of gaf zwakkere antwoorden.
    • RMA loste 8 van de 10 problemen op.
    • Nog belangrijker: toen menselijke wiskundigen de bewijzen beoordeelden, zeiden ze dat de oplossingen van RMA logischer, duidelijker en betrouwbaarder waren dan die van de anderen.

De Conclusie

Het artikel beweert dat het oplossen van moeilijke wiskunde niet gaat om het hebben van een slimmere "hersenen" (een enkel krachtig AI-model); het gaat om het hebben van een beter proces. Door het werk op te breken in gespecialiseerde rollen (Architect, Bouwer, Inspecteur), hen een gedeeld notitieboek te geven en hen te dwingen hun werk herhaaldelijk te controleren, kan RMA problemen aanpakken die zelfs de slimste enkele AI niet aankan.

Het is het verschil tussen één persoon vragen om een huis alleen in het donker te bouwen versus een team inhuren met een blauwdruk, een bibliotheek en een veiligheidsinspecteur.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →