← Nieuwste papers
🤖 AI

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

Dit artikel introduceert ProofCouncil, een open-source LLM-agent die gebruikmaakt van een auteur-criticus-architectuur en de state-of-the-art prestaties heeft behaald in de FirstProof-challenge door autonoom zes van de tien reële wiskundige problemen op te lossen en aanzienlijke vooruitgang te tonen op een bredere set openstaande problemen.

Oorspronkelijke auteurs: Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

Gepubliceerd 2026-07-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gloednieuwe, superintelligente robot de hand hebt geschoven met een stapel van de meest raadselachtige wiskundige puzzels ter wereld. Dit zijn geen standaard "vul het ontbrekende getal in"-raadsels; het zijn open problemen waar echte menselijke wiskundigen al jaren hun hoofd over breken en waar nog niemand het antwoord op weet.

Maak kennis met ProofCouncil. Zie dit niet als een enkele robot, maar als een kleine, hooggespannen wiskundige werkplaats.

De Crew van de Werkplaats: Auteur, Criticus en de Squad

Het hart van dit systeem is een slim spel van "hete aardappel" gespeeld door twee hoofdpersonages: de Auteur en de Criticus.

  • De Auteur is de dromer. Het is een AI die zich neerzet om een perfect bewijs (een stapsgewijs wiskundig argument) te schrijven voor een probleem. Het heeft een magisch notitieblok waarin het ideeën opschrijft, code probeert en zelfs het internet afzoekt naar aanwijzingen.
  • De Criticus is de strenge redacteur. Het leest wat de Auteur heeft geschreven en zegt: "Wacht, deze stap slaat nergens op," of "Je bent vergeten dit deel te bewijzen!" Het zegt niet alleen "fout"; het geeft specifieke feedback over hoe de hiaten gedicht kunnen worden.

Hier komt de twist: de Auteur schrijft niet slechts één keer. Het schrijft, wordt bekritiseerd, herschrijft, wordt opnieuw bekritiseerd en gaat zo door. Het is alsoals een schrijver en een redacteur die in een kamer opgesloten zitten om een verhaal te polijsten totdat het perfect is.

Maar soms loopt de Auteur vast. Dat is wanneer ze de Council (de Raad) en de Compute Node (de Rekenmodule) erbij roepen.

  • De Council is een panel van andere superintelligente AI-modellen (zoals een team van gastexperts). De Auteur vraagt hen: "Hé, ik loop vast op dit specische deel; wat is een andere manier om hiernaar te kijken?"
  • De Compute Node is de zware krachtpatser. Als het probleem een enorme berekening of gespecialiseerde wiskundige software vereist die de Auteur niet alleen kan draaien, voert deze node het zware werk uit, draait de code en verwerkt de getallen om te controleren of een vermoeden waar is.

Om de paar ronden neemt de Criticus een "mentale pauze" en begint opnieuw met een schone lei. Dit is cruciaal omdat als de Criticus te gewend raakt aan de fouten van de Auteur, het de fouten misschien niet meer ziet. Een frisse blik zorgt ervoor dat het bewijs daadwerkelijk solide is.

De Grote Test: De FirstProof Challenge

Het team onderwierp ProofCouncil aan de ultieme test: een uitdaging genaamd FirstProof. De regels waren simpel maar meedogenloos: los 10 echte, onopgeloste wiskundige problemen op in 24 uur, gebruikmakend van alleen publieke tools.

De resultaten? ProofCouncil was de ster van de show. Van de 10 problemen slaagde het erin om voor 6 van hen oplossingen te produceren die door menselijke beoordelaars als correct werden beschouwd (waarbij slechts minimale, kleine aanpassingen nodig waren). Dit was de beste prestatie van welk team dan ook in de competitie.

Ze probeerden het ook op 30 andere open problemen die door echte wiskundigen waren ingestuurd. Van de 21 problemen waarover zij feedback kregen:

  • 5 werden beoordeeld als volledig correcte oplossingen.
  • 2 werden gezien als zeer veelbelovend, wachtend op een laatste controle.
  • 8 maakten nuttige voortgang, ook al voltooiden ze de taak niet.
  • 4 bevatten geen fouten, maar zorgden ook niet echt voor vooruitgang.
  • 2 begrepen de vraag verkeerd en losten een makkelijkere versie ervan op.

Belangrijk is dat geen enkele expert beweerde dat de outputs wiskundig onjuist waren op een manier die de logica zou breken. De belangrijkste fout was niet slecht rekenwerk, maar soms het verkeerd begrijpen van de probleemstelling.

De Kosten van Genie

Hier is het addertje onder het gras: zo slim zijn is duur. Het draaien van ProofCouncil op een enkel probleem kostte ongeveer $350 aan computertijd en modeloproepen. Vergelijk dit met een eenvoudiger, "single-shot" AI-poging die slechts $12 kostte, maar minder problemen oploste. De paper suggereert dat hoewel de "team-aanpak" beter werkt, het momenteel een luxeproduct is. De auteurs geven toe dat ze nog niet hebben geprobeerd dit goedkoper te maken, wat een taak is voor toekomstige onderzoekers.

Wat het Niet Deed (En Wat het Niet Claimde)

Het is belangrijk om te weten wat deze robot niet deed.

  • Het loste niet alle 10 de problemen in de uitdaging op (het miste er 4).
  • Het produceerde geen gepolijst, klaar voor publicatie wetenschappelijk artikel. De wiskundigen die het werk beoordeelden, merkten op dat de tekst dicht en inwisselbaar was en menselijke redactie nodig had om leesbaar te zijn voor niet-experts.
  • Het bewees niet dat AI elk wiskundig probleem kan oplossen. Het liet zien dat voor sommige moeilijke problemen een team van AI's die samenwerken beter is dan één AI die alleen werkt.

De Kern van het Verhaal

ProofCouncil suggereert dat als je een echt moeilijk, open wiskundig probleem wilt oplossen, je niet gewoon één AI moet vragen om "het maar even uit te zoeken". In plaats daarvan heb je een systeem nodig waarbij één AI schrijft, een ander het afbreuk doet, een derde frisse perspectieven biedt en een vierde de zware wiskunde berekent.

In de wereld van de FirstProof challenge was dit "Auteur-Criticus-Council"-team de meest succesvolle strategie die tot nu toe is getest. Het heeft de hele berg niet overwonnen, maar het is hoger geklommen dan wie dan ook, waarmee bewezen is dat wanneer AI-agenten samenwerken als een menselijk onderzoeksteam, ze problemen kunnen aanpakken die voorheen als onbereikbaar werden beschouwd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →