← Nieuwste papers
🤖 AI

HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs

Het artikel introduceert Hermes, een nieuwe tool-ondersteunde agent die informele redenering afwisselt met formeel geverifieerde bewijzen in Lean om meer nauwkeurige, efficiënte en verifieerbare wiskundige redenering in grote taalmodellen te bereiken vergeleken met bestaande benaderingen.

Oorspronkelijke auteurs: Azim Ospanov, Zijin Feng, Jiacheng Sun, Haoli Bai, Xin Shen, Farzan Farnia

Gepubliceerd 2026-06-01
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Azim Ospanov, Zijin Feng, Jiacheng Sun, Haoli Bai, Xin Shen, Farzan Farnia

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer moeilijk wiskundig raadsel probeert op te lossen. Je hebt een briljante maar ietwat slordige assistent (het Large Language Model, of LLM) die geweldig is in het brainstormen van ideeën en het schrijven van lange, creatieve uitleg. Echter, deze assistent maakt soms kleine logische fouten, raakt in de war of "hallucineert" feiten die goed klinken maar niet waar zijn.

Aan de andere kant heb je een strikte, onverbiddelijke Wiskundige Rechter (een formeel bewijsysteem genaamd Lean). Deze rechter maakt nooit fouten, maar is ook erg rigide. Het begrijpt je creatieve brainstormen niet; het accepteert alleen perfect gestructureerde, formele code. Als je een slordige uitleg geeft, zegt het simpelweg "Error."

Hermes is een nieuwe tool die fungeert als een vertaler en kwaliteitscontrolemanager tussen deze twee. Het laat je creatieve assistent vrij werken, maar stopt het elke paar stappen om de strikte Rechter te vragen: "Is deze specifieke stap daadwerkelijk waar?"

Hier is hoe Hermes werkt, onderverdeeld in eenvoudige delen:

1. Het Probleen: De "Lange Wandeling" vs. De "Strikte Examen"

  • De Oude Manier (Informele Redenering): Je assistent probeert de hele oplossing in één lange stroom van gedachten op te lossen. Het is flexibel en snel, maar als het vroegtijdig een verkeerde afslag neemt, kan het nog een lange tijd de verkeerde richting uit blijven gaan voordat het de fout beseft. Het is als rijden in een auto met je ogen dicht, in de hoop dat je geen muur raakt.
  • De Andere Manier (Formeel Bewijzen): Je assistent probeert vanaf het begin de oplossing in strikte code te schrijven. Het is perfect accuraat, maar het is zo traag en moeilijk dat de assistent vaak vastloopt of opgeeft. Het is als het bouwen van een huis steen voor steen, terwijl je elke enkele steen controleert tegen een blauwdruk voordat je de volgende legt.

2. De Hermes Oplossing: Het "Checkpoint" Systeem

Hermes combineert het beste van beide werelden. Het laat de assistent een paar stappen van zijn creatieve uitleg schrijven, en pauzeert dan om een "checkpoint" uit te voeren.

  • De Vertaler (Formalisatie Module): Wanneer de assistent zegt: "Daarom is de hoek 45 graden," vertaalt Hermes die zin naar de strikte code die de Rechter begrijpt.
  • De Rechter (Prover Module): De strikte Rechter controleert die code.
    • Als het slaagt: Geweldig! Hermes slaat die stap op in een Geheugenbank en vertelt de assistent: "Je bent goed, ga door."
    • Als het faalt: De Rechter zegt: "Nee, dat is fout." Hermes vertelt de assistent: "Stop! Je hebt hier een fout gemaakt. Ga terug en herstel het."
  • De Geheugenbank: Omdat wiskundige problemen vaak lange ketens van logica bevatten, onthoudt Hermes alle stappen die wel gecontroleerd zijn. Dit zorgt ervoor dat de assistent de regels die hij al bewezen heeft niet vergeet, waardoor het hele argument consistent blijft.

3. Waarom het Beter Is (De Resultaten)

Het paper testte Hermes op moeilijke wiskundige competities (zoals de AIME en HARDMath2) met diverse AI-modellen.

  • Nauwkeurigheid: Hermes maakte de AI veel slimmer. Op de moeilijkste problemen verbeterde Hermes het succespercentage van de AI met wel 40%. Het voorkwam dat de AI met vol vertrouwen een foutief antwoord gaf.
  • Efficiëntie: Je zou kunnen denken dat het controleren van elke stap traag en duur zou zijn. Verrassend genoeg was Hermes zelfs sneller en goedkoper (in termen van rekenkracht) dan andere methoden die proberen 5 of 10 verschillende antwoorden te genereren en daar de beste uit te kiezen. Het is als het nemen van een direct, geverifieerd pad in plaats van rond te dwalen in een doolhof terwijl je 10 verschillende routes probeert.
  • Duidelijkheid: In tegen tegenstelling tot andere methoden die alleen zeggen "Dit antwoord is voor 80% waarschijnlijk juist," geeft Hermes een duidelijk "Ja" of "Nee" op specifieke stappen, wat het makkelijker maakt om te zien waarom een antwoord correct of onjuist is.

De Kernboodschap

Hermes is als het geven van een slimme, geautomatiseerde editor aan je creatieve wiskundige assistent die het werk in realtime controleert. Het stopt de assistent niet om creatief te denken; het zorgt er alleen voor dat de assistent niet van een klif af wandelt. Het resultaat is een wiskundige oplossende AI die niet alleen nauwkeuriger is, maar ook efficiënter en gemakkelijker te vertrouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →