← Nieuwste papers
🤖 AI

Aria: An Agent For Retrieval and Iterative Auto-Formalization via Dependency Graph

Het artikel introduceert Aria, een op retrieval gebaseerd agent dat een twee-fasen Graph-of-Thought-proces en een definitie-gegronde scorer gebruikt om de state-of-the-art nauwkeurigheid te bereiken in de conjectuur-niveau auto-formalisatie van wiskundig onderzoek in Lean, waarmee het effectief veelvoorkomende LLM-beperkingen zoals hallucinaties en semantische mismatches overwint.

Oorspronkelijke auteurs: Hanyu Wang, Ruohan Xie, Yutong Wang, Guoxiong Gao, Xintao Yu, Bin Dong

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hanyu Wang, Ruohan Xie, Yutong Wang, Guoxiong Gao, Xintao Yu, Bin Dong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Lost in Translation" Kloof

Stel je voor dat je een briljante wiskundige hebt die "Menselijke Wiskunde" spreekt (natuurlijke taal, zoals Engels) en een superstrenge computer die alleen "Formele Wiskunde" spreekt (een rigide programmeertaal genaamd Lean). De computer is ongelooflijk krachtig; hij kan stellingen bewijzen zonder fouten te maken. Maar hij heeft een groot probleem: hij begrijpt menselijke wiskunde niet, tenzij deze perfect vertaald is.

Als je een wiskundige zin zelfs maar een klein beetje verkeerd vertaalt, wijst de computer het af. Huidige AI-modellen (LLM's) zijn als enthousiaste maar onervaren vertalers. Ze doen vaak het volgende:

  1. Hallucineren: Ze verzinnen woorden of regels die niet bestaan in het woordenboek van de computer.
  2. De betekenis verkeerd begrijpen: Ze gebruiken de juiste woorden, maar in de verkeerde volgorde, waardoor de betekenis volledig verandert.
  3. Opgeven bij moeilijke zaken: Wanneer ze geconfronteerd worden met een gloednieuw, complex onderzoeksverhaal, bevriezen ze omdat ze geen vooraf geschreven antwoord in hun geheugen hebben.

De Oplossing: Maak kennis met Aria

De auteurs hebben een nieuwe AI-agent gebouwd genaamd Aria. Zie Aria niet als een vertaler, maar als een Meesterarchitect die een brug bouwt tussen Menselijke Wiskunde en Computerwiskunde.

Aria raadt de vertaling niet alleen. Het gebruikt een driestappenproces om ervoor te zorgen dat de brug stevig is:

1. De "Afhankelijkheidskaart" (Graph-of-Thought)

De Analogie: Stel je voor dat je een wolkenkrabber probeert te bouwen. Je kunt niet zomaar beton storten voor de bovenste verdieping; je hebt eerst het fundament, de stalen balken en de loodgieterswerk nodig.
Hoe Aria het doet: In plaats van te proberen de hele wiskundige opgave in één keer te vertalen, breekt Aria deze af. Het tekent een kaart (een graaf) die laat zien hoe elk concept van andere concepten afhankelijk is.

  • Voorbeeld: Om "Cohen-Macaulay Module" te begrijpen, moet je eerst "Noetherian Ring" begrijpen, wat weer "Ideal" nodig heeft, wat weer "Ring" nodig heeft.
  • Aria bouwt de brug van onder naar boven, waarbij het ervoor zorgt dat elke enkele steen correct is gelegd voordat het naar het volgende niveau gaat.

2. De "Bibliotheekdetective" (Retrieval-Augmented Generation)

De Analogie: Stel je een student voor die een toets maakt waarbij hij een bibliotheek mag gebruiken, maar niet de boeken uit zijn hoofd mag leren. Als de student een regel verzint, wordt hij betrapt.
Hoe Aria het doet: Wiskundige bibliotheken (zoals Mathlib) worden constant bijgewerkt met nieuwe regels. Oude AI-modellen vertrouwen op wat ze jaren geleden uit hun hoofd hebben geleerd, wat vaak verouderd of onjuist is.

  • Aria werkt als een detective. Voordat het ook maar één regel code schrijft, doorzoekt het de huidige bibliotheek om de exacte, officiële definitie van de termen die het nodig heeft te vinden.
  • Als de bibliotheek geen definitie heeft voor een nieuw concept, weet Aria dat het er een vanaf nul moet uitvinden, maar doet het dit zorgvuldig door zijn werk te controleren aan de hand van de regels die het net heeft gevonden.

3. De "Zelfcorrectie-lus" (Iterative Reflection)

De Analogie: Denk aan een beeldhouwer die een beeld uithakt. Ze hakken niet één keer en hopen dan op het beste. Ze hakken, stappen terug, kijken ernaar, zien een fout, en hakken dan opnieuw.
Hoe Aria het doet:

  • Aria schrijft een stuk code.
  • Het voert dit uit via de computercompiler (de strenge rechter).
  • Als de computer zegt "Error", raakt Aria niet in paniek. Het leest de foutmelding, begrijpt wat er misging en probeert het opnieuw.
  • Het herhaalt deze "proberen-falen-repareren"-cyclus totdat de code perfect compileert.

De "Waarheidsdetector": AriaScorer

Zelfs als de code compileert (draait zonder te crashen), kan het nog steeds het verkeerde betekenen. Dit is als een zin die grammaticaal perfect is, maar zegt: "De lucht is groen."

De auteurs hebben een speciaal hulpmiddel gebouwd genaamd AriaScorer om de betekenis te controleren.

  • De Oude Manier: Eerdere tools vergeleken alleen de woorden. Als de mens "Ring" zei en de code zei "Ring", dachten ze dat het een match was.
  • De Aria-Manier: AriaScorer is een diepgaande onderzoeker. Het zoekt de werkelijke definitie van "Ring" op in de bibliotheek van de computer en vergelijkt die diepe definitie met de intentie van de mens.
  • Het vangt subtiele trucs op, zoals wanneer de AI de volgorde van ingrediënten in een recept verwisselt. Het zorgt ervoor dat de versie van de computer wiskundig identiek is aan het idee van de mens, en niet alleen op elkaar lijkt.

De Resultaten: Hoe goed is Aria?

Het team testte Aria op drie niveaus van moeilijkheid:

  1. Bachelorwiskunde (ProofNet): Aria kreeg 68,5% van de moeilijke vertalingen goed, waarmee het alle vorige modellen versloeg.
  2. PhD-niveau Wiskunde (FATE-X): Dit is waar andere modellen meestal falen. Aria kreeg 44,0% goed, terwijl het op één na beste model slechts 24,0% haalde.
  3. Echt Onderzoek (De "Onmogelijke" Test): Het team gaf Aria 14 gloednieuwe, onopgeloste wiskundeproblemen van echte wiskundigen.
    • Andere AI-modellen: 0% succes. Ze konden niet eens beginnen.
    • Aria: 42,9% succes. Het slaagde erin bijna de helft van deze gloednieuwe, nooit eerder geziene problemen te vertalen naar een formaat dat de computer kon begrijpen.

Samenvatting

Aria is een systeem dat stopt met AI het "verzinnen van dingen" wanneer het geavanceerde wiskunde doet. In plaats van te gokken, doet het het volgende:

  1. Brengt afhankelijkheden in kaart (als een blauwdruk).
  2. Zoekt in de officiële bibliotheek naar huidige regels (als een detective).
  3. Itereert en herstelt zijn eigen fouten (als een beeldhouwer).
  4. Verifieert de diepe betekenis, niet alleen de oppervlakkige woorden (als een waarheidsdetector).

Dit stelt het in staat om complexe, onderzoeksniveau wiskundeproblemen aan te pakken die voorheen simpelweg onbereikbaar waren voor AI-systemen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →