← Nieuwste papers
🤖 AI

Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics

Het artikel introduceert "Formele Conjecturen", een dynamische, open-source benchmark van 2.615 in Lean 4 geformaliseerde wiskundige problemen afkomstig uit actief onderzoek, ontworpen om de capaciteiten van geautomatiseerde redeneersystemen te evalueren en te stimuleren bij het ontdekken van nieuwe bewijzen, terwijl de gegevensintegriteit wordt gewaarborgd door middel van gemeenschapscollaboratie en door AI geauditeerde verificatie.

Oorspronkelijke auteurs: Moritz Firsching, Paul Lezeau, Salvatore Mercuri, Miklós Z. Horváth, Yaël Dillies, Calle Sönne, Eric Wieser, Fred Zhang, Thomas Hubert, Blaise Agüera y Arcas, Pushmeet Kohli

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Moritz Firsching, Paul Lezeau, Salvatore Mercuri, Miklós Z. Horváth, Yaël Dillies, Calle Sönne, Eric Wieser, Fred Zhang, Thomas Hubert, Blaise Agüera y Arcas, Pushmeet Kohli

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robot te leren geavanceerde wiskunde. In het verleden had je de robot misschien een stapel oude wiskundehuiswerkopgaven gegeven. Maar er is een groot probleem: de robot heeft de antwoorden misschien gewoon uit het internet onthouden in plaats van echt te leren denken. Het is als een student die het antwoordensleutel van een toets heeft onthouden, maar de wiskunde niet begrijpt.

Dit artikel introduceert een nieuwe, slimmere manier om deze robots te testen. Ze noemen het Formele Vermoedens.

Zo werkt het, opgesplitst in eenvoudige ideeën:

1. De "Vers Vlees"-test (Zero Contaminatie)

De meeste wiskundetoetsen voor AI zijn "stale". De antwoorden staan al online, dus de AI kopieert ze misschien gewoon.

  • De Analogie: Stel je een kookwedstrijd voor waarbij de jury de chefs een recept geeft dat ze nog nooit hebben gezien, geschreven in een geheime code. Als de chef het gerecht kan bereiden, weet hij echt hoe te koken. Als hij het niet kan, raadt hij alleen maar.
  • De Oplossing van het Artikel: De auteurs hebben een bibliotheek gemaakt van 1.029 onopgeloste wiskundeproblemen (vermoedens). Dit zijn problemen die echte menselijke wiskundigen momenteel proberen op te lossen. Omdat niemand ze nog heeft opgelost, kan de AI de antwoorden niet hebben onthouden. Als de AI er een oplost, is het een echte ontdekking, geen kopieer-en-plakklus.

2. De "Strenge Rechter" (Lean 4)

In normale wiskunde kun je een bewijs schrijven dat er goed uitziet maar een kleine logische fout bevat. Mensen missen die misschien.

  • De Analogie: Denk aan een videospel waar je een brug moet bouwen. Als je een zwakke baksteen gebruikt, stort de brug in. In dit artikel is de "brug" een wiskundig bewijs. De auteurs gebruiken een speciale computertaal genaamd Lean 4 als rechter.
  • De Oplossing van het Artikel: Lean 4 is als een super-strenge scheidsrechter. Het geeft niet om of je bewijs er mooi uitziet; het controleert elke enkele logische stap. Als er zelfs maar één kleine fout is, zegt de scheidsrechter: "Nee, dat is fout." Dit zorgt ervoor dat wanneer de AI zegt dat het een probleem heeft opgelost, het dat ook echt heeft gedaan.

3. De "Levende Bibliotheek" (Een Evoluerende Benchmark)

Meestal blijft een toets, eenmaal gemaakt, voor altijd hetzelfde. Maar AI wordt elke dag slimmer, dus oude toetsen worden te makkelijk.

  • De Analogie: Stel je een videospel voor dat elke week wordt bijgewerkt. Naarmate spelers beter worden, voegt het spel moeilijkere levels toe en repareert het bugs op de kaart.
  • De Oplossing van het Artikel: Deze benchmark is een "levend" project.
    • Het groeit: Ze blijven nieuwe problemen toevoegen uit echte onderzoeksartikelen.
    • Het repareert zichzelf: Soms zijn de wiskundeproblemen zelf vaag geschreven. Als de AI ze probeert op te lossen, kan het mislukken omdat het probleem onduidelijk was. Deze mislukking helpt menselijke wiskundigen te beseffen: "Oh, we hebben dat probleem verkeerd opgeschreven!" Ze verbeteren dan de probleemstelling.
    • Het heeft twee sporen:
      1. Het Ontdekkingspad: Pogingen om de onopgeloste problemen op te lossen (het "verse vlees").
      2. Het Vertaalspoor: Het nemen van problemen die mensen al hebben opgelost en de AI leren ze te schrijven in de strenge computertaal (Lean 4).

4. De "Veiligheidsnet" (Het Vermijden van Cheaten)

De auteurs maken zich zorgen over "datalekken" (de AI die cheat door de antwoorden in haar trainingsdata te zien).

  • De Analogie: Om te voorkomen dat studenten cheaten, sluiten leraren het antwoordensleutel soms op in een kluis en openen die pas na de toets.
  • De Oplossing van het Artikel: Ze hebben een "bevroren" versie van de toets gemaakt. Dit is een momentopname van 100 problemen die in de tijd is vergrendeld. Zelfs als de hoofdbibliotheek later verandert, blijft deze specifieke momentopname hetzelfde, zodat wetenschappers verschillende AI-modellen eerlijk kunnen vergelijken zonder zich zorgen te hoeven maken dat de toets onder hen verandert.

5. Waarom Dit Belangrijk Is

Het artikel toont aan dat dit systeem al werkt.

  • Echte Resultaten: Ze vermelden dat met behulp van dit systeem een AI (genaamd Aristotle) een menselijke wiskundige hielp een beroemd probleem op te lossen dat al lang open stond (Erdős-probleem 124).
  • Het Signaal: De benchmark biedt een duidelijk "beklimbaar signaal". Het toont precies aan hoe ver AI is gekomen en hoe ver het nog moet gaan. Als een AI 10% van de onopgeloste problemen oplost, is dat een groot iets. Als het 0% oplost, is het nog niet klaar.

Samenvatting

Formele Vermoedens is een nieuwe, voortdurend bijgewerkte speelplaats voor AI-wiskundigen. Het gebruikt een strenge computerrechter (Lean 4) om werk te controleren, richt zich op problemen die nog niet zijn opgelost om cheating te voorkomen, en fungeert als een collaboratief hulpmiddel waarbij mensen en AI elkaar helpen bij het verduidelijken van moeilijke wiskundevragen. Het is niet zomaar een test; het is een hulpmiddel voor het maken van echte wiskundige ontdekkingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →