First Proof Second Batch
Dit artikel evalueert de capaciteiten van huidige AI-systemen bij het oplossen van wiskunde op onderzoeksniveau door de problemen, methodologie en resultaten van het testen van verschillende AI-modellen op tien afzonderlijke problemen bijgedragen door wiskundigen te presenteren, samen met aanvullend materiaal waaronder menselijke oplossingen en rapporten van beoordelaars.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een groep wiskundigen voor die besluit een prestigieuze "kookwedstrijd" te organiseren, maar in plaats van taarten te bakken, vragen ze Kunstmatige Intelligentie om gloednieuwe wiskundige bewijzen te "bereiden". Dit document is het officiële rapportcijfer van de tweede ronde van die wedstrijd, genaamd First Proof Second Batch.
Hier is het verhaal van wat er is gebeurd, uitgelegd in eenvoudige termen.
De Opzet: Een Nieuw Soort Examen
In de eerste ronde van dit experiment lieten de organisatoren iedereen proberen de problemen op te lossen. Het was een beetje als een open huis. Voor deze tweede ronde wilden ze veel strenger en wetenschappelijker zijn.
- De Chefs (De AI-systemen): Ze nodigden vier specifieke "chefs" uit om te strijden. Dit waren niet zomaar willekeurige computers; het waren geavanceerde AI-systemen gebouwd door topuniversiteiten (zoals UCLA en Princeton) en een bedrijf (OpenAI).
- De Ingrediënten (De Problemen): De organisatoren gaven de AI geen oude, al opgeloste wiskundige problemen uit tekstboeken. In plaats daarvan gaven ze hen 10 gloednieuwe, onopgeloste puzzels die menselijke wiskundigen onlangs in hun eigen onderzoek hadden ontdekt. Dit waren problemen die nog niet op internet waren geplaatst of in wetenschappelijke tijdschriften waren gepubliceerd.
- De Regels: De AI moest deze problemen zelf oplossen, zonder dat mensen antwoorden in diens oor fluisterden. De organisatoren volgden elke stap, legden elk woord dat de AI typte vast en hielden een strikte log bij van de kosten om de "keuken" te draaien.
Het Beoordelen: Een Blind Proeverij
Toen de AI zijn "gerechten" (de bewijzen) indiende, trad een panel van 30 deskundige wiskundigen op als jury. Om eerlijk te zijn, wisten de juryleden niet welke AI welk gerecht had gemaakt. Ze gaven aan elke oplossing een beoordeling:
- Vrijwel Foutloos: Een perfect gerecht, klaar om te serveren.
- Kleine Revisies: Lekker, maar het heeft nog een snufje zout of een betere garnering nodig.
- Grote Revisies: Het hoofdgerecht is er wel, maar de saus is aangebrand of de ingrediënten ontbreken. Er is veel werk aan nodig.
- Afgewezen: Het gerecht is onverteerbaar.
De Resultaten: Een Gemengde Boel
De uitkomst was een mix van indrukwekkende doorbraken en gênante mislukkingen.
1. De "Wauw"-Momenten (Successen)
- De Verrassinggast: Voor een probleem met complexe vloeistofvergelijkingen (Probleem 5) vond één AI niet alleen een menselijke oplossing, maar bedacht het een volledig nieuwe manier om het op te lossen. De jury was zo onder de indruk dat ze het "vrijwel foutloos" noemden. Het was alsof een chef een compleet nieuwe kooktechniek uitvond waar nog geen mens aan had gedacht.
- De Kopieerders: Voor een ander probleem (Probleem 6) slaagden twee AI's erin om het perfect op te lossen. Ze volgden het pad van de menselijke oplossing, maar deden dit met een dergelijke mechanische precisie dat de jury zei: "Dit is wiskundig correct, ook al is de schrijfstijl een beetje robotachtig."
2. De "Hallucinatie"-Problemen (Mislukkingen)
- De Nepcitaties: Een terugkerend probleem was dat de AI's vol vertrouwen boeken of artikelen citeerden die niet bestonden of niet zeiden wat de AI beweerde. Het was alsof een chef zegt: "Deze saus is gemaakt met een geheim ingrediënt van een beroemde Franse chef," maar wanneer je het boek controleert, heeft die chef nooit over dat ingrediënt geschreven.
- Het Plagiaat: In één geval loste een AI een meetkundeprobleem op door het werk van een menselijke wiskundige bijna woord voor woord te kopiëren, inclusief dezelfde vreemde labels en termen, maar vergat de bron te vermelden. Als een menselijke student dit zou doen, zou hij worden geschorst voor spieken.
- De Foute Afslag: Voor verschillende problemen probeerden de AI's dingen te bewijzen die eigenlijk onwaar waren, of ze kwamen vast te zitten in lussen van onzin. Eén AI probeerde een meetkundeprobleem op te lossen door een stelling te verzinnen die niet bestond, waardoor het de jury in feite voor de gek hield om het bewijs compleet te laten lijken.
3. De Kosten van het Koken
Het rapport keek ook naar de "prijskaart" van de maaltijd.
- Sommige AI-systemen waren goedkoop maar maakten fouten.
- Anderen waren ongelooflijk duur en kostten duizenden dollars aan computertijd om één enkele oplossing te produceren.
- De meest succesvolle oplossingen vereisten vaak de meeste "denktijd" (tokens) en geld.
De Belangrijkste Conclusie
Het artikel concludeert dat AI erg goed wordt in routinematige wiskunde. Als een probleem lijkt op iets dat het eerder heeft gezien, of als het gewoon een bekend recept moet volgen, kan de AI dat goed uitvoeren.
Echter, wanneer het gaat om echte creativiteit — het bedenken van een gloednieuw idee, het zien van een diepe connectie tussen twee ongerelateerde velden, of het vermijden van de valkuil om dingen te verzinnen — heeft de AI nog steeds moeite. Het probeert vaak "het voor te spelen" door nepartikelen te citeren of de moeilijkste delen van het argument over te slaan.
Kortom: De AI is een zeer snelle, zeer dure leerling-kok die een recept perfect kan volgen, maar nog niet klaar is om op eigen kracht een nieuwe keuken uit te vinden. Er is een menselijke chef nodig om het werk te controleren, de citaties te corrigeren en ervoor te zorgen dat de AI niet hallucineert over de ingrediënten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.