Can LLMs Build a MaxSAT Solver from Papers? The CoreForge Experience
Het artikel rapporteert over CoreForge, een experiment dat aantoont dat grote taalmodellen succesvol kunnen assisteren bij het bouwen van een functionele ongewogen MaxSAT-solver direct vanuit wetenschappelijke artikelen via een iteratieve workflow, hoewel het resulterende systeem nog steeds menselijke begeleiding en validatie vereist en qua prestaties achterblijft bij handmatig ontworpen solvers.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die probeert een enorme, verwarde knoop van aanwijzingen op te lossen. In de wereld van de informatica wordt deze knoop een "constraint problem" (beperkingsprobleem) genoemd. Je hebt een lijst met regels (zoals "de rode bal moet links liggen" of "de blauwe bal mag niet naast de groene staan") en je taak is om alles zo te rangschikken dat elke regel tevreden is. Soms is het onmogelijk om iedereen tevreden te stellen, dus verschuift het doel naar het vinden van de schikking die de meeste mensen tevreden stelt. Dit is de taak van een "MaxSAT-solver" — een superintelligente computerprogramma dat fungeert als een meester-puzzeloplosser, die de beste oplossing vindt wanneer een perfecte oplossing niet bestaat.
Decennialang was het bouwen van deze puzzeloplossers een taak voor menselijke experts. Zij moeten complexe wetenschappelijke artikelen lezen, diepe wiskundige theorieën begrijpen en vervolgens jarenlang miljoenen regels code schrijven, waarbij ze minuscule details bijsturen om de solver snel genoeg bruikbaar te maken. Maar onlangs is er een nieuw soort digitale assistent gearriveerd: Large Language Models (LLM's). Dit zijn de AI-hersenen achter tools zoals ChatGPT, die verhalen, gedichten en zelfs computercode kunnen schrijven. De grote vraag is: kan een AI een wetenschappelijk artikel lezen en vanaf nul een werkende puzzeloplosser bouwen, zonder dat een mens ook maar één regel code schrijft? Dit is het mysterie dat het "CoreForge"-project probeert op te lossen.
Het CoreForge-experiment: AI leren om een puzzeloplosser te bouwen
In een project genaamd CoreForge besloot een onderzoeker genaamd Ruben Martins van Carnegie Mellon University de grenzen van AI te testen. In plaats van een AI te vragen een bestaande, kapotte puzzeloplosser te repareren, daagde hij het uit om er een vanaf de grond op te bouen, met alleen wetenschappelijke artikelen als instructiehandleiding. Denk eraan als het aan een robot geeft: een stapel kookboeken geschreven door beroemde chefs en hem vraagt om een restaurantkeuken te bouwen en een vijfsterrenmaaltijd te koken, zonder ooit eerder een fornuis te hebben gezien.
Het proces was geen "one-shot" tovertruc waarbij de AI simpelweg een perfect programma uitspuugde. In plaats daarvan was het een lange, iteratieve dans tussen mens en machine. De menselijke onderzoeker koos een wetenschappelijk artikel, besprak de hoofdideeën met de AI, en vroeg de AI (specifiek een programmeertool genaamd Codex) vervolgens om de code te schrijven. Maar de AI kreeg geen vrijbrief. De mens voerde vervolgens tests uit, controleerde op bugs en vroeg de AI om zijn fouten te herstellen. Ze herhaalden deze cyclus keer op keer, zoals een student en een tutor die samen een moeilijke wiskundevraag doorwerken, totdat ze een werkende solver hadden.
Wat hebben ze gebouwd?
Het resultaat was een enorme codebase van meer dan 25.000 regels C++ code. De AI slaagde erin om complexe wiskundige ideeën uit artikelen te vertalen naar werkende software. Het implementeerde verschillende geavanceerde strategieën, waaronder:
- Core-guided optimization: Een methode waarbij de solver leert van zijn fouten (zogenaamde "cores") om herhaling te voorkomen.
- Preprocessing: Het opschonen van de puzzel voordat men probeert deze op te lossen, om het makkelijker te maken.
- Lookahead: Een nieuwe functie die de AI hielp uitvinden, waarbij de solver een paar snelle "oefenrondes" doet om de beste strategie te raden voordat hij zich vastlegt op de echte oplossing.
Werkte het?
Het meest verrassende deel van het verhaal is dat de AI niet heeft valsgespeeld. De onderzoekers voerden duizenden tests uit, inclusief "fuzzing" (het gooien van willekeurige, chaotische data naar de solver om te zien of hij breekt) en het vergelijken met officiële wedstrijdbenchmarks. Ze vonden nul foute antwoorden in de geteste configuraties. De solver was wiskundig correct. Hij gokte niet alleen; hij loste de puzzels daadwerkelijk correct op.
Maar is het wel snel genoeg?
Hier zit de crux. Hoewel de AI een correcte solver heeft gebouwd, was het niet de snelste. Wanneer het werd vergeleken met de door mensen ontworpen solvers die al jarenlang worden verfijnd, was CoreForge trager en loste het minder puzzels op. Het is alsoك of de AI een auto heeft gebouwd die perfect rijdt en nooit crasht, maar die slechts 64 kilometer per uur gaat terwijl de beste door mensen gebouwde auto's 193 kilometer per uur gaan.
De onderzoekers ontdekten dat de AI erg goed was in het begrijpen van de hoogwaardige ideeën en het omzetten daarvan in code. Echter, de AI had moeite met de details van de "fine-tuning" — de minuscule, agressieve optimalisaties die een solver razendsnel maken. De AI voegde ook soms extra stappen toe die de boel vertraagden, zoals het nemen van een omweg wanneer een rechte weg beter zou zijn geweest.
Het eindoordeel
De CoreForge-ervaring suggereert dat AI zeker kan helpen bij het bouwen van complexe software vanuit wetenschappelijke artikelen, maar het is nog niet klaar om menselijke ingenieurs te vervangen. De AI heeft een menselijke gids nodig om het werk te controleren, te beslissen welke ideeën behouden blijven en te helpen voorkomen dat het in trage lussen blijft hangen.
Het artikel concludeert dat hoewel we het punt nog niet hebben bereikt waarop AI autonoom een wereldklasse solver kan bouwen, we er wel dichtbij komen. De AI bewees dat het de "kookboeken" kan lezen en de "keuken" kan bouwen. De volgende stap is om het te leren hoe het een meesterchef wordt die precies weet hoe hij de hitte en de timing moet afstemmen om een wedstrijd te winnen. Voor nu komen de beste resultaten voort uit een team: een mens die de strategie bepaalt en de AI die het zware werk doet van het schrijven van de code.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.