Can LLMs Solve Science or Just Write Code? Evaluating Quantum Solver Generation
Dit artikel introduceert Q-SAGE, een iteratieve evaluatiemethodologie die aantoont dat Large Language Models, hoewel ze door verfijning quantumoplossers kunnen genereren met verbeterde slagingspercentages, nog steeds worstelen met numerieke nauwkeurigheid en aanzienlijke rekenkundige overhead veroorzaken, waardoor de huidige beperkingen in het volledig automatiseren van de ontwikkeling van wetenschappelijke quantumsoftware aan het licht komen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer getalenteerde, hyper-snelle robotassistent hebt die fantastisch is in het schrijven van computercode. Je vraagt hem om een complexe machine te bouwen om een moeilijk natuurkundig raadsel op te lossen. De robot typt de code uit en de machine begint te draaien. Hij crasht niet! Hij geeft geen foutmelding! Het lijkt perfect te werken.
Maar hier zit de adder onder het gras: De machine draait, maar hij geeft je het verkeerde antwoord.
Dit is het kernprobleem dat onderzoekers van het Politecnico di Milano en de Universiteit van Luxemburg aanpakten in hun paper "Can LLMs Solve Science or Just Write Code?". Ze wilden weten of Large Language Models (LLMs) – de AI-geesten achter tools zoals ChatGPT – daadwerkelijk code kunnen schrijven die echte wetenschappelijke problemen correct oplost, of dat ze alleen code schrijven die er goed uitziet maar faalt in de wiskundetest.
De "Q-SAGE"-workshop
Om dit uit te zoeken, bouwden de onderzoekers een testkader genaamd Q-SAGE. Denk aan Q-SAGE als een strenge, iteratieve workshop voor AI-code:
- De Opdracht: De AI krijgt een wetenschappelijk probleem (zoals het uitvogelen hoe elektronen zich gedragen in een klein magneetje of hoe moleculen bindingen aangaan).
- Het Concept: De AI schrijft een Python-script om het op te lossen.
- De Testrun: Het script wordt uitgevoerd op een computer.
- De Realiteitscheck: Het resultaat wordt vergeleken met een "Gouden Standaard" – een betrouwbaar, ouderwets klassiek computerprogramma waarvan we weten dat het het juiste antwoord geeft.
- De Feedbacklus: Als het antwoord van de AI verkeerd is (of de code crasht), zegt de workshop niet zomaar "Mislukt". Het vertelt de AI waarom het mislukt is (bijvoorbeeld "Je hebt een rekenfout gemaakt" of "De code is gecrasht"). De AI herschrijft vervolgens de code en probeert het opnieuw.
Ze voerden deze workshop uit met vijf verschillende soorten wetenschappelijke problemen (variërend van kwantumfysica tot chemie) en vijf verschillende AI-modellen (sommige open-source, sommige van grote techbedrijven).
Wat ze ontdekten
1. Het "Eerste Concept"-probleem
Toen de AI werd gevraagd om de code slechts één keer te schrijven (zonder feedback), faalde het vaak. Het was alsof je een student een eindexamen laat maken zonder enig studeren of oefenen. Veel scripts crashten direct, of ze gebruikten de verkeerde hulpmiddelen (zoals het gebruik van een hamer om een gloeilamp in te draaien).
2. De magie van "Probeer, Faal, Fix"
Toen de onderzoekers de AI de ruimte gaven om te itereren – door het zijn fouten te laten zien en het opnieuw te laten proberen – steeg het slagingspercentage dramatisch.
- Analogie: Stel je een chef-kok voor die een taart probeert te bakken. De eerste keer vergeten ze de eieren. De jury zegt: "Geen eieren." De chef probeert het opnieuw, voegt eieren toe, maar verbrandt de taart. De jury zegt: "Verlaag de hitte." Bij de derde of vierde poging bakt de chef eindelijk een perfecte taart.
- Het resultaat: Voor eenvoudigere problemen werd de AI zeer goed in het zelf oplossen van zijn eigen fouten binnen ongeveer 5 pogingen.
3. De "Stille Moordenaar": Verkeerde Wiskunde
Hier is de belangrijkste bevinding: Naarmate de AI-modellen slimmer werden, veranderde het type fouten.
- Domme AI: Maakte "syntaxis"-fouten. De code zou niet eens draaien. Het was als een auto die niet wilde starten omdat de sleutels in het verkeerde contact zaten.
- Slimme AI: De code draaide perfect! Maar de cijfers waren verkeerd. Het was als een auto die soepel reed maar een verkeerde afslag nam omdat de GPS iets afweek.
- De les: Zelfs de beste AI-modellen worstelen met numerieke nauwkeurigheid. Ze kunnen code schrijven die eruit ziet als een oplossing voor kwantumfysica, maar de wiskunde erin is iets afwijkend, wat leidt tot wetenschappelijk onbruikbare resultaten.
4. De kosten van perfectie
Het laten oplossen van fouten door de AI kost tijd.
- Analogie: Als je een mens vraagt om een rapport te schrijven, duurt het een uur. Als je hen vraagt om het te schrijven, feedback te krijgen, het te herschrijven, opnieuw feedback te krijgen en het vijf keer te herschrijven, kan het vijf uur duren.
- Het resultaat: De onderzoekers ontdekten dat iteratieve feedback wel werkte, maar dat het gepaard ging met een enorme "tijdstaks". Het krijgen van een correct antwoord duurde vaak veel langer dan het gewoon één keer uitvoeren van de code. Bij zeer complexe problemen bleef de AI soms vastzitten in een lus van proberen en falen, waarbij veel computertijd werd verbrand.
De conclusie
De paper concludeert dat hoewel AI beter wordt in het schrijven van code, het nog geen betrouwbare wetenschapper is.
- Kan het code schrijven? Ja, vooral als je het zijn fouten laat oplossen.
- Kan het wetenschap oplossen? Niet betrouwbaar op zichzelf. Het produceert vaak code die draait maar de verkeerde cijfers geeft.
De onderzoekers suggereren dat AI voor nu een geweldige "tekenaar" is die je 80% van de weg kan brengen, maar dat een menselijk expert (of een zeer strenge verificatiesysteem) nog steeds nodig is om de uiteindelijke wiskunde te controleren. Je kunt de AI niet zomaar vertrouwen om de wetenschap te doen; je moet de resultaten verifiëren, omdat een draaiend programma niet altijd een correct antwoord betekent.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.