← Nieuwste papers
💻 computer science

PROVE-RT: Generating Mechanized Theorem Prover Scripts for Real-Time Systems using LLMs

Dit artikel introduceert PROVE-RT, een door LLM ondersteund framework dat afhankelijkheidsbewuste schetsen, documentretrieval en gefaseerde generatie gebruikt om succesvol de creatie van gemachiniseerde PROSA/ROCQ-scripts voor real-time planbaarheid-analyse te automatiseren, waarbij een succespercentage van 44,7% wordt bereikt waar directe prompting faalt.

Oorspronkelijke auteurs: Sadat Shahriyar, Shareef Ahmed, Abdullah Al Arafat

Gepubliceerd 2026-08-14
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sadat Shahriyar, Shareef Ahmed, Abdullah Al Arafat

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, ingewikkelde klokwerkmachine bouwt waarbij elk tandwiel op exact het juiste moment moet draaien. Als één klein tandwiel slipt, komt de hele machine stil te staan, en in de echte wereld zou dit kunnen betekenen dat een zelfrijdende auto een stopbord mist of een pacemaker een hartslag mist. Dit is de wereld van real-time systemen: computers die dingen niet alleen correct moeten doen, maar ook op tijd. Decennialang hebben ingenieurs gecontroleerd of deze machines zouden werken door lange, complexe wiskundige bewijzen op papier uit te schrijven, zoals een detective die een mysterie oplost met een notitieblok en een potlood. Maar naarmate deze machines complexer worden, worden die papieren bewijzen rommelig, moeilijk te controleren en gemakkelijk foutief. Om dit op te lossen, hebben wetenschappers een "digitale bewijscontroleur" uitgevonden (een hulpmiddel genaamd PROSA/ROCQ) die werkt als een superstrenge robotrechter. Deze robot kan de wiskunde lezen en zeggen: "Ja, dit is 100% waar," of "Nee, je hebt hier een fout gemaakt." Het probleem? Een mens leren om de instructies voor deze robot te schrijven is ongelooflijk moeilijk, traag en vereist een begrip op PhD-niveau van zowel wiskunde als computercode.

Ontmoet PROVE-RT, een nieuwe tool die probeert een "slimme AI-assistent" (een Large Language Model) te leren hoe hij de instructies voor deze robot voor ons moet schrijven. Denk aan het inhuren van een briljante maar ietwat verwarde stagiair die veel van wiskunde weet, maar nog nooit het specifieke regelboek voor deze klokwerkmachine heeft gezien. Als je de stagiair alleen vraagt om "het bewijs te schrijven", kan hij regels verzinnen die goed klinken, maar die eigenlijk onjuist zijn. PROVE-RT is de slimme manager die de stagiair niet zomaar een leeg blad geeft. In plaats daarvan geeft de manager een stapschets van het plan, een stapel van de exacte pagina's uit het regelboek die nodig zijn, en een systeem om het werk te controleren voordat hij het inlevert. Het paper laat zien dat, hoewel de AI alleen verschrikkelijk is in deze specifieke taak (hij krijgt het minder dan 1% van de tijd goed), de AI met de hulp van dit "manager"-systeem de correcte instructies voor ongeveer 45% van de taken succesvol kan schrijven. Het is nog geen toverstaf die alles oplost, maar het is een enorme sprong voorwaarts in het helpen van computers om veiligere, betere machines te bouwen.

Het Probleen: De "Papieren Bewijs"-bottleneck

Al een lange tijd gebruiken ingenieurs "pen-en-papier"-bewijzen om te bewijzen dat hun real-time systemen veilig zijn. Het is een beetje alsof je een wolkenkrabber probeert te bouwen door de blauwdrukken op een servet te tekenen. Voor kleine gebouwen werkt het, maar wanneer je bij een wolkenkrabber komt, wordt het servet rommelig en is het moeilijk om de kleine fout te vinden die ervoor zorgt dat het hele bouwwerk instort.

Om dit op te lossen, creëerden onderzoekers PROSA, een digitale bibliotheek van regels en bewijzen die een computer kan controleren. Het is alsof je upgradet van een servet naar een 3D-simulatie waarbij de computer je direct vertelt als een balk te zwak is. Maar hier zit de crux: het schrijven van de code voor deze 3D-simulatie is ongelooflijk moeilijk. Het vereist een menselijke expert om hun rommelige servet-tekeningen te vertalen naar een rigide, computerleesbare taal. Het is zo moeilijk dat zelfs eenvoudige wijzigingen in het ontwerp de code kunnen breken, wat uren van saai herschrijfwerk vereist.

De Oplossing: PROVE-RT (De "Slimme Manager")

De auteurs van dit paper realiseerden zich dat hoewel AI (Large Language Models) geweldig is in het schrijven van code en het oplossen van wiskundige problemen, het in de war raakt wanneer het wordt gevraagd om code te schrijven voor deze specifieke "robotrechter" (PROSA) zonder hulp. De AI kent de specifieke vocabulaire of de strikte volgorde van regels niet.

Dus bouwden ze PROVE-RT, een framework dat fungeert als een brug tussen de rommelige menselijke ideeën en de strikte computercode. Ze vroegen de AI niet simpelweg om het "te doen". In plaats daarvan braken ze de taak af in vier duidelijke stappen, als een lopende band in een fabriek:

  1. De Schets: Eerst neemt het systeem het oorspronkelijke papieren bewijs en gebruikt het een AI om het om te zetten in een heldere, stapsgewijze "informele schets". Het is alsof je een complex juridisch contract omzet in een eenvoudige opsomming van wat er moet gebeuren.
  2. De Bibliotheekzoekopdracht: Vervolgens zoekt het systeem door een enorme bibliotheek met PROSA-documentatie om de exacte regels en voorbeelden te vinden die de AI voor die specifieke stap nodig heeft. Het is alsof de manager de stagiair de specifieke pagina van het regelboek overhandigt die hij nodig heeft, in plaats van hem te laten gissen.
  3. Het Skelet: De AI bouwt vervolgens het "skelet" van de code. Dit is de structuur: de namen van de variabelen, de typen data en de probleemstelling. Cruciaal is dat de AI het eigenlijke "bewijs"-gedeelte leeg laat (gemarkeerd als "Admitted", wat betekent "vertrouw me, ik vul dit later aan"). Dit zorgt ervoor dat de structuur correct is voordat de AI zich bezighoudt met de moeilijke wiskunde.
  4. De Afwerking: Ten slotte vult de AI de lege bewijsdelen in. Als de computerrechter zegt: "Dit compileert niet", gebruikt het systeem die foutmelding om de AI te vertellen: "Probeer het opnieuw, maar corrigeer deze specifieke fout."

Wat ze vonden (De Resultaten)

Het team testte dit systeem op een enorme collectie van 1.191 real-time systeempapers, waardoor ze een dataset van meer dan 13.000 "schetsen" creëerden om hun tool te trainen en te testen. Ze vergeleken PROVE-RT met het direct vragen aan de beste AI-modellen om de code te schrijven.

De resultaten waren schrijnend. Wanneer ze de AI simpelweg vroegen de code te schrijven (de methode van "direct prompting"), faalde het bijna volledig. Het kreeg 0% van de taken goed met één model en slechts 0,33% met een ander model. De AI verzon regels en schreef code die op PROSA leek, maar die binnen het systeem niet echt werkte.

Echter, wanneer ze het PROVE-RT "manager"-systeem gebruikten, sprong het succespercentage naar 44,7%. Dit betekent dat de AI succesvol de correcte, door de computer gecontroleerde bewijzen genereerde voor bijna de helft van de complexe scheduling-problemen waarop het werd getest.

Waarom dit ertoe doet

Het paper suggereert dat we niet simpelweg op AI kunnen vertrouwen om "alles te weten" over een nicheveld zoals real-time systemen. De AI heeft begeleiding nodig. Door het probleem op te splitsen, de AI de juiste context te geven (retrieval), en het werk in fasen te controleren (eerst het skelet, dan het bewijs), kunnen we een verwarde AI transformeren tot een behulpzame assistent.

De auteurs merken op dat hoewel 44,7% een goed begin is, het nog niet perfect is. Het systeem heeft nog steeds moeite met de meest complexe problemen die lange ketens van afhankelijkheden hebben (zoals een wolkenkrabber met 100 verdiepingen waarbij elke verdieping afhankelijk is van de verdieping eronder). Maar dit werk bewijst dat we, met de juiste tools, kunnen beginnen met het automatiseren van de creatie van deze veiligheidskritische bewijzen, waardoor onze real-time systemen veiliger en gemakkelijker te certificeren zijn. Het is een stap naar een toekomst waarin computers ons helpen bewijzen dat onze machines niet zullen falen, in plaats van dat wij zelf worstelen om dat te bewijzen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →