Deterministic vs. LLM-Controlled Orchestration for COBOL-to-Python Modernization
Dit artikel presenteert een gecontroleerde empirische studie die aantoont dat deterministische orchestratie beter presteert dan door LLM-gestuurde agentische workflows bij COBOL-naar-Python modernisering door vergelijkbare vertaalnauwkeurigheid te bereiken, terwijl de robuustheid aanzienlijk wordt verbeterd, de prestatievariabiliteit wordt verminderd en de operationele kosten met wel 3,5x worden verlaagd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Decennialang hebben de financiële en overheidssectoren vertrouwd op enorme, ingewikkelde computerprogramma's geschreven in een taal genaamd COBOL. Deze systemen draaien de banktransacties en sociale zekerheidsbetalingen van de wereld, maar de experts die ze hebben gebouwd zijn aan het pensioneren en de code zelf is vaak decennia oud, slecht gedocumenteerd en moeilijk te wijzigen. Om deze vitale diensten draaiende te houden, moeten organisaties deze eeuwenoude code vertalen naar moderne talen zoals Python, een proces dat extreme precisie vereist omdat zelfs een kleine fout kan leiden tot het falen van een systeem. Onlangs is er een nieuw type kunstmatige intelligentie, bekend als een groot taalmodel, opgekomen als een potentieel hulpmiddel voor deze taak. Deze modellen kunnen code lezen en nieuwe code schrijven, maar ze werken vaak door te fungeren als autonome agenten: ze beslissen zelf welke stappen ze nemen, wanneer ze een taak opnieuw proberen en hoe ze fouten herstellen terwijl ze bezig zijn. Dit roept een cruciale vraag op voor ingenieurs: is het beter om de kunstmatige intelligentie het hele proces te laten aansturen, waarbij het elke zet in realtime zelf beslist, of is het effectiever om het proces op een strikt, vooraf gedefinieerd traject te houden waarbij de computer een vaste set regels volgt?
Een team van onderzoekers aan de Bucknell University en Astrio zette zich met deze vraag bezig door een gecontroleerd experiment uit te voeren om te zien hoe deze twee verschillende benaderingen omgaan met de moeilijke taak van het converteren van COBOL-code naar Python. Ze bouwden een systeem genaamd ATLAS om als vertaler te fungeren, maar ze ontwierpen het experiment zo dat het enige dat tussen de tests veranderde, wie er achter het stuur zat. In de ene versie kreeg de kunstmatige intelligentie de volledige controle, waarbij het de vrijheid had om zijn eigen pad te kiezen, zijn eigen instrumenten te selecteren en te beslissen wanneer het stopt of opnieuw begint. In de andere versie werd dezelfde kunstmatige intelligentie gebruikt om de code te schrijven, maar een rigide, onveranderlijke set regels dicteerde exact welke stappen te nemen waren, in welke volgorde, en hoe vaak er opnieuw geprobeerd moest worden als er iets misging. Door de hersenen van het systeem — het taalmodel — exact hetzelfde te houden in beide scenario's, konden de onderzoekers het effect van de controlemethode zelf isoleren, waardoor alle andere variabelen werden weggenomen om te zien welke strategie werkelijk beter werkte.
De resultaten van dit onderzoek toonden een duidelijke afweging tussen flexibiliteit en betrouwbaarheid. Wanneer de kunstmatige intelligentie de vrijheid kreeg om het proces te controleren, slaagde het er regelmatig in om een werkend programma te produceren, waarbij het vaak slaagde in het genereren van een resultaat dat zonder crashen kon draaien. Deze successen kwamen echter met een verborgen prijs: de resultaten waren inconsistent. Omdat het model zelf beslissingen nam over hoe verder te gaan, konden dezelfde startcode bij verschillende pogingen tot zeer verschillende uitkomsten leiden, waarbij het soms een perfecte vertaling produceerde en op andere momenten op onvoorspelbare wijze faalde. Bovendien was deze "agentic" benadering ongelooflijk duur. Het model zou vaak langdurige, kronkelende paden van redenering bewandelen, zichzelf vragen stellen en meerdere strategieën proberen die niet noodzakelijk waren, wat enorme hoeveelheden computationele middelen consumeerde. In sommige gevallen gebruikte de flexibele benadering meer dan drie keer zoveel tokens — de basisunits van informatie die het model verwerkt — als de vaste benadering om een vergelijkbaar resultaat te bereiken.
In contrast hiermee produceerde het systeem dat een vast, deterministisch pad volgde resultaten die veel stabieler en voorspelbaarder waren. Hoewel de algehele bekwaamheid om de code te vertalen net zo goed was als die van de flexibele versie, faalde het rigide systeem zelden in de ergste gevallen. Het raakte niet verdwaald in lussen van onnodig nadenken en het varieerde zijn gedrag niet van de ene run naar de andere. Het belangrijkste was dat het aanzienlijk goedkoper was om uit te voeren. Door zich aan een strikt schema van stappen te houden en de kunstmatige intelligentie alleen te gebruiken om de code te schrijven in plaats van om de reis te plannen, verminderde het systeem de kosten van de vertaling met een factor drie tot drieënhalf. De onderzoekers ontdekten dat voor taken zoals het moderniseren van legacy-software, waarbij de stappen goed gedefinieerd zijn en de resultaten gecontroleerd kunnen worden aan de hand van strikte regels, het de kunstmatige intelligentie laten besturen van de auto niet alleen duurder was, maar ook minder betrouwbaar dan het hebben van een door een mens ontworpen kaart die de weg wijst.
Deze studie suggereert dat de toekomst van het gebruik van kunstmatige intelligentie in complexe technische taken mogelijk niet ligt in het geven van totale vrijheid aan machines om te beslissen hoe ze moeten werken. In plaats daarvan lijkt de meest effectieve benadering het inbedden van deze krachtige modellen in een gestructureerd kader waar de spelregels vaststaan en het pad duidelijk is. De kunstmatige intelligentie blijft de deskundige schrijver, in staat om complexe instructies te begrijpen en nieuwe code te genereren, maar de orchestratie van het werk — de planning, de timing en de veiligheidscontroles — blijft onder strikte, deterministische controle. Dit zorgt ervoor dat het proces niet alleen in staat is om hoogwaardige resultaten te leveren, maar ook robuust, voorspelbaar en economisch levensvatbaar blijft voor de grootschalige, kritieke systemen die onze moderne wereld draaiende houden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.