← Nieuwste papers
🤖 AI

Directed Neuro-Symbolic Stochastic Execution for Verification of Distributed Parallel AI Programs

Dit artikel introduceert Directed Neuro-Symbolic Stochastic Execution (DNSSE), een hybride testframework dat LLM-gestuurde planningvoorspelling combineert met symbolische constraint-solving en stochastische mutatie om gedistribueerde parallelle AI-programma's effectief te verifiëren, waarbij het aanzienlijk hogere branch-coverage en detectie van concurrency-bugs bereikt dan bestaande baselines.

Oorspronkelijke auteurs: Gautham Koorma, Vikas Sharma, George Edwards, Mahdi Eslamimehr

Gepubliceerd 2026-08-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Gautham Koorma, Vikas Sharma, George Edwards, Mahdi Eslamimehr

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert één specifiek zandkorreltje te vinden op een strand dat voortdurend verschuift, uitrekt en van vorm verandert. Dit is de dagelijkelijkse realiteit voor ingenieurs die bouwen aan de enorme, breinachtige computerprogramma's die de moderne kunstmatige intelligentie aandrijven. Deze programma's blijven niet gewoon stilzitten; ze draaien op enorme computerclusters, met duizenden kleine werkers (threads) die allemaal tegelijkertijd met elkaar communiceren. Het probleem is dat wanneer je zoveel werkers hebt die tegelijkertijd actie ondernemen, de volgorde waarin zij dingen doen een chaotische loterij wordt. Soms, als twee werkers op exact hetzelfde moment hetzelfde stukje informatie proberen te grijpen, kan het hele systeem een glitch krijgen, vastlopen of gegevens verliezen. Dit worden "concurrency bugs" genoemd, en ze zijn berucht moeilijk te vinden omdat ze alleen voorkomen onder zeer specifieke, zeldzame combinaties van timing en input.

Om het nog erger te maken, zitten deze AI-programma's vol complexe wiskunde die verandert op basis van de gegevens die ze verwerken. Traditionele testtools zijn als een zaklamp: ze kunnen licht werpen op één pad tegelijk, maar raken overweldigd wanneer het pad zich splitst in miljoenen mogelijkheden, of wanneer de wiskunde te vreemd wordt om ze te kunnen berekenen. Andere tools proberen met pijltjes in het donker te gooien, in de hoop door toeval een bug te raken, maar ze missen vaak de lastige plekken waar de wiskunde en de timing met elkaar botsen. We hebben een manier nodig om slimmer te zijn over waar we zoeken, waarbij we de precisie van een rekenmachine combineren met de intuïtie van een ervaren detective, terwijl we door een doolhof navigeren waarvan de muren voortdurend veranderen.

Hier komt een nieuwe aanpak genaamd Directed Neuro-Symbolic Stochastic Execution (DNSSE) in beeld. Denk aan DNSSE als een superintelligent team van drie detectives die samenwerken om deze onzichtbare bugs in AI-programma's op te sporen. De eerste detective is een Symbolic Engine, een rigoureuze wiskundige die eenvoudige, rechtlijnige logische puzzels perfect kan oplossen. De tweede is een Stochastic Engine, een dappere ontdekkingsreiziger die gebruikmaakt van willekeurige gissingen en trial-and-error om de rommelige, niet-lineaire wiskundige problemen aan te pakken die de wiskundige in de steek laten. De derde, en misschien wel de meest unieke, is een LLM Scheduler — een groot taalmodel dat fungeert als een ervaren gids. Deze gids heeft miljoenen codeverhalen gelezen en kan voorspellen welk pad door de chaotische doolhof het meest waarschijnlijk tot een ramp zal leiden.

Het artikel legt uit hoe het team deze drie krachten combineert. In plaats van alleen maar willekeurig te gokken of te proberen elk enkel pad op te lossen (wat eeuwig zou duren), kijkt de "gids" naar de code en zegt: "Hé, deze twee werkers gaan bijna ruzie maken over een gedeelde geheugenlocatie; laten we hen nu dwingen om te botsen." De wiskundige controleert vervolgens of de getallen logisch zijn voor die botsing, en de ontdekkingsreiziger probeert de specifieke gegevensinputs te vinden die de getallen laten kloppen. Als de gids ernaast zit, heeft het team een vangnet: ze vallen terug op willekeurige exploratie, zodat het systeem nooit vastloopt.

De resultaten van deze nieuwe methode zijn indrukwekkend. Wanneer de onderzoekers DNSSE testten op vijf realistische, complexe AI-programma's — variërend van het trainen van modellen tot het serveren van gegevens — kwamen ze tot de conclusie dat het ver boven de beste bestaande tools uitsteekt. Terwijl de sterkste eerdere methode 25 bugs vond, vond DNSSE er 73, wat 2,9 keer meer is. Het slaagde er ook in om 91,6% van de mogelijke codepaden te dekken, een enorme sprong ten opzichte van de gemiddelde dekking van 68,6% bij de andere tools. Het systeem bereikte dit zonder vast te lopen, waarbij het werk voltooide in enkele duizend seconden, terwijl andere methoden na 24 uur een time-out kregen. De "gids" (de LLM) gebruikte slechts ongeveer 14,3% van de totale rekentijd, wat bewijst dat een beetje slimme begeleiding een heel eind komt bij het temmen van de chaos in gedistribueerde AI-systemen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →