Supporting System Testing with a Multi-Agent LLM-based Framework for Knowledge Graph Extraction: A Case Study with Ethernet Switch Systems
Dit artikel presenteert een multi-agent LLM-gebaseerd raamwerk dat kennisgrafieken uit semi-gestructureerde handleidingen voor Ethernet-switchconfiguratie extraheren en iteratief verfijnt om de geautomatiseerde generatie van accurate specificaties voor systeemtestgevallen te ondersteunen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Geheel: Een Rommelige Handleiding Omzetten in een Slimme Kaart
Stel je voor dat je een enorme, 500 pagina's tellende handleiding hebt voor een complex stukje machines (in dit geval een Ethernet-switch, wat werkt als een verkeersregelaar voor internetdata). Deze handleiding is geschreven voor mensen om te lezen, niet voor computers om te begrijpen. Het zit vol met "semi-gestructureerde" tekst—dat betekent dat er koppen en lijsten zijn, maar dat de belangrijke details vaak verborgen zitten in alinea's, vermengd met notities, of impliciet worden aangegeven in plaats van duidelijk te worden vermeld.
Het probleem? Een computer die probeert automatisch te testen of deze machine correct werkt, raakt in de war. Het kan niet eenvoudigweg achterhalen: "Als ik stap A doe, betekent dat dan dat ik stap B als volgende moet doen? En hoe moet de machine er precies uitzien nadat ik klaar ben?"
De auteurs van dit paper bouwden een slimme robotteam (een Multi-Agent LLM Framework) om deze rommelige handleidingen te lezen en om te zetten in een perfect georganiseerde kaart (een Kennisgrafiek). Deze kaart stelt computers in staat om automatisch testscripts te genereren om te controleren of de machine werkt, waardoor mensen worden bevrijd van het saaie, repetitieve werk dat ze handmatig deden.
De Cast van Personages: Een Team van Gespecialiseerde Robots
In plaats van één grote robot die alles tegelijk probeert te doen, creëerden de auteurs een team van drie gespecialiseerde "agenten" (AI-assistenten), elk met een specifieke taak, plus twee toezichthouders.
- De Routekaart Agent: Deze robot leest het "grote geheel"-gedeelte van de handleiding. Het achterhaalt de overkoepelende doelen (bijvoorbeeld: "We moeten loops in het netwerk detecteren").
- De Procedure Agent: Deze robot leest het "kruimelige" gedeelte. Het haalt de exacte commando's, knoppen om in te drukken en verwachte resultaten uit de tekst (bijvoorbeeld: "Typ deze specifieke code in, en je zou dit specifieke foutbericht moeten zien").
- De Mapper Agent: Dit is het cruciale verbindingsstuk. Het verbindt de "grote geheel"-doelen met de "kruimelige" stappen. Het beantwoordt de vraag: "Welke specifieke commando's bereiken dat overkoepelende doel eigenlijk?"
De Toezichthouders:
- De Rechter (EvalAgent): Nadat het team zijn werk heeft gedaan, controleert de Rechter hun huiswerk. Het vergelijkt de output van de robot met de originele handleiding om te zien of ze iets hebben gemist of iets verkeerd hebben begrepen.
- De Coach (ImprovAgent): Als de Rechter fouten vindt, corrigeert de Coach niet alleen het antwoord; het herschrijft de instructies (prompts) die aan de robots zijn gegeven, zodat ze de volgende keer niet dezelfde fout maken.
Het Proces: De "Probeer, Controleer, Repareer"-lus
Het systeem gebruikt een slimme cyclus genaamd de Extract-Evaluate-Improve (EEI)-lus. Denk hierbij aan een student die een oefentoets maakt:
- Extract: Het robotteam leest de handleiding en bouwt de kaart (Kennisgrafiek).
- Evaluate: De Rechter kijkt naar de kaart en zegt: "Je hebt hier een detail gemist," of "Je hebt deze notitie in het verkeerde vakje gezet." Het geeft een score.
- Improve: Als de score te laag is, komt de Coach in actie. Het kijkt naar de feedback van de Rechter en zegt: "Oké, de volgende keer moet je beter onderscheid maken tussen een 'doel' en een 'notitie'." Het update de instructies van de robot.
- Repeat: De robots proberen het opnieuw met de nieuwe instructies. Ze blijven dit doen totdat de kaart perfect is of totdat ze vaak genoeg hebben geprobeerd.
De Resultaten: Hoe Goed Werkte Het?
Het team testte dit systeem op 50 echte handleidingen van een grote tech-bedrijf (Huawei).
- De "Eerste Poging" was al verbazingwekkend: Zelfs zonder dat de "Coach" hen hielp om te verbeteren, kregen de robots het juiste antwoord 97% tot 99% van de tijd bij de eerste poging.
- De "Coach" hielp bij de moeilijke gevallen: Voor de paar handleidingen die bijzonder lastig of verwarrend waren, kwam de EEI-lus in actie. Het verfijnde de instructies, en de nauwkeurigheid schoot nog verder omhoog, met bijna perfecte scores.
- Mensen zijn het eens met de Robots: De auteurs lieten ook menselijke experts het werk controleren. Zij ontdekten dat de "Rechter"-robot en de menselijke experts 72% tot 80% van de tijd met elkaar overeenkwamen. De meeste meningsverschillen waren kleine dingen (zoals een ontbrekende spatie of een iets andere manier om een notitie te categoriseren), geen grote fouten.
- Reële Bruikbaarheid: Het team gaf de gegenereerde kaarten aan vijf ervaren menselijke testers. De testers zeiden dat de kaarten zeer nuttig, duidelijk en accuraat waren. Ze voelden dat de kaarten hen succesvol konden leiden bij het maken van testgevallen, hoewel ze opmerkten dat soms de "voorwaarden" (wat er moet worden ingesteld voordat je begint) een klein beetje menselijke polijsting nodig hadden om perfect duidelijk te zijn.
De Conclusie
Dit paper toont aan dat we een team van AI-robots kunnen gebruiken om complexe, rommelige technische handleidingen te lezen en om te zetten in schone, gestructureerde data. Deze data is zo goed dat het kan helpen bij het automatiseren van het testen van netwerkapparatuur, een taak die doorgaans traag, duur en volledig met de hand wordt uitgevoerd. Het systeem is slim genoeg om te leren van zijn eigen fouten en beter te worden in het lezen van specifieke soorten handleidingen, waardoor het een krachtig hulpmiddel wordt voor de toekomst van softwaretesting.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.