Spec Kit Agents: Context-Grounded Agentic Workflows
Dit paper introduceert Spec Kit Agents, een multi-agent SDD-pipeline die door middel van context-verankeringstaken de hallucinaties van AI-coderingsagenten in grote repositories vermindert en de kwaliteit van de gegenereerde code significant verbetert zonder de testcompatibiliteit te schaden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorm, oud en complex gebouw (een softwareproject) hebt dat je wilt verbouwen. Je hebt een superintelligente, maar soms een beetje dromerige architect (de AI-agent) in dienst.
Het probleem met deze architect is dat hij vaak contextblind is. Hij ziet wel de blauwdrukken die hij zelf tekent, maar hij kijkt niet goed naar het bestaande gebouw. Hij zegt bijvoorbeeld: "Ik ga een nieuwe trap bouwen bij de achterdeur," terwijl er op die plek al een muur staat of de achterdeur eigenlijk niet bestaat. Hij maakt prachtige plannen die intern logisch klinken, maar in de realiteit van het gebouw totaal niet werken.
Spec Kit Agents is een nieuwe manier van werken die dit probleem oplost. Het is alsof je een ervaren bouwteam samenstelt in plaats van alleen een dromerige architect.
Hier is hoe het werkt, vertaald naar alledaagse taal:
1. Het Probleem: De "Dromerige Architect"
Normaal gesproken vraagt je AI-agent: "Maak een nieuwe functie." De AI begint dan direct te tekenen en bouwen. Omdat hij niet goed kijkt naar de bestaande muren, kabels en regels van het gebouw, bouwt hij dingen die niet passen. Pas als hij klaar is en je probeert het gebouw te betreden, blijkt dat de trap in de lucht hangt of de deur op slot zit. Dan moet hij alles weer afbreken en opnieuw beginnen. Dat kost tijd en energie.
2. De Oplossing: Het Bouwteam met "Controleurs"
Spec Kit Agents introduceert een stappenplan met twee belangrijke nieuwe rollen: een Projectmanager en een Bouwcontroleur.
Het proces ziet er nu zo uit:
- Stap 1: Het Schetsen (Specifiëren)
De AI schetst wat er moet gebeuren. - 🔍 De "Snuffel-Controle" (Discovery Hook):
Voordat de AI verder gaat, stapt er een snuffelhond (de controleur) het gebouw binnen. Deze hond snuffelt niet aan de plannen, maar kijkt alleen naar de werkelijkheid: "Zijn er hier al kabels? Is die muur draagkrachtig? Welke bouwstijl gebruiken we hier?"- Voorbeeld: De hond zegt: "Hé, we kunnen hier geen nieuwe trap bouwen, want er loopt een gasleiding. Laten we die trap verplaatsen."
- Dit voorkomt dat de architect plannen maakt die onmogelijk zijn.
- Stap 2: Het Plannen en De Taken
De AI maakt nu een gedetailleerd plan, gebaseerd op wat de snuffelhond heeft gevonden. - ✅ De "Kwaliteitscheck" (Validation Hook):
Na het maken van het plan, maar voordat er echt gebouwd wordt, komt er een bouwkundig inspecteur. Hij kijkt naar het plan en zegt: "Klopt het dat je hier een betonplaat wilt gieten? Ja, want de inspecteur heeft gezien dat de fundering dat aankan."- Als het plan fout is (bijvoorbeeld: "We gebruiken een materiaal dat we niet in de schuur hebben"), wordt het plan nu alvast gecorrigeerd.
- Stap 3: Het Bouwen (Implementeren)
Pas als het plan is goedgekeurd door de inspecteur, begint de AI met het daadwerkelijke bouwen van de code. - 🏁 De "Eindinspectie":
Als het gebouw klaar is, wordt er nog een laatste test gedaan (zoals een brandweertest) om te zien of alles veilig is.
3. Waarom is dit beter?
In het oude systeem (alleen de dromerige architect) bouwde de AI vaak dingen die niet pasten, wat leidde tot veel fouten en gedoe achteraf.
Met Spec Kit Agents:
- Minder fouten: De AI maakt minder "hallucinaties" (dingen die hij verzonnen heeft).
- Beter resultaat: De kwaliteit van het eindproduct is hoger, omdat het plan alvast is getoetst aan de realiteit.
- Efficiënter: Je bouwt niet eerst iets dat je weer moet slopen. Je bouwt het goed in één keer.
De Resultaten in het Kort
De onderzoekers hebben dit getest op 32 verschillende "verbouwingen" in 5 grote software-projecten.
- De kwaliteit van de resultaten steeg met ongeveer 15% (op een schaal van 1 tot 5).
- Het systeem brak bijna nooit bestaande functies kapot (99,7% tot 100% van de tests slaagden).
- Het werkt zelfs beter dan de huidige top-systemen op de beroemde "SWE-bench" (een soort olympische wedstrijd voor software-herstel), met een slagingspercentage van 58,2%.
Conclusie
Spec Kit Agents is als het toevoegen van een verstandige bouwmeester en een strenge inspecteur aan je team. Ze zorgen ervoor dat de AI niet in een droomwereld leeft, maar met beide benen op de grond staat en rekening houdt met de feitelijke situatie in het bestaande gebouw. Het kost misschien iets meer tijd voor de controles, maar het bespaart enorm veel tijd en frustratie doordat je minder hoeft te slopen en opnieuw te bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.