FullStack-Agent: Enhancing Agentic Full-Stack Web Coding via Development-Oriented Testing and Repository Back-Translation
Het artikel introduceert FullStack-Agent, een verenigd systeem bestaande uit een multi-agent ontwikkelingsframework, een zelfverbeterende data-schaalmethode en een uitgebreide benchmark, die gezamenlijk LLM's in staat stellen om productieklare full-stack webapplicaties te genereren met een significant verbeterde prestatie op het gebied van frontend-, backend- en databasefunctionaliteiten vergeleken met bestaande state-of-the-art methoden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een volledig functionele webshop wilt bouwen. Je vraagt een slimme AI-assistent om dit te doen. De meeste huidige AI-assistenten zijn als getalenteerde schilders die alleen weten hoe ze de etalage moeten schilderen. Ze kunnen het bord prachtig maken, de ramen laten glanzen en de deuren laten openzwaaien, maar als je iets probeert te kopen, gebeurt er niets. Er is geen kassa, geen magazijn en geen bezorgwagen. Het is een "nep" winkel die er echt uitziet, maar geen backend heeft.
Dit artikel introduceert FullStack-Agent, een nieuw systeem dat is ontworpen om de AI te stoppen met alleen de gevel schilderen en daadwerkelijk de hele winkel te bouwen, inclusief de onzichtbare leidingen, het magazijn en de bezorgwagens.
Hier is hoe ze het hebben aangepakt, onderverdeeld in drie eenvoudige delen:
1. De Bouwploeg (FullStack-Dev)
In plaats van de klus uit te besteden aan één enkele AI-werker die alles tegelijk probeert te doen, hebben de auteurs een bouwploeg gecreëerd met specifieke rollen:
- De Architect (Planning Agent): Deze AI bekijkt je verzoek en tekent de blauwdrukken. Hij bepaalt waar de muren komen, waar de leidingen lopen en hoe de data van de voordeur naar het achterkantoor stroomt.
- De Front-End Engineer: Deze werker bouwt het deel dat jij ziet (het websiteontwerp).
- De Back-End Engineer: Deze werker bouft het deel dat jij niet ziet (de database en de serverlogica).
Het Geheime Wapen: De ploeg heeft speciale debug-tools (zoals een diagnosecomputer van een monteur).
- Als de voordeur niet opengaat, gaat de Front-End Engineer niet zomaar gokken; hij voert een test uit die hem precies vertelt welke schroef loszit.
- Als de kassa geen geld bijhoudt, gebruikt de Back-End Engineer een tool die lijkt op Postman (een tool die echte ontwikkelaars gebruiken) om de verbinding direct te testen, in plaats van blindelings te proberen het te repareren.
Deze teamwork zorgt ervoor dat de "winkel" ook daadwerkelijk werkt, en niet alleen mooi oogt.
2. De Zelfverbeterende Leerling (FullStack-Learn)
Zelfs met een geweldige ploeg moet de AI slim genoeg zijn om te weten hoe je complexe dingen bouwt. De auteurs realiseerden zich dat het simpelweg vertellen van "bouw een winkel" tegen een AI niet genoeg is; de AI moet leren van echte voorbeelden.
Ze creëerden een methode genaamd Back-Translation. Stel je voor dat je een afgewerkte, hoogwaardige woning vindt (de echte websitecode van GitHub). In plaats van het alleen maar te kopiëren, gedraagt de AI zich als een detective:
- Hij bestudeert de afgewerkte woning.
- Hij ontdekt wat de oorspronkelijke huiseigenaar heeft gevraagd (bijv. "Ik wil een huis met een rode deur en een garage").
- Vervolgens doet hij alsof hij dat huis vanaf nul bouwt, stap voor stap, alsof het de eerste keer is.
Door dit te doen met duizenden echte websites, genereert de AI zijn eigen "handleiding". De AI leert de logica van het bouwen vanaf de basis, in plaats van alleen maar te kopiëren. Ze gebruiken ook Augmentation, waarbij ze een bestaand huisontwerp nemen en de AI vragen om "een tweede verdieping toe te voegen" of "dit huis in een bakkerij te veranderen", wat nog meer oefenscenario's creëert. Hierdoor wordt de AI op eigen kracht slimmer zonder dat er voor elke stap een menselijke leraar nodig is.
3. De Strenge Inspecteur (FullStack-Bench)
Hoe weet je of de AI daadwerkelijk een werkende winkel heeft gebouwd en niet gewoon een neptent? Eerdere tests waren als een visuele inspectie: "Ziet de deur er mooi uit? Ja. Geslaagd."
De auteurs bouwden een nieuw testingsysteem genaamd FullStack-Bench dat fungeert als een gezondheidsinspecteur:
- Front-End Test: Gaat de deur open?
- Back-End Test: Heeft de kassa de verkoop daadwerkelijk geregistreerd?
- Database Test: Staat het geld daadwerkelijk op de bankrekening, of deed de kassa alleen alsof het geld aannam?
De inspecteur kijkt niet alleen naar de website; hij voert daadwerkelijke tests uit om te zien of gegevens correct worden opgeslagen en opgehaald. Als de AI de backend vervalst, vangt de inspecteur dit direct op.
De Resultaten
Toen ze dit systeem op de proef stelden:
- De nieuwe Bouwploeg (FullStack-Dev) bouwde websites die veel beter werkten dan voorheen. Het verbeterde het succespercentage van de "etalage" met ongeveer 9%, de "kassa" met een enorme 38%, en de "bankrekening" (database) met 16%.
- De Zelfverbeterende Leerling (FullStack-Learn) nam een standaard AI-model en maakte het, door zijn eigen oefening, aanzienlijk slimmer in het bouwen van deze volledige systemen, waarbij de scores in sommige gebieden met bijna 10% verbeterden.
Kortom: Het artikel presenteert een systeem dat voorkomt dat AI simpelweg websites "faked". Het gebruikt een team van gespecialiseerde AI-werkers, leert hen door echte projecten te reverse-engineeren, en huurt een strenge inspecteur in om te controleren of de onzichtbare delen van de website daadwerkelijk werken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.