RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository
Dit paper introduceert RepoGenesis, het eerste meertalige benchmark voor het genereren van volledige microservice-repositories van README tot repository, en toont aan dat bestaande AI-systemen ondanks hoge API-dekking en succesvolle implementatie nog tekortschieten in architecturale coherentie en cross-bestandsconsistentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een architect bent die een compleet nieuw stadje moet bouwen, niet alleen één huis. Je krijgt een briefje met de wensen van de klant: "Ik wil een postkantoor, een school en een park, en ze moeten allemaal met elkaar kunnen praten."
Vroeger konden slimme computers (AI) alleen maar helpen met het bouwen van één klein raam of het repareren van een kapotte deur in een bestaand huis. Maar nu willen we dat de AI het hele stadje bouwt, van de eerste steen tot de laatste lantaarnpaal, inclusief de riolering en de elektriciteit.
Dit is precies wat het nieuwe onderzoek RepoGenesis doet. Hier is een uitleg in gewone taal:
1. Het Probleem: De "Losse Poot" van de AI
Tot nu toe waren tests voor programmeer-AI's als een vliegveld waar je alleen test of een piloot goed kan landen op één specifieke landingsbaan. Ze keken niet of de piloot ook het vliegtuig kon bouwen, of dat hij de brandstof kon vinden, of dat hij de verkeersleiding kon regelen.
Bestaande tests keken alleen naar:
- Het schrijven van één klein stukje code (zoals een raam).
- Het repareren van een fout in een bestaand programma.
Maar in de echte wereld bouwen mensen microservices: kleine, onafhankelijke programmaatjes die samenwerken (zoals een postkantoor dat samenwerkt met een school). Dit is heel complex. De AI moet niet alleen code schrijven, maar ook weten hoe alles in elkaar past.
2. De Oplossing: RepoGenesis (De "Stadjesbouwer")
De onderzoekers (van Microsoft en universiteiten) hebben een nieuwe test gemaakt genaamd RepoGenesis.
- Wat is het? Een enorme verzameling van 106 "stadjes" (software-projecten) in twee talen: Python en Java.
- Hoe werkt het? Ze geven de AI een beschrijving (zoals een recept) en de AI moet het hele gebouw (de map met bestanden) bouwen.
- De Kwaliteitscontrole: Ze hebben een heel streng systeem gebruikt, alsof ze een rechter en drie experts hebben ingehuurd. Deze keken elke test na, discussieerden erover ("review-rebuttal"), en zorgden ervoor dat de tests echt werkten. Als de AI het gebouw niet kon bouwen en het systeem startte niet, was het een mislukking.
3. De Resultaten: De AI is nog niet klaar voor de grote boer
Toen ze de beste AI's (zowel gratis open-source versies als dure commerciële tools zoals Copilot) op deze test lieten werken, was het resultaat verrassend:
- De "Bouwplaat" is goed: De AI's konden vaak wel de schetsen maken. Ze bouwden de muren en de ramen (ze hadden 70% van de functies).
- De "Stroom" is vaak uit: Maar als je het gebouw probeerde te betrekken (het systeem starten), vielen ze vaak uit elkaar. De elektriciteit werkte niet, de deuren sloten niet goed, of de riolering liep lek.
- Het cijfer: Slechts 23% van de pogingen lukte volledig. Dat betekent dat 77% van de tijd het gebouw instortte zodra je het probeerde te gebruiken.
Waarom lukt het niet?
De AI's hebben moeite met:
- De grote lijn: Ze zien niet hoe het postkantoor moet praten met de school (architectuur).
- De onderdelen: Ze vergeten soms de juiste schroeven of bouten (afhankelijkheden).
- De consistentie: Ze schrijven in het ene bestand "rode deur" en in het andere "blauwe deur", en dat werkt niet samen.
4. De Opvallende Vinder: Een AI die leerde van de fouten
De onderzoekers hebben een speciale AI (genaamd GenesisAgent) gemaakt die heeft geoefend op deze test.
- Het resultaat: Deze getrainde AI deed het bijna even goed als de allerbeste, duurste AI's van de wereld (zoals GPT-5 mini).
- De les: Als je een AI goed traint met de juiste voorbeelden en strenge tests, kan hij echt leren om complexe systemen te bouwen. Het bewijst dat RepoGenesis een goede "school" is voor AI's.
Samenvatting in een Metafoor
Stel je voor dat je een kookwedstrijd hebt.
- Vroeger: De AI moest alleen een ei kloppen of een saus maken.
- Nu (RepoGenesis): De AI moet een hele maaltijd koken, inclusief het afwassen, het opwarmen van de oven en het serveren aan de gasten.
- Het resultaat: De AI's kunnen vaak een mooi bord met eten neerzetten (het ziet er goed uit), maar als je het proeft, is het vaak nog rauw of verbrand (het werkt niet).
Conclusie:
We zijn een enorme stap verder. We hebben nu een manier om te testen of AI's echt complete software kunnen bouwen, niet alleen losse stukjes. De AI's zijn slim, maar ze moeten nog veel leren over hoe ze een heel systeem in elkaar moeten zetten voordat we ze volledig kunnen vertrouwen om onze digitale stadjes te bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.