← Nieuwste papers
💻 computer science

AI builds, We Analyze: An Empirical Study of AI-Generated Build Code Quality

Dit artikel presenteert een empirische studie met behulp van de AIDev-dataset die onthult dat hoewel AI-coderingsagenten frequent onderhoudbaarheidsproblemen en beveiligingsproblemen introduceren in de gegenereerde code, ze ook effectief bestaande codegeuren verwijderen en een hoge acceptatiegraad van meer dan 61% door ontwikkelaars bereiken, wat de noodzaak voor AI-bewuste kwaliteitsbeoordelingskaders benadrukt.

Oorspronkelijke auteurs: Anwar Ghammam, Mohamed Almukhtar

Gepubliceerd 2026-01-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Anwar Ghammam, Mohamed Almukhtar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je softwareontwikkeling voor als het bouwen van een enorm, complex huis. Normaal gesproken heb je twee soorten werkers: de architecten die de kamers ontwerpen (de broncode) en de bouwmanagers die de logistiek afhandelen, zoals het bestellen van materialen, het plannen van de ploeg en het ervoor zorgen dat het fundament stevig is (de build code).

Lange tijd hebben we nieuwe AI-robots getest om te zien of ze als architecten kunnen optreden. Maar dit artikel stelt een andere vraag: Kunnen deze AI-robots ook goede bouwmanagers zijn?

De auteurs, Anwar Ghammam en Mohamed Almukhtar, besloten de "bouwmanagement"-vaardigheden van de AI op de proef te stellen. Ze keken naar een enorme stapel echte bouwlogs (GitHub pull requests) waar AI-agenten probeerden de "bouwhandleidingen" (build-bestanden zoals Maven, Gradle en Makefiles) te repareren of bij te werken.

Dit is wat zij vonden, eenvoudig uitgelegd:

1. De "geurtest": Heeft de AI er een potje van gemaakt?

In de wereld van programmeren is een "code smell" (codegeur) geen letterlijke geur. Denk aan het als een slechte gewoonte in een recept.

  • Goede gewoonte: "Voeg 2 kopjes bloem toe."
  • Slechte gewoonte (Smell): "Voeg bloem toe uit de zak in de garage" (Hardcoded pad) of "Gebruik wat er nog over is aan bloem" (Wildcard-gebruik).

De onderzoekers ontdekten dat wanneer AI-agenten deze bouwhandleidingen probeerden te schrijven, ze soms slechte gewoonten introduceerden.

  • Het probleem: In ongeveer 66 gevallen creëerde de AI nieuwe "smells". De meest voorkomende slechte gewoonten waren een gebrek aan foutafhandeling (geen plan B hebben als er iets misgaat) en hardcoded paden (specifieke adressen in de code schrijven die niet werken als je het huis verplaatst).
  • De schuldigen: Niet alle AI-robots waren gelijk. Eén robot, "Copilot", introduceerde de meeste slechte gewoonten. Een andere, "Claude", introduceerde er geen enkele, maar deze probeerde het slechts op drie bestanden, dus het is lastig te beoordelen.

2. De "reparatieploeg": Heeft de AI opgeruimd?

De onderzoekers vroegen zich ook af of de AI kon fungeren als een professionele keurmeester en bestaande slechte gewoonten zou verwijderen.

  • Het resultaat: Ja! In 31 gevallen heeft de AI de bouwhandleidingen succesvol opgeruimd.
  • Hoe? De AI trad op als een slimme renovateur. Het nam rommelige, verspreide instructies en organiseerde deze. Bijvoorbeeld, in plaats van een geheim wachtwoord direct in de handleiding te schrijven (een beveiligingsrisico), verplaatste de AI het naar een veilige "kluis" (externe eigenschappen). Het verwijderde ook ongebruikte gereedschappen en actualiseerde oude, kapotte instructies.
  • De les: De AI is niet alleen een chaotische bouwer; soms is het een zeer effectieve refactorer (iemand die dingen reorganiseert om ze beter te maken).

3. De menselijke bazen: Zeiden de mensen "Ja"?

Ten slotte vroegen het team zich af: Vertrouwen menselijke bouwmanagers de AI?

  • Het oordeel: Verrassend genoeg wel. Meer dan 61% van de suggesties van de AI werd direct geaccepteerd en samengevoegd (merged).
  • De reactie: Menselijke reviewers zeiden vaak "Looks Good To Me" (LGTM) of maakten zelfs een grapje: "Je kunt mijn baan nu overnemen!" Ze hoefden zelden wijzigingen aan te brengen voordat ze het werk van de AI goedkeurden. Dit suggereert dat mensen op dit moment de AI genoeg vertrouwen om de bouwlogistiek met zeer weinig toezicht af te handelen.

Het grote plaatje

Beschouw deze studie als een rapportcijfer voor AI-agenten die proberen de "loodgieters- en elektrawerkzaamheden" van softwareprojecten te beheren.

  • Het goede nieuws: De AI is verrassend goed in het opruimen van rommelige instructies en het organiseren van het bouwproces. Mensen vertrouwen het genoeg om het werk meestal aan de AI over te laten.
  • De waarschuwing: De AI is niet perfect. Het laat soms "slechte gewoonten" achter, zoals ontbrekende veiligheidscontroles of het gebruik van verouderde tools.

De conclusie: We moeten de AI niet blindelings de bouwplaats laten beheren. We moeten betere "veiligheidsinspecteurs" (tools) bouwen om de slechte gewoonten van de AI te vangen voordat ze onderdeel worden van het uiteindelijke huis. Het doel is om het vermogen van de AI om op te ruimen te behouden, terwijl we voorkomen dat het per ongelt nieuwe rommel creëert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →