← Nieuwste papers
🤖 AI

Safer Builders, Risky Maintainers: A Comparative Study of Breaking Changes in Human vs Agentic PRs

Hoewel AI-agents in code-generatietaken minder breaking changes introduceren dan mensen, vertonen ze bij onderhoudstaken zoals refactoring en chore een aanzienlijk hoger risico, waarbij zelfs hoog vertrouwen in de agent niet garandeert dat de wijzigingen veilig zijn.

Oorspronkelijke auteurs: K M Ferdous, Dipayan Banik, Kowshik Chowdhury, Shazibul Islam Shamim

Gepubliceerd 2026-03-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: K M Ferdous, Dipayan Banik, Kowshik Chowdhury, Shazibul Islam Shamim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

"Veilige Bouwers, Risicovolle Onderhouders": Wat de Studie Zegt over AI en Mensen

Stel je voor dat softwareontwikkeling een enorme stad is die nooit stopt met groeien. In deze stad zijn er twee soorten arbeiders: menselijke bouwers en AI-bots. Deze bots (zoals Devin of GitHub Copilot) helpen steeds vaker om nieuwe gebouwen te bouwen of oude te renoveren. Maar de vraag is: wie maakt de minste fouten die de hele stad kunnen laten instorten?

Deze studie, getiteld "Safer Builders, Risky Maintainers", kijkt precies naar dat probleem. Ze vergelijken de "pull requests" (de bouwplannen die worden ingediend) van mensen met die van AI. Hier is wat ze ontdekten, vertaald in begrijpelijke taal:

1. De Grote Verrassing: AI is een betere "Nieuwbouwer"

Je zou denken dat AI, omdat het soms gekke dingen doet, overal fouten maakt. Maar de studie toont iets verrassends aan:

  • Bij het bouwen van iets nieuws (zoals een nieuwe functie toevoegen of een bug fixen), is de AI veiliger dan mensen.
  • Menselijke bouwers maken vaker fouten die de "oudere" versies van de software kapotmaken (zogenaamde breaking changes).
  • De analogie: Stel je voor dat je een nieuw raam in een huis plaatst. De AI doet dit netjes en past het perfect in het bestaande raamkozijn. De menselijke bouwer doet het ook, maar vergeet soms dat de deur er nog open moet kunnen, waardoor de hele gevel scheef komt te staan.

De cijfers: AI maakt in nieuwe bouwprojecten maar 3,45% fouten die compatibiliteit breken, terwijl mensen 7,40% fouten maken.

2. Het Gevaarlijke Gebied: De "Onderhouds-werkzaamheden"

Maar wacht, er is een grote "maar". De studie ontdekt dat AI een heel ander gedrag vertoont als het gaat om onderhoud (zoals het herschrijven van oude code of het opschonen van rommel).

  • Hier wordt de AI veel risicovoller dan mensen.
  • Bij het "opknappen" van oude code (refactoring) of het doen van klusjes (chore), maakt AI veel vaker fouten die de software kapotmaken.
  • De analogie: Stel je voor dat je een oud, complex horloge moet repareren. De menselijke horlogemaker weet precies welke veer hij niet mag aanraken omdat hij het mechanisme kent. De AI-ploeg kijkt naar het horloge en denkt: "Ik kan dit wel sneller maken!" en verwijdert per ongeluk een veer die cruciaal was. Het horloge loopt nog, maar de wijzers staan niet meer goed.

De cijfers: Bij onderhoudstaken maakt AI 6,72% tot 9,35% fouten. Mensen blijven hier veiliger (rond de 4-5%).

3. De "Zekerheidsval" (The Confidence Trap)

Er is nog een gevaarlijke valkuil ontdekt: het vertrouwensniveau van de AI.

  • AI-bots geven vaak een score van 8, 9 of 10 (op een schaal van 10) als ze zeggen: "Ik ben er 100% zeker van dat dit goed is!"
  • De studie laat zien dat zelfs bij die hoge zekerheidsscores de AI nog steeds fouten maakt die de software breken.
  • De analogie: Het is alsof een zelfverzekerde gids in een berggebied zegt: "Ik weet het zeker, deze weg is veilig!" terwijl hij je per ongeluk naar een afgrond leidt. Het feit dat hij zeker is, betekent niet dat hij juist is.

Wat betekent dit voor ons?

De studie geeft ons drie belangrijke lessen mee:

  1. Laat AI bouwen, maar laat mensen onderhouden: Als het gaat om het creëren van nieuwe functies, kunnen we AI vertrouwen. Maar als het gaat om het herschrijven of opkuisen van oude code, moeten we extra voorzichtig zijn en de AI niet blindelings laten werken.
  2. Kijk niet alleen naar de zekerheid: Als een AI zegt: "Ik ben 100% zeker", geloof het niet direct. Controleer het werk altijd, vooral bij onderhoudstaken.
  3. Nieuwe regels nodig: Softwarebedrijven moeten hun regels aanpassen. Ze moeten strengere controles hebben voor AI-werk dat gaat over het "opknappen" van oude systemen, ongeacht hoe zelfverzekerd de AI klinkt.

Kortom: AI is een uitstekende starter die nieuwe dingen bouwt, maar een onbetrouwbare klusjesman als het gaat om het repareren van het bestaande. We moeten weten wanneer we de AI de sleutel geven en wanneer we die sleutel zelf vasthouden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →