Engineering Pitfalls in AI Coding Tools: An Empirical Study of Bugs in Claude Code, Codex, and Gemini CLI
Deze empirische studie analyseert systematisch ruim 3.800 bugs in AI-codingtools zoals Claude Code, Codex en Gemini CLI om veelvoorkomende engineeringfouten, met name gerelateerd aan functionaliteit en API-integratie, in kaart te brengen en zo een leidraad te bieden voor het ontwikkelen van robuustere AI-assistenten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente, maar soms wat onhandige assistent hebt die je helpt met het bouwen van een huis. Deze assistent (de AI) is slim genoeg om te weten welke planken je nodig hebt en hoe je ze moet schroeven. Maar in dit onderzoek kijken we niet naar de slimheid van de assistent zelf, maar naar de gereedschapskist, de ladder en de instructiehandleiding die de assistent gebruikt.
Deze studie, gedaan door onderzoekers van de York University, kijkt naar wat er misgaat in de software die deze AI-coders (zoals Claude Code, Codex en Gemini) laat werken. Ze hebben meer dan 3.800 klachten van echte gebruikers onderzocht om te zien waar de hakken in de schoenen zitten.
Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:
1. Het Probleem: De "Tussenpersoon" is vaak de boosdoener
Je zou denken dat als een AI code schrijft, de fouten komen omdat de AI "niet slim genoeg" is. Maar de onderzoekers ontdekten iets verrassends: meestal is de AI niet het probleem.
Het probleem zit in de tussenpersoon (de software die de AI omringt).
- De Vergelijking: Stel je voor dat je een chef-kok (de AI) hebt die perfect kan koken. Maar de kok moet zijn ingrediënten halen via een bezorger (de API), die weer een sleutel nodig heeft van de portier (de configuratie). Als de deur niet opent of de bezorger de verkeerde deur opent, komt het eten niet aan. De kok is niet dom; het systeem om hem heen werkt niet.
2. Wat ging er mis? (De drie hoofdcategorieën)
De onderzoekers hebben de fouten in drie grote groepen verdeeld:
De "Dingetjes die niet werken" (Functie-bugs - 67%):
Dit is de grootste groep. De AI probeert iets te doen (bijvoorbeeld een bestand opslaan of een commando uitvoeren), maar het lukt niet.- Vergelijking: Je zegt tegen je robot: "Zet de koffie op de tafel." De robot pakt de koffie, maar laat hem vallen omdat de wieltjes vastzitten. De opdracht was goed, maar de uitvoering faalde.
De "Verwarrende Handleiding" (Gebruiksgemak - 18%):
De tool doet het misschien wel, maar de interface is zo raar dat gebruikers niet weten wat er gebeurt.- Vergelijking: Je hebt een auto die perfect rijdt, maar de knoppen voor de lichten zitten op de achterbank en de snelheidsmeter is verdraaid. Je komt wel aan, maar het is een frustrerende rit.
De "Verkeerde Adreslijst" (Compatibiliteit - 8%):
De tool werkt op je Windows-computer, maar niet op je Mac, of hij heeft een specifieke versie van een programma nodig die je niet hebt.- Vergelijking: Het is alsof je een sleutel hebt die perfect past in een deur, maar de deur is gemaakt van een ander metaal dan waar de sleutel voor is ontworpen.
3. Waar zit de fout eigenlijk? (De "Waarom")
De onderzoekers keken naar de oorzaken. Het bleek dat de AI-zelf (het "brein") maar voor ongeveer 10% van de fouten verantwoordelijk was. De echte boosdoeners waren:
- API & Integratie (21%): De verbinding tussen de AI en de buitenwereld (zoals internet of andere programma's) werkt niet goed.
- Vergelijking: De telefoonlijn tussen de chef-kok en de bezorger is onderbroken.
- Configuratie & Instellingen (16%): De tool is niet goed ingesteld op jouw computer.
- Vergelijking: Je hebt de verwarming op "winter" gezet, maar de thermostaat staat nog op "zomer".
- Omgeving: Je computer of besturingssysteem is niet compatibel.
4. Wat zien gebruikers? (De Symptomen)
Wat zien mensen op hun scherm als er iets misgaat?
- Foutmeldingen van de server (18%): "Ik kan niet verbinden."
- Problemen in het terminal-scherm (14%): Tekst verdwijnt, letters worden gek, of het scherm blijft hangen.
- Commando's die mislukken (13%): De AI probeert een opdracht uit te voeren, maar de computer zegt "Nee".
5. De Grote Les: Het is een "Systeemprobleem", geen "Slimheidsprobleem"
De belangrijkste conclusie van dit onderzoek is dat het bouwen van betrouwbare AI-tools geen probleem is van kunstmatige intelligentie, maar van systeem-engineering.
Het is alsof je een Formule 1-auto bouwt. Je kunt de beste motor (de AI) hebben, maar als de banden (de verbindingen), de brandstofleidingen (de configuratie) en de bestuurdersstoel (de interface) niet perfect op elkaar zijn afgestemd, zal de auto nooit winnen.
Wat betekent dit voor de toekomst?
Ontwikkelaars moeten niet alleen proberen de AI slimmer te maken, maar vooral zorgen voor:
- Betere verbindingen: Zorg dat de AI goed kan praten met andere programma's.
- Duidelijke feedback: Als iets misgaat, moet de tool zeggen waarom en niet alleen "Fout 404".
- Veiligheid: Zorg dat de AI niet per ongeluk je huis (je computer) platbrandt omdat hij een verkeerde sleutel probeerde.
Kortom: De AI is de ster in de film, maar de regisseur, de cameraman en de technici (de software-engineers) moeten zorgen dat de film niet stopt halverwege.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.