← Nieuwste papers
🤖 machine learning

Learning from 53.6K Real-World Developer Edits of AI-Generated Code

Dit artikel introduceert DECODE, een dataset van 53.600 real-world in-IDE bewerkingen van door AI gegenereerde code van meer dan 1.000 ontwikkelaars, die onthult dat de meeste wijzigingen plaatsvinden binnen 15 minuten na acceptatie en aantoont dat het finetunen van kleinere modellen op deze data aanzienlijk beter presteert dan frontier LLM's in het voorspellen van code-bewerkingen.

Oorspronkelijke auteurs: Jenny T. Liang, Mihika Bairathi, Wayne Chi, Ameet Talwalkar, Nishant Subramani, Valerie Chen

Gepubliceerd 2026-07-29
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jenny T. Liang, Mihika Bairathi, Wayne Chi, Ameet Talwalkar, Nishant Subramani, Valerie Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert koken. Je laat het de robot een receptenboek zien, en de robot probeert een gerecht te maken. Soms doet de robot het perfect. Maar vaak voegt hij te veel zout toe, vergeet hij de knoflook, of gebruikt hij een lepel in plaats van een garde. In de wereld van de informatica is deze robot een "AI-programmeerassistent", en de gerechten zijn regels code. Een lange tijd probeerden wetenschappers deze robots te onderwijzen door ze voltooide recepten te laten zien (genaamd "Git commits")—de uiteindelijke, perfecte gerechten die in kookboeken terechtkwamen. Maar dit is alsof je probeert te leren koken door alleen naar het eten op het bord te kijken, terwijl je de rommelige keuken, het aangebrande brood en de hectische correcties van de chef negeert.

De echte magie (en de echte chaos) gebeurt in het midden. Wanneer een menselijke chef een soep proeft en zegt: "Nee, er moet meer peper bij," of "Gooi dat eigenlijk weg en begin opnieuw," dan is dat een "code-edit". Tot nu toe hadden we geen goede manier om de chef dit te zien doen. We zagen alleen het eindresultaat. Dit artikel duikt in die rommelige, prachtige keuken. Het vraagt: Hoe passen mensen AI-fouten aan? Tweaken ze een klein beetje, of gooien ze het hele ding weg? En kunnen we de robot leren om deze aanpassingen te voorspellen voordat ze zelfs maar plaatsvinden?

De Grote Code-Detective: DECODE

De onderzoekers achter deze studie realiseerden zich dat om AI beter te laten worden in het schrijven van code, ze moesten stoppen met het bekijken van het eindproduct en het proces moeten gaan observeren. Ze creëerden een enorme nieuwe dataset genaamd DECODE (Developer Edits of Code Dataset). Zie DECODE als een gigantisch, high-definition beveiligingscamerasysteem geïnstalleerd in de IDE's (de digitale werkruimtes) van meer dan 1.000 echte ontwikkelaars. In plaats van alleen de definitieve code op te slaan, legde dit systeem elke enkele toetsaanslag, verwijdering en herschrijving vast die een ontwikkelaar maakte nadat de AI een stuk code had gesuggereerd.

Ze verzamelden 53.600 van deze echte editor-sessies, voornamelijk in Python, TypeScript en JavaScript. Het is alsof je een bibliotheek hebt van 53.600 verhalen over hoe mensen en robots ruziën, compromissen sluiten en samenwerken om software te bouwen.

Wat Ze Vonden: De 15-Minuten Regel en de "Vuilnisbak"

Toen het team naar de data keek, ontdekten ze enkele verrassende patronen in hoe mensen met AI-suggesties omgaan.

Eerst ontdekten ze een strikte 15-minuten regel. De meeste aanpassingen gebeuren heel snel. Als een ontwikkelaar de code van de AI gaat veranderen, doen ze dat meestal binnen de eerste 15 minuten nadat de suggestie is geaccepteerd. Daarna wordt de code meestal met rust gelaten.

Ten tweede ontdekten ze dat mensen verrassend streng zijn. In ongeveer 31% van de gevallen heeft de ontwikkelaar de code niet alleen aangepast; ze hebben de volledige suggestie van de AI verwijderd en vanaf nul opnieuw begonnen. Het is alsof de AI je een broodje aanreikt, en je het direct in de prullenbak gooit omdat het brood net niet goed is. De data suggereert dat als een AI-suggestie niet direct perfect aansluit bij de intentie van de ontwikkelaar, deze vaak gedoemd is om te worden verlaten.

Echter, wanneer mensen de code wel behouden, veranderen ze niet veel. De data laat zien dat voor de code die overleeft, ontwikkelaars meestal ongeveer 63% van de oorspronkelijke AI-suggestie behouden. Ze voegen meestal heel weinig van hun eigen nieuwe code toe (slechts ongeveer 20% van de uiteindelijke code is nieuwe inhoud toegevoegd door de mens). Dit betekent dat ontwikkelaars zwaar leunen op de AI, maar ze zijn zeer kieskeurig over de initiële kwaliteit.

De onderzoekers merkten ook een specifieke volgorde op waarin mensen dingen repareren. Het is als een checklist:

  1. De "Is dit überhaupt bruikbaar?" check: Eerst beslissen ze of ze de code überhaupt willen houden. Zo niet, dan verwijderen ze het.
  2. De "Fix de bugs" fase: Vervolgens herstellen ze syntactische fouten of leesbaarheidsproblemen.
  3. De "Maak het van mij" fase: Daarna passen ze variabelen aan of veranderen ze getallen om het aan hun specifieke behoeften te laten voldoen.
  4. De "Verander het plan" fase: Ten slotte, als ze er nog steeds mee bezig zijn, kunnen ze de daadwerkelijke functie van de code veranderen.

De Robot Gedachten laten Lezen

Het tweede grote deel van het artikel was een test: Kunnen we een kleiner, open-source AI-model leren om deze edits beter te voorspellen dan de gigantische, super-slimme "frontier" modellen?

Normaal gesproken worden de grootste, duurste AI-modellen als de beste beschouwd in alles. Maar hier namen de onderzoekers een kleiner model (met 3 miljard parameters, wat piepklein is vergeleken met de reuzen) en trainden dit specifiek op de DECODE-dataset. Ze leerden het model om naar een AI-suggestie te kijken en te raden: "Zal de mens dit verwijderen? Zullen ze het tweaken? Of zullen ze het ongemoeid laten?"

De resultaat was een schok. Het kleine model, nadat het had geleerd van de echte editor-data, werd significant beter in het voorspellen van edits dan de enorme, state-of-the-art modellen die deze specifieke data nooit hadden gezien.

  • Voor het raden van wat de uiteindelijke code zou worden, verbeterde het kleine model de nauwkeurigheid met 0,17 (een enorme sprong in dit vakgebied).
  • Voor het raden van of de code wel of niet zou worden gewijzigd, verbeterde het ook met 0,17.

Dit suggereert dat het hebben van de juiste "ervaring" (real-world editing data) belangrijker is dan alleen een groter brein hebben. Het is als een jonge chef die duizenden kookprogramma's heeft bekeken (de data) en daardoor misschien beter weet hoe hij een gerecht moet repareren dan een beroemde chef die alleen maar perfecte maaltijden heeft gekookt in een laboratorium.

De Les: Het Gaat Om de Mens, Niet Alleen de Code

Het artikel concludeert dat we moeten stoppen met het behandelen van AI-codegeneratie als een wiskundig probleem waarbij het enige doel "correctheid" is. Het echte doel is "alignment" (afstemming). De code moet aansluiten bij de intentie van de mens, anders gooit de mens het gewoon weg.

De auteurs suggereren dat toekomstige AI-assistenten niet alleen moeten proberen om in de eerste poging de perfecte code te schrijven. In plaats daarvan moeten ze getraind worden om het proces van het editen te begrijpen. Ze moeten leren dat mensen dingen vaak snel verwijderen, dat ze fouten repareren voordat ze functies veranderen, en dat ze eerder geneigd zijn code te behouden die gemakkelijk aanpasbaar is.

Door gebruik te maken van datasets zoals DECODE, kunnen we AI bouwen die niet alleen code schrijft, maar code schrijft die mensen ook echt willen behouden. Het is een verschuiving van de vraag "Is deze code correct?" naar de vraag "Is deze code iets dat een mens gemakkelijk tot zijn eigen kan maken?". En de data suggereert dat als we onze AI leren om de rommelige, 15-minuten durende editing-window te begrijpen, we eindelijk een robot kunnen krijgen die een maaltijd bereidt waar we blij mee zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →