← Nieuwste papers
🤖 AI

Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

Dit artikel introduceert een gecureerde meertalige benchmark en presenteert een studie die aantoont dat de taal die in prompts wordt gebruikt de functionele correctheid, de structurele kwaliteit en de lexicale kenmerken van door LLM's gegenereerde code significant beïnvloedt, waarbij wordt onthuld dat Engelse prompts niet consistent de beste resultaten opleveren en dat de impact varieert tussen verschillende modellen en programmeertalen.

Oorspronkelijke auteurs: Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo

Gepubliceerd 2026-07-17
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Code Vertaler Experiment

Stel je voor dat je een super slimme robotvriend hebt die alles kan bouwen, van een simpel vogelhuisje tot een complex ruimteschip. Deze robot, een Large Language Model (of LLM) genoemd, heeft bijna alles gelezen wat ooit op het internet is geschreven, inclusief miljoenen regels computercode. Omdat de robot zoveel heeft gelezen, is hij ongelooflijk goed in het volgen van instructies om nieuwe code voor ons te schrijven. Meestal praten we met deze robot in het Engels, omdat dat de taal is waarin de meeste code die hij heeft geleerd, is geschreven. Maar wat als je de robot zou vragen om een ruimteschip te bouwen met instructies in het Spaans, Hindi of Chinees? Zou de robot in de war raken? Zou het ruimteschip uit elkaar vallen? Of zou hij precies hetzelfde bouwen, maar dan met een ander accent?

Dit is de grote vraag achter een nieuwe studie door een team van onderzoekers. Ze wilden zien of de taal die we gebruiken om met deze AI-robots te praten, de kwaliteit van de code die ze schrijven verandert. In de wereld van software engineering is "code" de set instructies die een computer vertelt wat hij moet doen. "Correctheid" betekent dat de code daadwerkelijk werkt en alle tests doorstaat, zoals een brug die een auto vasthoudt zonder in te storten. "Kwaliteit" is iets breder; het betekent dat de code makkelijk te lezen is, de regels van de buurt volgt (zoals geen afval op de stoep achterlaten) en geen verborgen vallen bevat die later de boel kunnen laten breken. De onderzoekers waren nieuwsgierig of het vragen om een brug in een andere taal dan het Engels de robot een wankele brug zou laten bouwen, of dat de robot net zo goed is in bouwen in elke taal.

Het Experiment: Een Meertalige Coding Uitdaging

Om dit te ontdekken, zetten de onderzoekers een enorme coding wedstrijd op. Ze namen 460 verschillende programmeertaken over — 230 voor Python en 230 voor Java — afkomstig van een beroemde benchmark genaamd CoderEval. Dit waren niet zomaets eenvoudige "print hello"-taken; het waren echte wereld uitdagingen die van de AI vereisten om problemen op te lossen, met data om te gaan en structuren op te bouwen.

Vervolgens deden ze iets slims. In plaats van de AI alleen in het Engels te vragen, vertaalden ze deze 460 taken naar vier andere talen: Chinees, Hindi, Spaans en Italiaans. Maar ze gebruikten niet zomaar een snelle machinevertaler. Ze hadden moedertaalsprekers die experts zijn in computerwetenschappen die elke vertaling handmatig controleerden en verbeterden. Ze wilden ervoor zorgen dat de instructies perfect en natuurlijk waren, precies zoals een mens een vriend om hulp vraagt.

Daarna voerden ze deze vertaalde instructies in bij drie van de krachtigste AI-robots die vandaag de dag beschikbaar zijn: GPT-4o mini, DeepSeek en Claude. Ze vroegen elke robot om dezelfde 460 problemen op te lossen in alle vijf de talen (Engels plus de andere vier). In totaal genereerden ze duizenden stukken code om te vergelijken.

De Grote Verrassing: Engels is Niet Altijd Koning

De resultaten waren een beetje een schok. De algemene veronderstelling was dat als je de AI in het Engels vraagt, je de beste code krijgt omdat dat de taal is die de AI het meest heeft bestudeerd. Maar de studie vond dat dit niet altijd waar is.

Sterker nog, voor Python-taken leidde het vragen in het Chinees zelfs tot betere resultaten dan vragen in het Engels! De code die vanuit Chinese prompts werd gegenereerd, slaagde voor meer tests en werkte betrouwbaarder. Het is alsof je een chef vraagt een gerecht te koken; soms zorgt het geven van het recept in een andere taal ervoor dat de chef een betere manier bedenkt om te koken. Deze "Chinese voorsprong" gebeurde echter niet voor elke robot of elk type taak. Voor Java waren de resultaten gemengder, en er was geen enkele taal die duidelijk de winnaar was. De belangrijkste les is dat het spreken van Engels naar een AI niet garandeert dat je de beste code krijgt, en dat het spreken van een andere taal niet automatisch betekent dat de code slechter zal zijn.

De Code Ziet Er Anders Uit, Maar Is Het Slechter?

De onderzoekers keken ook naar de "kwaliteit" van de code, niet alleen of het werkte. Ze controleerden zaken zoals:

  • Complexiteit: Is de code een rommelige knoop of een rechte lijn?
  • Comments: Legde de robot uit wat hij aan het doen was?
  • Waarschuwingen: Bracht de code regels met zich mee of zag het er slordig uit?

Ze ontdekten dat de code gegenereerd in niet-Engelse talen niet noodzakelijkerwijs "slecht" was. Het zag er gewoon anders uit. Bijvoorbeeld, code geschreven vanuit Chinese prompts bevatte vaak meer comments, alsof de robot extra behulpzaam wilde zijn. Code uit Hindi-prompts had soms meer stijl fouten, zoals ontbrekende leestekens of vreemde spatiering, maar dit waren meestal kleine problemen die gemakkelijk te herstellen waren.

Een interessante ontdekking ging over Hindi. Wanneer de AI werd gevragen om in het Hindi te coderen, produceerde het soms code die een beetje risicovoller was, met meer potentiële bugs of verwarrende logica. Maar voor Spaans en Italiaans was de code over het algemeen net zo goed als de Engelse versie, soms zelfs beter in het vermijden van bepaalde fouten.

Het "Mix-en-Match" Probleem

Hier wordt het een beetje rommelig. Hoewel de logica van de code misschien geweldig is, waren de woorden binnen de code vaak een verwarrende mix. De onderzoekers ontdekten dat zelfs wanneer je de AI in het Spaans of Chinees vroeg, de robot de comments (de aantekeningen die de code uitleggen) en de variabelen (de labels voor data) vaak in het Engels schreef.

Het is alsof je een chef vraakt om een recept in het Italiaans te schrijven, maar hij schrijft de ingrediëntenlijst in het Engels en de instructies in een mix van beide. De onderzoekers vonden dat de AI erg inconsistent is. Soms volgt hij jouw taal, soms niet. Dit is een probleem voor teams van ontwikkelaars die hun code in één consistente taal nodig hebben zodat iedereen het kan begrijpen. De studie suggereert dat alleen vragen om code in een specifieke taal niet genoeg is; je moet misschien heel specifiek zijn in het vertellen van de robot om de aantekeningen en labels in diezelfde taal te houden.

Wat Betekent Dit voor Ons?

De studie concludeert dat we niet bang hoeven te zijn om onze moedertalen te gebruiken om met AI-coding assistenten te praten. Je kunt om code vragen in het Spaans, Chinees of Hindi zonder je zorgen te maken dat de robot zal falen. In sommige gevallen, zoals bij Python, krijg je zelfs betere resultaten!

Er zijn echter twee zaken om op te letten:

  1. Het "Stijl" Probleem: De code kan meer kleine opmaakfouten hebben (zoals ontbrekende komma's of lange regels) wanneer deze in niet-Engelse talen wordt geschreven. Maar deze zijn gemakkelijk te herstellen met geautomatiseerde tools.
  2. Het "Taal Mix" Probleem: De AI houdt de comments en labels misschien niet in de taal die je hebt gevraagd. Als je alles in één taal nodig hebt, moet je de code misschien dubbelchecken of de AI extra instructies geven.

Al met al laat dit onderzoek zien dat AI flexibeler wordt. Het kan begrijpen en bouwen in veel talen, waardoor de barrière die iedereen dwong om Engels te spreken om goede code te krijgen, wordt doorbroken. Maar zoals elk nieuw hulpmiddel, heeft het zijn eigenaardigheden, en moeten we leren hoe we ermee moeten werken om de beste resultaten te krijgen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →