← Nieuwste papers
💬 NLP

Comparing Developer and LLM Biases in Code Evaluation

Dit paper introduceert TRACE, een framework dat aantoont dat LLM-judges in realistische coderingsscenario's significant afwijken van menselijke voorkeuren door systematische biases, zoals de neiging om langere code-uitleg te prefereren terwijl ontwikkelaars kortere verkiezen.

Oorspronkelijke auteurs: Aditya Mittal, Ryan Shar, Zichu Wu, Shyam Agarwal, Tongshuang Wu, Chris Donahue, Ameet Talwalkar, Wayne Chi, Valerie Chen

Gepubliceerd 2026-03-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Aditya Mittal, Ryan Shar, Zichu Wu, Shyam Agarwal, Tongshuang Wu, Chris Donahue, Ameet Talwalkar, Wayne Chi, Valerie Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe chef-kok hebt aangenomen om te oordelen over de maaltijden die je koks bereiden. Deze chef-kok is geen mens, maar een zeer slimme computer (een AI). Je wilt dat deze AI-chef precies weet wat jij lekker vindt, zodat hij de beste gerechten selecteert.

Maar wat als de AI-chef een heel ander smaakpalet heeft dan jij? Wat als hij houdt van enorme porties en ingewikkelde sauzen, terwijl jij juist houdt van simpele, snelle en duidelijke gerechten?

Dit is precies het probleem dat onderzoekers van de Carnegie Mellon Universiteit hebben onderzocht in hun nieuwe paper over TRACE. Hier is de uitleg in simpele taal:

1. Het Probleem: De "Valse" Chef

In de softwarewereld gebruiken bedrijven steeds vaker AI om te beoordelen of andere AI's goed code schrijven. Dit noemen ze "AI als rechter". Maar vaak kijkt deze AI-rechter naar de verkeerde dingen.

  • De Menselijke Kookstijl: Een menselijke programmeur (de ontwikkelaar) wil code die werkt, maar ook makkelijk te lezen is, niet te langdradig is en precies past in wat hij nu nodig heeft.
  • De AI-Kookstijl: De AI-rechter vindt vaak dat "meer" beter is. Hij houdt van lange uitleg, heel robuuste (veilige) code die misschien wel 10 keer te veilig is, en hij negeert soms of de code wel echt in het bestand past.

Het resultaat? De AI kiest vaak voor een antwoord dat de menselijke programmeur eigenlijk niet wil.

2. De Oplossing: TRACE (De Smaaktest)

De onderzoekers hebben een nieuwe tool bedacht die TRACE heet. Je kunt TRACE zien als een geavanceerde smaaktest.

In plaats van alleen te zeggen "Deze AI is fout", doet TRACE drie dingen:

  1. Het Vergelijken: Het kijkt naar duizenden voorbeelden waar een mens en een AI-rechter verschillende keuzes maakten.
  2. Het Ontmaskeren: Het trekt de "recepten" (de regels) uit de AI's hoofd. Het vraagt: "Waarom koos de AI dit? Ah, omdat hij van lange uitleg houdt!"
  3. Het Kwantificeren: Het maakt een lijstje van de "smaakvoorkeuren" (in het paper rubrics genoemd) en meet precies hoeveel de AI afwijkt van de mens.

3. De Drie Keukens (De Drie Manieren van Werken)

De onderzoekers keken naar drie verschillende situaties, alsof ze drie verschillende keukens bezochten:

  • De Autocompletie (De Snelle Hulp): Hier helpt de AI je terwijl je typt (zoals een slimme voorspelling).
    • Het verschil: De mens wil dat de code snel in de zin past en duidelijk is. De AI-rechter vindt het belangrijker dat de code "logisch perfect" is, zelfs als het de menselijke flow verstoort.
  • De Code-Edit (De Reparatie): Hier vraag je de AI om een stukje code te veranderen.
    • Het verschil: De mens wil een precieze reparatie. De AI-rechter negeert vaak of de code duidelijk is, en kijkt alleen of de opdracht is uitgevoerd, alsof hij een robot is die alleen "ja/nee" denkt.
  • De Chat (Het Gesprek): Hier praat je met de AI over een probleem.
    • Het verschil: De mens wil een oplossing die past bij zijn specifieke situatie (bijv. "Ik werk met een oude database"). De AI-rechter geeft vaak een generiek, standaard antwoord met een lange uitleg, omdat hij denkt dat "veel uitleg" altijd goed is.

4. De Grote Ontdekking: De AI is nog niet klaar

De onderzoekers hebben 13 verschillende AI's getest. Het nieuws is niet heel goed:

  • Geen enkele AI is perfect: Zelfs de slimste AI's scoren 12% tot 23% slechter dan een groep mensen die samen oordelen.
  • Oefening baart kunst (niet): AI's die speciaal zijn getraind om te "rechteren" doen het niet veel beter dan de gewone AI's. Het probleem zit dieper.
  • De "Smaak" is anders: De AI's waarderen dingen die voor hen logisch lijken (zoals "veiligheid" en "lengte"), maar die voor een menselijke programmeur soms juist hinderlijk zijn.

5. Waarom is dit belangrijk?

Stel je voor dat je een auto bouwt en de AI de "veiligheidsrechter" is. Als de AI denkt dat een auto veiliger is als hij 1000 kilo weegt en 500 km/u kan, maar jij wilt een lichte, snelle auto, dan bouw je de verkeerde auto.

In de softwarewereld betekent dit dat we AI's die code schrijven misschien niet kunnen vertrouwen op hun eigen oordeel over wat "goede code" is. Ze hebben een bias (vooroordeel) ontwikkeld die niet overeenkomt met hoe mensen echt werken.

Conclusie

Deze paper zegt eigenlijk: "Stop met blind vertrouwen op AI als rechter."

We moeten AI's beter trainen om te begrijpen wat mensen echt belangrijk vinden in hun dagelijkse werk, en niet alleen wat er op papier "correct" lijkt. De tool TRACE is de eerste stap om deze smaakverschillen in kaart te brengen, zodat we in de toekomst een AI-chef kunnen hebben die precies weet wat jij lekker vindt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →