← Nieuwste papers
💬 NLP

Evaluating Scoring Bias in LLM-as-a-Judge

Dit artikel behandelt het onderbelichte probleem van scorebias in LLM-as-a-Judge-systemen door drie nieuwe bias-types te definiëren en te kwantificeren—rubriekvolgorde-, score-ID- en referentieantwoord-scorebias—en een uitgebreid kader voor te stellen om deze te mitigeren via verbeterde promptontwerp en geautomatiseerde evaluatie.

Oorspronkelijke auteurs: Qingquan Li, Shaoyu Dou, Kailai Shao, Chao Chen, Haixiang Hu

Gepubliceerd 2026-05-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qingquan Li, Shaoyu Dou, Kailai Shao, Chao Chen, Haixiang Hu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, geautomatiseerde robotleraar hebt ingehuurd om opstellen te beoordelen. Deze robot moet eerlijk, objectief en consistent zijn. Je geeft hem een studentopstel en een beoordelingsrubriek (een checklist van wat een goed opstel maakt), en hij geeft het opstel een score van 1 tot 5.

Dit artikel gaat over de ontdekking dat zelfs de slimste robotleraren vrij gemakkelijk in de val kunnen worden gelokt. Ze kijken niet alleen naar het opstel; ze raken in de war door hoe de instructies zijn geschreven, zelfs als de instructies precies hetzelfde zeggen.

Hier is de uiteenzetting van de bevindingen van het artikel met behulp van eenvoudige analogieën:

Het Kernprobleem: Het "Magische 8-Bal"-effect

De onderzoekers ontdekten dat als je de opmaak van de beoordelingsinstructies lichtjes verandert – zonder de daadwerkelijke betekenis te wijzigen – de score van de robot voor hetzelfde opstel drastisch kan veranderen. Het is alsof je een vriend vraagt: "Hoe goed is deze film?" en je krijgt een "5 van de 5" als je het beleefd vraagt, maar een "2 van de 5" als je het vraagt terwijl je op je hoofd staat. De film is niet veranderd, maar het antwoord wel.

Het artikel richt zich op Beoordelingsbias, wat het geval is wanneer de robot een ander absoluut cijfer geeft (zoals een 3 of een 4) puur omdat de prompt is aangepast, niet omdat het antwoord is veranderd.

De Drie Manieren waarop de Robot in de War Raakt

De onderzoekers identificeerden drie specifieke "trucs" die de beoordeling van de robot verstoren:

  1. De Menu-volgorde Bias (Volgorde van de Rubriek):
    Stel je een restaurantmenu voor. Meestal staan voorgerechten eerst, dan hoofdgerechten. Als je het menu omdraait zodat de hoofdgerechten eerst staan, smaakt het eten dan anders? Nee. Maar de robotleraar denkt van wel.

    • De Bevinding: Als de beoordelingsregels worden opgesomd van "1 tot 5" (laag naar hoog), beoordeelt de robot anders dan als ze worden opgesomd van "5 tot 1" (hoog naar laag) of in een willekeurige volgorde. De robot raakt in de war door de volgorde.
  2. De Naamplaatje Bias (Score-ID):
    Meestal gebruiken we cijfers zoals 1, 2, 3, 4, 5. Maar wat als we letters gebruiken (A, B, C, D, E) of Romeinse cijfers (I, II, III, IV, V)?

    • De Bevinding: Het brein van de robot reageert anders op deze verschillende "namen" voor de scores. Soms maakt het gebruik van Romeinse cijfers de robot een betere beoordelaar; soms maakt het hem slechter. Het is alsof de robot een favoriet alfabet heeft.
  3. De "Perfecte Voorbeeld" Bias (Referentieantwoord Score):
    Soms geven docenten studenten een "perfect voorbeeld" van een opstel om te laten zien hoe een "5" eruit ziet. De onderzoekers testten wat er gebeurt als ze een score aan dat voorbeeld koppelen.

    • De Bevinding: Als je de robot een perfect voorbeeld laat zien en het labelt als "Score 5", wordt de robot zeer consistent en accuraat. Echter, als je datzelfde perfecte voorbeeld labelt als een "Score 3", raakt de robot in de war en begint hij aan alles anders lagere scores te geven, denkend: "Oh, als het perfecte voorbeeld slechts een 3 is, moet dit opstel van de student verschrikkelijk zijn."

De Experimenten: Het Testen van de Robots

De onderzoekers testten dit op verschillende "robotleraren" (AI-modellen), variërend van de krachtigste (zoals GPT-4o) tot kleinere, goedkopere modellen.

  • De Grote Robots versus de Kleine Robots: De krachtigste robots waren minder snel in de war te brengen. Ze waren als een senior leraar die het materiaal zo goed kent dat het omdraaien van de menuvolgorde hen niet van hun stuk brengt. De kleinere robots waren als nerveuze studentleraren; een kleine verandering in de instructies liet hun scores wild op en neer springen.
  • De Verrassing: Soms hielpen de "trucs" eigenlijk! Voor sommige robots zorgden het gebruik van Romeinse cijfers of het omdraaien van de volgorde van de regels ervoor dat ze accurater beoordeelden dan op de standaardmanier. Het blijkt dat de "standaard" manier waarop mensen meestal prompts schrijven, niet altijd de beste manier is voor robots.

De Oplossingen: Hoe de Beoordeling te Repareren

Op basis van hun experimenten stellen de auteurs drie manieren voor om deze robotrechters betrouwbaarder te maken:

  1. Huur de Grote Robots in: Als je een kritische beoordeling nodig hebt (zoals voor een baan of school), gebruik dan het krachtigste beschikbare AI-model. Ze zijn van nature stabieler en minder vatbaar voor te worden beïnvloed door opmaaktrucs.
  2. Breek de Regels (Opzettelijk): Kopieer niet zomaar de standaardlijst van "1 tot 5". Probeer de regels te lijsten van "5 tot 1", of gebruik letters in plaats van cijfers. Het artikel suggereert dat iets doen dat iets "onconventioneel" is maar duidelijk, de robot eigenlijk kan stoppen in zijn gebruikelijke biasvalstrikken te vallen.
  3. Toon het Perfecte Voorbeeld (met een 5): Als je de robot een "gouden standaard" antwoord gaat tonen om hem te helpen bij het beoordelen, zorg er dan voor dat je het labelt als een "5" (de hoogste score). Dit verankert het denken van de robot en maakt het veel accurater.

De Conclusie

Het artikel concludeert dat "LLM-as-a-Judge" (het gebruik van AI om AI te beoordelen) niet zo objectief is als we dachten. De robots zijn gevoelig voor de presentatie van de regels, niet alleen voor de regels zelf. Om eerlijke cijfers te krijgen, moeten we zeer zorgvuldig zijn met hoe we de instructies schrijven, misschien door de krachtigste modellen te gebruiken en onze prompts op een manier te ontwerpen die iets afwijkt van wat we gewend zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →