Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks
Dit artikel onthult dat op LLM gebaseerde beoordelaars aanzienlijke inconsistentie binnen dezelfde beoordelaar vertonen over verschillende runs, wat de betrouwbaarheid van hun scores ondermijnt, en onderzoekt of dergelijke evaluaties toch effectief kunnen worden benut aan de hand van specifieke richtlijnen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: De "Achtergrond" Rechter
Stel je voor dat je een beroemde foodcriticus huurt om een nieuw restaurant te beoordelen. Je vraagt hen om drie keer op rij hetzelfde gerecht te proeven, terwijl ze aan dezelfde tafel zitten met dezelfde servet voor zich.
- Proef 1: Ze geven het een 5-sterrenbeoordeling en noemen het "een meesterwerk".
- Proef 2: Ze geven het een 2-sterrenbeoordeling en noemen het "banaal en overgaard".
- Proef 3: Ze geven het een 4-sterrenbeoordeling en zeggen dat het "fatsoenlijk is maar meer zout nodig heeft".
Als dit zou gebeuren, zou je die criticus niet vertrouwen. Je zou beseffen dat hun oordeel als een roulette-wiel is: het draait en landt elke keer op een ander getal, zelfs al is het eten (de invoer) nooit veranderd.
Dit is precies wat de onderzoekers ontdekten toen ze Large Language Models (LLM's) vroegen om als rechters op te treden voor andere door AI gegenereerde teksten. Ze ontdekten dat deze AI-rechters lijden aan "Rating Roulette".
Het Probleem: De AI-Rechter Kan het Niet Met Zichzelf Eens Worden
In de wereld van AI gebruiken we vaak één AI om het werk van een andere AI te beoordelen. Dit heet "LLM-as-a-Judge". Het is populair omdat het sneller en goedkoper is dan het inhuren van mensen.
Echter, de onderzoekers deden een simpele test:
- Ze namen een stuk tekst (zoals een nieuwsbericht of een chatgesprek).
- Ze vroegen dezelfde AI-rechter om het drie keer te beoordelen met exact dezelfde instructies.
- Ze keken of de AI elke keer dezelfde score gaf.
Het Resultaat: De AI-rechters waren overal.
- Bij een taak genaamd SummaC (controleren of een samenvatting feitelijk waar is), stemde de beste AI-rechter slechts ongeveer 79% van de tijd met zichzelf in.
- Bij een taak genaamd MT-Bench (chatbot-gesprekken rangschikken) daalde de overeenstemming nog verder. Een AI-rechter gaf slechts in 61% van de gevallen drie keer op rij exact hetzelfde antwoord.
Het is alsof de stemming van de rechter elke keer verandert als je een vraag stelt, zelfs al zijn de vraag en het antwoord niet veranderd.
De "Goedkope Truc" die Terugslaat
Je zou kunnen denken: "Oké, laten we de AI gewoon vertellen dat ze niet willekeurig moet zijn. Laten we het 'dobbelstenen' deel van haar hersenen uitschakelen zodat ze altijd hetzelfde antwoord geeft."
De onderzoekers probeerden dit. Ze stelden de AI in op 100% deterministisch (geen willekeur).
- Werd het consistent? Ja.
- Werd het een betere rechter? Nee.
Sterker nog, toen ze de AI dwongen om te stoppen met het rollen van de dobbelstenen, werden hun beoordelingen eigenlijk slechter in vergelijking met menselijke rechters. Het is alsof je een chef-kok dwingt om elke keer exact hetzelfde recept te gebruiken; ze maken misschien geen fouten meer, maar ze zijn ook niet meer creatief of aanpasbaar, en het eten smaakt uiteindelijk slechter.
Het artikel suggereert dat er een afweging is: Om een goede beoordeling te krijgen die overeenkomt met de menselijke mening, heeft de AI een beetje "willekeur" (variabiliteit) nodig. Maar diezelfde willekeur maakt de AI inconsistent met zichzelf.
De Menselijke Vergelijking: Zijn Mensen Beter?
De onderzoekers keken ook naar menselijke rechters om te zien of dit een probleem is dat alleen bij AI voorkomt.
- Menselijke Experts: Toen experts dezelfde tekst beoordeelden, waren ze redelijk met elkaar eens, maar niet perfect.
- Crowdwerkers: Toen gewone mensen (crowdwerkers) de tekst beoordeelden, waren ze vaak het oneens met elkaar en met de experts.
- De Verrassing: In sommige gevallen waren de AI-rechters eigenlijk consistenter met zichzelf dan mensen met elkaar. Echter, omdat de scores van de AI zo wisselvallig waren, is het moeilijk om te zeggen of de AI eigenlijk "goed" is of gewoon "geluk" heeft.
Waarom Is Dit Belangrijk? (De "Gebroken Liniaal" Analogie)
Stel je voor dat je de hoogte van een boom wilt meten.
- De Oude Manier: Je gebruikt een liniaal die iets gebogen is. Het is niet perfect, maar het is stabiel.
- De Nieuwe Manier (LLM-Rechter): Je gebruikt een liniaal van rubber. Soms rekt het uit, soms krimpt het. Zelfs als je dezelfde boom drie keer meet, krijg je drie verschillende getallen.
Als je een rubberen liniaal gebruikt, kun je de meting niet vertrouwen. Het artikel stelt dat het gebruik van een LLM als rechter momenteel hetzelfde is als het gebruik van een rubberen liniaal.
- Als je de test één keer uitvoert, krijg je een score.
- Als je het opnieuw uitvoert, krijg je een andere score.
- Als je het een derde keer uitvoert, krijg je een derde score.
Omdat de score elke keer verandert, weten we niet of de AI echt goed is in het beoordelen van kwaliteit, of dat het gewoon raadt.
Wat Vonden Ze in Verschillende Taken?
De onderzoekers testten drie verschillende soorten "spelletjes" die de AI moest spelen:
- Waar of Onwaar (SummaC): Is de samenvatting feitelijk correct? (Twee keuzes).
- Resultaat: AI-rechters waren inconsistent, maar nieuwere, grotere modellen waren iets beter.
- De 1-tot-5 Sterren Beoordeling (SummEval): Beoordeel de samenvatting op "Coherentie", "Vloeiendheid", enz.
- Resultaat: De AI was zeer inconsistent, vooral bij "Vloeiendheid" (hoe soepel de tekst klinkt). Interessant genoeg was de AI soms beter in het beoordelen van vloeiendheid dan mensen in het met elkaar eens worden.
- De Battle Royale (MT-Bench): Welke van twee chatbots gaf een beter antwoord?
- Resultaat: Dit was de moeilijkste taak. De AI-rechters waren hier extreem wisselvallig, vaak van mening veranderend over welke chatbot beter was.
De Conclusie: Hoe Het Roulette-wiel Te Repareren
Het artikel biedt een paar praktische tips voor mensen die AI-rechters willen gebruiken:
- Vertrouw niet op één keer: Als je een AI vraagt om iets te beoordelen, neem dan niet zomaar het eerste antwoord. Vraag het om het drie keer te beoordelen en neem de gemiddelde of de meerderheidsstem. Dit gladstrijkt het "roulette"-effect en geeft een score die dichter bij ligt bij wat een mens zou zeggen.
- Zet de willekeur niet uit: Hoewel willekeur zorgt voor inconsistentie, maakt het volledig uitschakelen de AI slechter in het overeenstemmen met menselijke meningen. Je hebt een beetje chaos nodig om het juiste antwoord te krijgen.
- Controleer je eigen consistentie: Voordat je een AI-rechter vertrouwt, moet je controleren of het met zichzelf eens is. Als het niet met zichzelf eens kan worden, kan het waarschijnlijk ook niet met jou eens worden.
Samenvatting
Het artikel onthult dat AI-rechters momenteel onbetrouwbaar zijn omdat ze elke keer dat ze worden gevraagd, verschillende antwoorden geven op dezelfde vraag. Ze zijn als een roulette-wiel in plaats van een stabiele weegschaal. Hoewel nieuwere AI-modellen iets consistenter zijn, worstelen ze nog steeds om betrouwbaar te zijn. De beste oplossing op dit moment is om de AI het spel meerdere keren te laten spelen en de resultaten te middelen, in plaats van te vertrouwen op één enkele "draai" van het wiel.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.