← Nieuwste papers
💬 NLP

Mediocrity is the key for LLM as a Judge Anchor Selection

Dit onderzoek toont aan dat de keuze van een 'anker'-model cruciaal is voor de betrouwbaarheid van LLM-jury-evaluaties, waarbij extreme modellen (zeer goed of zeer slecht) als ankers averechts werken en in plaats daarvan gemiddelde modellen de voorkeur verdienen om menselijke rankings nauwkeurig te reproduceren.

Oorspronkelijke auteurs: Shachar Don-Yehiya, Asaf Yehudai, Leshem Choshen, Omri Abend

Gepubliceerd 2026-03-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shachar Don-Yehiya, Asaf Yehudai, Leshem Choshen, Omri Abend

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De "Middelmachtigheid" is de Sleutel: Waarom een Gemiddeld Model de Beste Scheidsrechter is

Stel je voor dat je een groot toernooi organiseert waar 20 verschillende robot-koks (AI-modellen) een gerecht moeten maken. Je wilt weten wie de beste is. Maar in plaats van dat elke kok tegen elke andere kok moet vechten (wat 190 gevechten zou zijn en veel tijd kost), kies je één "standaard-kok" als anker. Alle andere koks moeten dan alleen maar tegen deze ene standaard-kok koken.

Dit is hoe veel AI-benchmarks werken: ze noemen het "LLM-as-a-judge" met een anker. De grote vraag in dit nieuwe onderzoek is: Wie moet die standaard-kok zijn?

De onderzoekers dachten eerst: "Natuurlijk moet je de allerbeste kok nemen, of juist de allerminste, zodat je duidelijk ziet wie beter is." Maar hun onderzoek toont aan dat dit een grote fout is.

Hier is de uitleg in simpele taal:

1. De "Superster" en de "Nul" werken niet

Stel je voor dat je als anker kiest voor Gordon Ramsay (de allerbeste kok).

  • Als je tegen hem kookt, winnen bijna alle andere koks niet. Ze verliezen allemaal.
  • Het resultaat? Je weet alleen dat ze allemaal slechter zijn dan Gordon. Maar je weet niet wie van de anderen net iets beter is dan de ander. Het is alsof je een race doet tegen een Formule 1-auto; de rest van de deelnemers haalt de finishlijn nooit, dus je kunt ze niet rangschikken.
  • Gordons winst: 90% van de tijd. Informatie: 0%. Je verspil je tijd.

Nu stel je voor dat je als anker kiest voor een kok die net de keuken heeft opgeblazen (de allerminste).

  • Dan winnen bijna alle anderen makkelijk.
  • Het resultaat? Iedereen wint, maar je weet weer niet wie de beste van de winnaars is.
  • Informatie: Ook hier 0%.

2. De "Middelmachtige" is de Held

Het verrassende resultaat van het papier is: De beste anker is een kok die "gemiddeld" is. Iemand die net goed genoeg kookt om soms te winnen en soms te verliezen.

  • Als je tegen een gemiddelde kok kookt, winnen de betere koks vaak, maar verliezen de slechtere koks vaak.
  • Dit creëert een perfecte mix: je krijgt genoeg "winnen" en genoeg "verliezen" om precies te zien wie er tussenin zit.
  • De onderzoekers noemen dit "Mediocrity" (middelmachtigheid), maar bedoelen hiermee: niet te sterk, niet te zwak. Iemand die precies in het midden van de ranglijst staat.

3. Waarom is dit belangrijk?

In de wereld van AI wordt nu vaak de allerbeste AI (zoals o3 of GPT-4) gebruikt als anker. Het papier laat zien dat dit een enorme verspilling is.

  • Je gebruikt 2/3 van je rekenkracht voor gevechten die je al weet: "De beste AI wint altijd."
  • Hierdoor worden de resultaten onnauwkeurig. Je denkt dat twee modellen even goed zijn, terwijl ze dat niet zijn, omdat je anker te sterk was om het verschil te zien.

4. De Grootte van het Toernooi

Het papier zegt ook iets over de grootte van je test.

  • Als je een anker gebruikt, heb je veel meer tests nodig dan wanneer je iedereen tegen iedereen laat vechten.
  • De huidige tests (zoals Arena-Hard) zijn vaak te klein. Ze zijn net groot genoeg om te zeggen "A is beter dan B", maar niet groot genoeg om te zeggen "A is heel iets beter dan B" als je een anker gebruikt.
  • Advies: Als je een anker gebruikt, zorg dan dat je anker "informatief" is (dus een gemiddelde) en dat je genoeg tests doet.

De Gouden Tips (Samenvatting)

  1. Kies geen ster: Gebruik niet de allerbeste AI als anker. Die wint te vaak en zegt je niets over de rest.
  2. Kies geen nul: Gebruik ook niet de slechtste AI. Die verliest te vaak.
  3. Kies de "Middellijn": Kies een AI die ongeveer even goed is als de modellen die je wilt testen. Die zorgt voor de eerlijkste en meest gedetailleerde ranglijst.
  4. Check je anker: Voordat je een groot onderzoek start, doe een kleine test om te zien of je anker echt "gemiddeld" genoeg is om interessante resultaten te geven.

Kortom: In de wereld van AI-jury's is de beste scheidsrechter niet de allerbeste speler, maar degene die precies in het midden zit. Die ziet het verschil tussen de winnaars het scherpst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →