← Nieuwste papers
🤖 machine learning

Resolution Diagnostics for Paired LLM Evaluation

Dit artikel diagnosticeert een kritiek tekort aan statistische power in huidige gepaarde LLM-leaderboards, waarbij wordt aangetoond dat veel paarsgewijze rangschikkingen onopgelost blijven door onvoldoende steekproefgroottes en de wijdverbreide misbruik van ongepaarde effectgrootte-benaderingen die de benodigde steekproefgroottes met ongeveer een factor twee onderschatten.

Oorspronkelijke auteurs: Anany Kotawala

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anany Kotawala

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een jurylid bent bij een kookwedstrijd. Twee chefs, Chef A en Chef B, hebben net hun gerechten afgerond. Je proeft ze en zegt: "Het gerecht van Chef A is 0,8% beter dan dat van Chef B." De menigte raakt in extase, de krantenkoppen schreeuwen "Chef A wint!" en mensen beginnen de kookboeken van Chef A te kopen.

Maar wacht even. Wist je eigenlijk wel dat Chef A beter was, of had je gewoon geluk met de specifieke ingrediënten die je toevallig proefde?

Dit artikel is een "realiteitscheck" voor de wereld van Large Language Models (LLM's). Het betoogt dat veel van de huidige leaderboards (de "kookwedstrijden" voor AI) claims doen die te wankel zijn om waar te zijn. Ze verklaren winnaars op basis van minimale verschillen die gemakkelijk gewoon willekeurige ruis kunnen zijn.

Hier is de uiteenzetting van de bevindingen van het artikel met behulp van eenvoudige analogieën:

1. Het "Gekoppelde" Probleem: Het is geen Race, het is een Duel

De meeste mensen denken dat het testen van twee AI-modellen als een race is waarbij ze op verschillende banen lopen. Maar in werkelijkheid worden deze modellen getest op exact dezelfde vragen (hetzelfde parcours).

  • De Analogie: Stel je twee hardlopers voor die op hetzelfde moment op hetzelfde parcours lopen. Als de wind waait, waait hij voor beiden. Als het parcours glad is, is het voor beiden glad. Omdat ze exact dezelfde omstandigheden ondergaan, zijn hun resultaten "gekoppeld".
  • De Fout: Veel huidige tools berekenen de "statistische power" (het vertrouwen dat het resultaat echt is) alsof de hardlopers op verschillende banen zouden lopen. Dit is alsof je de wind en de omstandigheden van het parcours negeert.
  • Het Resultaat: Het artikel vond dat door deze "gekoppelde" aard te negeren, veel tools de benodigde steekproefomvang met een factor twee onderschatten. Het is alsof je denkt dat je slechts 50 proefpersonen nodig hebt om een verschil te bewijzen, terwijl je er eigenlijk 100 nodig hebt.

2. De "Resolutie"-diagnose: De Microscope-check

De auteurs hebben een nieuw hulpmiddel ontwikkeld dat een "Resolutie-diagnose" wordt genoemd. Denk hierbij aan een microscoop voor de leaderboard.

  • Hoe het werkt: Voordat je een winnaar verklaart, kijk je door de microscoop.
    • Als het gat tussen de modellen groot is (zoals 15%), toont de microscoop een helder, scherp beeld. De winnaar is echt.
    • Als het gat klein is (zoals 0,5%), toont de microscoop een wazig, onscherp beeld. Je kunt niet zeggen of de wazigheid komt doordat één model echt beter is, of gewoon door willekeurige ruis.
  • De Bevinding: Toen ze keken naar twee beroemde leaderboards (Open LLM Leaderboard en MMLU-Pro), vonden ze dat veel van de "winnaars" eigenlijk slechts wazige beelden waren.
    • Op de Open LLM Leaderboard waren 11 van de 40 beweerde koppelingen te wazig om zeker te zijn.
    • Op de top 10 van MMLU-Pro waren 4 van de 9 dichtstbijzijnde matches onopgelost.

3. De "Shortcut"-valstrik: De Gebroken Rekenmachine

Het artikel ontdekte dat veel onderzoekers een "shortcut" gebruiken om hun wiskunde te doen.

  • De Analogie: Stel je voor dat je een rekenmachine hebt die is ontworpen voor individuele hardlopers (ongekoppeld). Je probeert deze te gebruiken voor een duel (gekoppeld) door simpelweg aan het einde op een knop "vermenigvuldig met 0,7" te drukken.
  • Het Probleem: Het artikel bewees wiskundig dat deze shortcut gebroken is voor nauwe races. Het vertelt je consequent dat je de helft van de data nodig hebt die je eigenlijk nodig hebt.
  • Het Bewijs: Ze testten vijf populaire statistische tools. Drie daarvan (inclusief een beroemde formule uit een handboek en een populaire software genaamd G*Power) liepen in deze valstrik. Ze gaven stilzwijgend antwoorden die de helft zo groot waren als ze hadden moeten zijn, waardoor mensen dachten dat ze voldoende data hadden terwijl ze dat niet hadden.

4. Het "Groeps"-effect: Vrienden die Samen Zitten

Realistische tests zijn niet zomaar willekeurige vragen; ze zijn vaak gegroepeerd per onderwerp (bijvoorbeeld wiskunde, geschiedenis, wetenschap).

  • De Analogie: Stel je voor dat je test of een nieuwe leermethode werkt. Als je het test op een groep vrienden die allemaal samen zitten en elkaars antwoorden kopiëren, zijn hun resultaten gecorreleerd. Je kunt ze niet behandelen als 100 onafhankelijke personen; ze gedragen zich meer als 10 personen.
  • De Bevinding: Toen de auteurs rekening hielden met deze "groepen" (clusters) in de MMLU-Pro-test, steeg het aantal "onopgeloste" (wazige) paren.
    • Zonder te controleren op groepen: 4 paren waren wazig.
    • Met controleren op groepen: 6 paren waren wazig.
    • Sommige paren die leken op duidelijke winnaars, werden plotseling te nauwe races om te beslissen.

5. Het "Live Stream"-probleem: Te Vroeg Stoppen

Leaderboards worden voortdurend bijgewerkt. Er worden elke dag nieuwe modellen toegevoegd.

  • De Analogie: Stel je voor dat je een live stream van een race bekijkt. Als je de race stopt op het exacte moment dat je ziet dat één hardloper vooruitkomt, kun je ongelijk hebben. Ze hebben misschien net geluk gehad, en de andere hardloper kan later inhalen.
  • De Bevinding: Het artikel testte wat er gebeurt als je de leaderboard behandelt als een continue live stream in plaats van een enkel momentopname. Deze "anytime-valid" test is strenger. Het markeerde nog één paar als onopgelost dat de standaardtest had gemist.

De Conclusie

Het artikel zegt niet dat de modellen slecht zijn of dat de ranglijsten nep zijn. Het zegt: "We verklaren winnaars te snel."

Veel van de kleine gaten die we op leaderboards zien (zoals 0,5% of 1%) zijn momenteel te klein om statistisch zeker te zijn. De "microscoop" (de resolutiediagnose) toont aan dat we vaak naar statische ruis kijken en dat een signaal noemen.

Het advies van de auteurs: Voordat je een kopregel plaatst over een model dat "beter" is, moet je controleren of je test voldoende "resolutie" heeft om dat verschil duidelijk te zien. Als het antwoord nee is, is het gat slechts een gok, geen feit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →