← Nieuwste papers
💻 computer science

Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards

Dit paper analyseert de beperkingen van bestaande LLM-leaderschappen en introduceert een interactieve visualisatie die gebruikers in staat stelt om hun eigen evaluatieprioriteiten te definiëren, waardoor transparantie en contextspecifieke modelbeoordeling worden bevorderd.

Oorspronkelijke auteurs: Minji Jung, Minjae Lee, Yejin Kim, Sarang Choi, Minsuk Kahng

Gepubliceerd 2026-04-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Minji Jung, Minjae Lee, Yejin Kim, Sarang Choi, Minsuk Kahng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een grote prijsuitreiking voor auto's organiseert. De winnaar wordt gekozen op basis van één enkel cijfer: de "totale score". Maar wie bepaalt eigenlijk welke onderdelen van die score tellen?

In dit onderzoek kijken de auteurs naar de wereld van LLM-leaderboards (ranglijsten van slimme AI-modellen). Ze stellen een vervelend probleem bloot: deze lijsten worden gemaakt door een kleine groep experts die beslissen wat belangrijk is. Maar de echte gebruikers (zoals een school, een ziekenhuis of een bedrijf) hebben vaak heel andere behoeften.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Alles-in-één" Score is een Leugen

Stel je voor dat je een grote soep maakt. De chef-kok (de maker van de ranglijst) zegt: "Deze soep is de beste ter wereld!" Maar hij heeft de soep gemaakt met veel ingrediënten die jij niet lekker vindt, zoals veel vis en kruiden die jij niet mag.

De huidige AI-ranglijsten werken zo. Ze geven één getal (bijvoorbeeld: "Model A is nummer 1"). Maar dat getal is een gemiddelde van alles: van het schrijven van computercode tot het oplossen van wiskundige sommen en het vertellen van grappen.

  • Het probleem: Als jij een AI nodig hebt voor een wiskundetoets voor middelbare scholieren, maakt het niet uit hoe goed die AI is in het schrijven van computercode. Maar op de ranglijst telt die code-werkzaamheid even zwaar mee als jouw wiskunde-vraag. Het is alsof je een auto koopt die de "beste" is omdat hij snel kan racen, terwijl jij hem alleen nodig hebt om rustig door de stad te rijden.

2. De Onderzoekers Kijken in de Soep

De auteurs van dit paper hebben de "soep" van de populaire LMArena (een grote AI-wedstrijd) eens goed onder de loep genomen. Ze ontdekten drie verrassende dingen:

  • De soep is scheef: Er zit veel meer "computercode" en "AI-taal" in dan in andere onderwerpen. De lijst is dus eigenlijk gemaakt voor programmeurs, niet voor de gemiddelde gebruiker.
  • De winnaar hangt af van de vraag: Een model dat nummer 1 is in de algemene lijst, kan nummer 50 zijn als je alleen kijkt naar wiskundevragen. En een ander model dat over het algemeen slecht is, kan juist de beste zijn voor het oplossen van complexe wiskundeproblemen.
  • Mensen zijn niet altijd logisch: Soms kiezen mensen een antwoord dat "mooier" klinkt, zelfs als het antwoord verkeerd is. Of ze kiezen een antwoord dat een bepaald politiek standpunt inneemt, terwijl ze misschien een neutraal antwoord nodig hadden.

3. De Oplossing: Een "Zelfbouw-Ranglijst"

In plaats van te zeggen: "Kijk, dit is de beste AI," zeggen de auteurs: "Jij bepaalt wat 'het beste' is voor jou."

Ze hebben een interactief dashboard ontworpen. Stel je dit voor als een keukentafel met ingrediënten:

  • Je ziet een lijst met alle soorten vragen (wiskunde, geschiedenis, code, grappen).
  • Je kunt de "ingrediënten" die jij niet nodig hebt, weggooien (bijvoorbeeld: "Ik wil geen computercode").
  • Je kunt de ingrediënten die je wel belangrijk vindt, extra groot maken (bijvoorbeeld: "Ik wil 50% van mijn tijd besteden aan geschiedenis").
  • Zodra je dit doet, verandert de ranglijst direct. De "winnaar" is nu misschien een heel ander model dan voorheen.

4. Wat Leerden We van Mensen die het Probeerden?

De onderzoekers lieten tien professionals (zoals ingenieurs en docenten) met dit nieuwe systeem werken. Wat gebeurde er?

  • Oogopenend: Mensen dachten dat ze wisten welk model het beste was, maar toen ze hun eigen lijst maakten, zagen ze dat hun favoriet eigenlijk slecht was voor hun specifieke taak.
  • Betrouwbare keuzes: In plaats van blind te vertrouwen op een getal, konden ze zien waarom een model goed was. Ze konden zelfs kijken naar de echte vragen en antwoorden om te zien of het model echt slim was of gewoon geluk had.
  • Geen "één groot antwoord": Mensen realiseerden zich dat er geen universele "beste AI" bestaat. Er is alleen de beste AI voor jouw specifieke situatie.

Conclusie: Wie Bepaalt Wat "Best" Is?

De titel van het paper is: "Wie bepaalt 'het beste'?"

Het antwoord is: Jij.

De huidige lijsten zijn als een vast menu in een restaurant waar je niet kunt kiezen. Dit nieuwe idee is als een buffet waar je zelf je bord samenstelt. Je kunt beslissen welke onderdelen belangrijk zijn voor jouw situatie, en zo een eerlijke en zinvolle vergelijking maken.

Het belangrijkste leerpunt is dat we stoppen met blind vertrouwen op één getal, en beginnen met het begrijpen van de context. Een AI is niet per se "slecht" of "goed"; het is alleen goed of slecht voor de vraag die je stelt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →