← Nieuwste papers
💬 NLP

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

Dit artikel onthult een "benchmark-illusie" waarbij geprunte grote taalmodellen competent lijken op meerkeuze-evaluaties maar falen in open eind generatie omdat pruning de juiste antwoorden degradeert in plaats van ze te wissen, wat suggereert dat gecomprimeerde modellen getest moeten worden op hun generatieve vermogens in plaats van alleen op hun herkenningsvermogens.

Oorspronkelijke auteurs: Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li

Gepubliceerd 2026-06-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, erudiete bibliothecaris hebt (een Large Language Model) die het antwoord op bijna elke vraag weet. Om geld en ruimte te besparen, besluit je de bibliotheek te "snoeien". Je verwijdert een enorme hoeveelheid boeken en planken en houdt alleen de meest essentiële over.

Het wetenschappelijke artikel waar je naar vraagt, onderzoekt wat er gebeurt wanneer je deze gekrompen bibliotheek test.

De "Multiple-Choice Illusie"

Hier is de truc: Wanneer je de bibliothecaris een vraag stelt, kun je hem op twee manieren testen:

  1. De Open Vraag: Je vraagt: "Wie ontdekte de Azoren?" en wacht tot hij het antwoord uit zijn geheugen spreekt.
  2. De Multiple-Choice Test: Je vraagt: "Wie ontdekte de Azoren? A) 1427, B) 1500, C) 1600, D) 1700."

Het artikel vond een verrassende "illusie". Na het snoeien faalt de bibliothecaris vaak bij de Open Vraag. Hij zegt misschien: "Ik denk dat het de 15e eeuw was," wat vaag of onjuist is. Maar als je hem de Multiple-Choice test geeft, behaalt hij een uitstekende score. Hij wijst onmiddellijk naar "1427" en heeft het goed.

Standaard benchmarks (de tests die worden gebruikt om AI te beoordelen) vertrouwen meestal op het multiple-choice formaat. Dit creëert een vals gevoel van veiligheid. De test zegt: "Je bibliotheek is nog steeds perfect!" maar in werkelijkheid heeft de bibliothecaris het vermogen verloren om het antwoord te herinneren zonder hulp. Hij kan het antwoord nog wel herkennen als je het hem laat zien, maar hij kan het niet uit zichzelf produceren.

De "Demotie" vs. "Erasure" Theorie

De auteurs stelden een cruciale vraag: Heeft het snoeien de kennis gewist (de bibliothecaris is het feit volledig vergeten) of heeft het de kennis slechts gedemoteerd (de bibliothecaris weet het nog wel, maar het is niet langer zijn eerste gedachte)?

Ze ontdekten dat het voornamelijk demotie is.

Denk aan de geest van de bibliothecaris als een drukke kamer vol ideeën. Vóór het snoeien stond het juiste antwoord direct bij de voordeur en zwaaide naar je. Na het snoeien is het juiste antwoord nog steeds in de kamer, maar is het naar de derde of vierde rij naar achteren geduwd.

  • Greedy Decoding (De standaardinstelling): De bibliothecaris kijkt alleen naar de persoon die bij de voordeur staat. Omdat het juiste antwoord nu in rij 3 staat, kiest de bibliothecaris de verkeerde persoon die bij de voordeur staat.
  • Multiple Choice: Je overhandigt de bibliothecaris een lijst met mensen in de kamer. Zelfs al staat de juiste persoon in rij 3, de bibliothecaris kan die persoon nog steeds op de lijst zien en aanwijzen.

Hoe de "Demotie" te Herstellen

Omdat de kennis niet gewist, maar slechts naar achteren verplaatst is, laat het artikel zien dat je het antwoord vaak weer terugkrijgt met een beetje hulp:

  • Wider Search (Breder zoeken): In plaats van alleen bij de voordeur te kijken (greedy decoding), als je de bibliothecaris vertelt om naar de top 5 mensen in de kamer te kijken (Beam Search) of een paar gokjes te wagen (Sampling), zal hij het juiste antwoord weer vinden.
  • Een Kleine Hint: Als je de bibliothecaris één voorbeeld geeft van hoe hij een soortgelijke vraag moet beantwoorden (één "in-context" voorbeeld), helpt dit hem om het juiste antwoord weer naar de voorste rij te duwen.

De Catch

Dit "demotie"-effect komt vaak voor, vooral bij grotere modellen en talen waar het model goed in is. Echter, het artikel merkt op dat bij kleinere modellen of zeer moeilijke talen, het snoeien de kennis soms daadwerkelijk verwijdert (erasure). In die gevallen kan de bibliothecaris het antwoord zelfs niet vinden als je hem de lijst laat zien, omdat het weg is.

De Kern van de Zaak

Het artikel waarschuwt ons om "multiple-choice" scores niet te veel te vertrouwen bij het beoordelen van gecomprimeerde AI-modellen. Een model kan er perfect uitzien op een test waarbij je de antwoorden geeft, maar hopeloos falen wanneer een echte gebruiker een directe vraag stelt. Om te weten of een gecomprimeerd model echt bruikbaar is, moeten we testen wat het zelf kan produceren, en niet alleen wat het kan herkennen wanneer we het antwoord met de antwoordensleutel voor de neus houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →