← Nieuwste papers
💬 NLP

Uncovering Competency Gaps in Large Language Models and Their Benchmarks

Dit artikel introduceert een ongesuperviseerde methode die gebruikmaakt van het concept van sparse autoencoder activaties om automatisch zowel "model gaps" (specifieke zwakheden in grote taalmodellen) als "benchmark gaps" (dekkingsimbalans) te identificeren en te decomponeren, waardoor een fijnmazige evaluatie op conceptniveau wordt geboden die bestaande gestandaardiseerde benchmarks aanvult.

Oorspronkelijke auteurs: Maty Bohacek, Nino Scherrer, Nicholas Dufour, Thomas Leung, Christoph Bregler, Stephanie C. Y. Chan

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Maty Bohacek, Nino Scherrer, Nicholas Dufour, Thomas Leung, Christoph Bregler, Stephanie C. Y. Chan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Gemiddelde" Score Verbergt de Waarheid

Stel je voor dat je een schooldirecteur bent die een nieuwe leerling probeert te beoordelen. Je geeft de leerling een eindexamen en ze halen een 75%. Dat klinkt als een "C", toch? Goed gedaan.

Maar wat als die 75% een mix is van 100% voor wiskunde en 0% voor geschiedenis? Of wat als het examen zelf alleen maar vragen over wiskunde stelde en geschiedenis volledig negeerde?

Dit is precies het probleem met de manier waarop we AI momenteel testen (Large Language Models of LLM's). We geven ze meestal een grote lijst met vragen (een "benchmark") en rapporteren één enkele gemiddelde score. De auteurs van dit paper stellen dat dit ene getal misleidend is. Het verbergt twee specifieke problemen:

  1. Model Gaps (Modelkloven): De AI is eigenlijk heel slecht in specifieke dingen, maar de gemiddelde score laat het er goed uitzien.
  2. Benchmark Gaps (Benchmarkkloven): De test zelf is oneerlijk omdat het alleen over bepaalde onderwerpen gaat en andere negeert.

De Oplossing: De "Röntgenvisie"-Tool

Om dit op te lossen, hebben de auteurs een nieuwe tool gebouwd genaamd Competency Gaps (CG).

Beschouw het brein van een AI als een gigantische, donkere loods gevuld met duizenden verschillende "concepten" (zoals "hoe schrijf je code", "hoe ben je beleefd" of "hoe vertel je een grap"). Normaal gesproken kunnen we niet in deze loods kijken; we zien alleen het uiteindelijke antwoord dat de AI geeft.

De auteurs gebruiken een speciale technologie genaamd een Sparse Autoencoder (SAE). Je kunt dit zien als röntgenvisie of een hoogtechnologische zaklamp. Het schijnt een lichtstraal in het brein van de AI en onthult precies welke "concept-lampjes" aan gaan wanneer de AI een vraag leest.

In plaats van alleen te zeggen: "De AI heeft de vraag goed beantwoord," zegt deze tool: "De AI heeft de vraag goed beantwoord, en we weten dat de AI dacht aan 'wiskundige logica' en 'beleefde toon' terwijl hij dat deed."

Hoe de Tool Werkt (De Twee Soorten Kloven)

Met behulp van deze röntgenvisie hebben de onderzoekers naar 5 populaire AI-modellen gekeken en naar meer dan een dozijn verschillende tests. Ze vonden twee hoofdtypen "kloven":

1. Benchmark Gaps (De Test Mist Vragen)

Stel je een rijexamen voor dat alleen vraagt om op een zonnige dag op een rechte snelweg te rijden. Je slaagt met vlag en wimpel. Maar de test heeft nooit gevraagd om in de regen te rijden of door een drukke stad te navigeren.

  • De Bevinding: De onderzoekers ontdekten dat veel populaire AI-tests zoals die rijtest op een zonnige dag zijn. Ze zijn sterk gericht op zaken als "het opvolgen van instructies" of "praten over sport".
  • Het Ontbrekende Deel: De tests negeren vaak belangrijke concepten zoals "hoe je beleefd nee zegt" of "hoe je toegeeft dat je iets niet weet". Omdat de test deze vragen nooit stelt, krijgt de AI nooit de kans om te laten zien dat hij dit kan (of om het te leren).

2. Model Gaps (De AI is Slecht in Specifieke Dingen)

Stel je nu voor dat de AI de test maakt. De röntgenvisie laat ons precies zien waar het moeizaam gaat.

  • De Bevinding: De AI-modellen waren erg goed in "STEM"-taken (zoals coderen of wiskunde) en in "sycophancy" (instemming met de gebruiker en overdreven behulpzaam zijn).
  • De Zwakte: De modellen waren verrassend slecht in:
    • Tijd: Het begrijpen van datums, kooktijden of historische periodes.
    • Grenzen: Het beleefd afwijzen van ongepaste verzoeken of weten wanneer ze moeten stoppen.
    • Logica: Dingen zoals controleren of een woord een palindroom is (hetzelfde vooruit en achteruit lezen) of eenvoudige optelsommen maken.

Waarom Dit Belangrijk Is

De auteurs hebben aangetoond dat hun methode automatisch en schaalbaar is. Ze hoefden niet handmatig duizenden vragen te lezen om deze gaten te vinden. De computer deed het door te kijken naar de "lampjes" in het brein van de AI.

Ze hebben ook bewezen dat zelfs als je een iets andere "zaklamp" gebruikt (een andere SAE getraind op een ander model), je nog steeds dezelfde algemene patronen ziet. Dit betekent dat de tool betrouwbaar is.

De Kernboodschap

Het paper introduceert een manier om te stoppen met het kijken naar het "gemiddelde cijfer" van een AI en te beginnen met het kijken naar een "rapportcijfer" voor elke individuele vaardigheid.

  • Voor Testmakers: Het laat hen zien welke onderwerpen ze vergeten te testen (zoals "beleefde weigering"), zodat ze betere vragen kunnen schrijven.
  • Voor AI-makers: Het laat hen precies zien waar hun AI zwak is (zoals "tijdsbeheer" of "nee zeggen"), zodat ze deze specifieke problemen kunnen oplossen in plaats van alleen maar de algemene score te proberen te verhogen.

De auteurs hebben zelfs een gratis, interactieve website uitgebracht waar iedereen deze tool kan gebruiken om deze gaten zelf te verkennen, waardoor de "black box" van AI verandert in iets dat we daadwerkelijk kunnen zien en begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →