← Nieuwste papers
🤖 machine learning

Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders

Dit onderzoek toont met behulp van sparse autoencoders aan dat onzekerheid en correctheid in grote taalmodellen worden gedragen door functioneel verschillende kenmerkenpopulaties, waarbij het gerichte onderdrukken van verwarrende kenmerken de nauwkeurigheid aanzienlijk verbetert.

Oorspronkelijke auteurs: Het Patel, Tiejin Chen, Hua Wei, Evangelos E. Papalexakis, Jia Chen

Gepubliceerd 2026-04-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Het Patel, Tiejin Chen, Hua Wei, Evangelos E. Papalexakis, Jia Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een Large Language Model (LLM) zoals een zeer slimme, maar soms verwarde, bibliothecaris is. Deze bibliothecaris kan twee dingen doen die vaak door elkaar worden gehaald:

  1. Zekerheid voelen: "Ik weet het zeker!" (Hij is zelfverzekerd).
  2. Het juiste antwoord geven: "Het antwoord is X." (Het is correct).

De grote vraag in de wereld van kunstmatige intelligentie is: Is het gevoel van zekerheid hetzelfde als het hebben van het juiste antwoord? Of zijn dit twee totaal verschillende dingen die in het brein van de AI op verschillende plekken zitten?

Dit paper (onderzoek) zegt: "Ja, ze zijn verschillend!" En ze hebben een slimme manier gevonden om dit te bewijzen en zelfs te gebruiken.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. De Grote Verwarring: Het "Zekerheids-Compass"

Vaak denken we: "Als de AI twijfelt, is het antwoord waarschijnlijk fout. Als de AI zeker is, is het waarschijnlijk goed."
Maar dat klopt niet altijd. Soms is de AI zeker maar fout (een zelfverzekerde leugenaar) en soms is hij onzeker maar juist (een twijfelende genie).

De onderzoekers wilden weten: Zitten deze twee signalen (zekerheid en juistheid) in dezelfde "neuronen" van de AI, of zijn het aparte systemen?

2. De Oplossing: De "Feature-Scheurmachine" (Sparse Autoencoders)

Om dit te zien, gebruikten de onderzoekers een soort microscoop voor het brein van de AI, genaamd een Sparse Autoencoder.
Stel je het brein van de AI voor als een enorme, rommelige koffer vol met duizenden losse onderdelen (features). Meestal zitten deze onderdelen door elkaar heen. Deze microscoop helpt om de koffer leeg te maken en elk onderdeel op zijn eigen plekje te leggen, zodat je precies kunt zien wat elk onderdeel doet.

Ze deelden alle vragen in vier groepen in:

  • Zeker & Goed (De held)
  • Zeker & Slecht (De zelfverzekerde leugenaar)
  • Onzeker & Goed (Het twijfelende genie)
  • Onzeker & Slecht (De twijfelende leugenaar)

Daarna keken ze welke onderdelen in de koffer "oplichtten" bij welke groep.

3. De Drie Soorten Onderdelen (De Grote Ontdekking)

Ze vonden drie heel verschillende soorten onderdelen in het brein van de AI:

A. De "Zekerheids-Wachters" (Pure Uncertainty Features)

  • Wat doen ze? Deze onderdelen vertellen de AI: "Hé, ik weet het niet zeker!"
  • Vergelijking: Dit zijn als de remmen in een auto.
  • Wat gebeurt er als je ze weghaalt? Als je deze onderdelen uitschakelt (supprimeert), crasht de auto. De AI wordt niet slimmer; hij wordt juist dommer en maakt veel meer fouten. Ze zijn essentieel voor het werk.

B. De "Slechte-Nieuws-Melkers" (Pure Incorrectness Features)

  • Wat doen ze? Deze onderdelen lichtten op als de AI een fout maakte. Ze lijken op een alarm dat "Fout!" schreeuwt.
  • Vergelijking: Dit zijn als een rookmelder die alleen piept als er rook is, maar die je niet kunt gebruiken om de brand te blussen.
  • Wat gebeurt er als je ze weghaalt? Niets! De AI gaat gewoon door alsof er niets aan de hand is. Het uitschakelen van deze onderdelen verandert niets aan de kwaliteit van het antwoord. Ze zijn inert (dode lading). Ze laten zien dat er een fout is, maar ze veroorzaken hem niet en kunnen hem niet stoppen.

C. De "Verwarde Dubbelgangers" (Confounded Features)

  • Wat doen ze? Deze onderdelen lichtten op bij zowel twijfel als fouten. Ze waren een mix van beide signalen.
  • Vergelijking: Dit zijn als een verkeerde GPS die je soms naar de goede plek brengt, maar vaak ook in een sloot rijdt. Ze zijn verward.
  • Wat gebeurt er als je ze weghaalt? Wauw! Als je deze specifieke onderdelen uitschakelt, wordt de AI beter. De antwoorden worden nauwkeuriger en de AI twijfelt minder onnodig. Het is alsof je de ruis uit een radio haalt en plotseling een kristalhelder signaal hoort.

4. Waarom is dit belangrijk? (De Praktijk)

Dit onderzoek heeft twee enorme voordelen:

  1. Betrouwbare AI: We kunnen nu specifiek de "verwarde dubbelgangers" uitschakelen. Hierdoor wordt de AI niet alleen slimmer, maar ook rustiger (minder twijfelachtig).
  2. Slimme "Niet-weten" strategie: Omdat deze verwarde onderdelen zo goed voorspellen of een antwoord goed is, kunnen we ze gebruiken als een waarschuwingslampje.
    • Voorbeeld: Als de AI een vraag krijgt en deze 3 specifieke onderdelen gaan "aan", weten we: "Dit antwoord is waarschijnlijk fout."
    • In plaats van een fout antwoord te geven, kan de AI dan zeggen: "Ik weet het niet."
    • Resultaat: De nauwkeurigheid van de AI springt van 62% naar 81% op de vragen die hij wel durft te beantwoorden!

Samenvatting

De onderzoekers hebben bewezen dat zekerheid en juistheid in het brein van een AI twee verschillende dingen zijn.

  • Sommige onderdelen zorgen voor zekerheid (en zijn nodig).
  • Sommige onderdelen signaleren fouten (maar doen niets).
  • En sommige onderdelen zijn verward en maken de AI juist slechter.

Door die verwarde onderdelen te verwijderen, maken we de AI niet alleen slimmer, maar ook betrouwbaarder. Het is alsof je een auto niet alleen sneller maakt, maar ook de remmen en de stuurinrichting optimaliseert zodat hij niet meer in de greppel rijdt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →