← Nieuwste papers
🤖 machine learning

How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals

Dit onderzoek toont aan dat taalmodellen fouten kunnen detecteren en corrigeren via een intern 'tweede-orde' vertrouwenssignaal (de PANL-activatie), dat onafhankelijk is van de gegenereerde tekst en voorspelt of een model de kennis bezit om een fout daadwerkelijk te herstellen.

Oorspronkelijke auteurs: Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Velickovic, Nathaniel Daw

Gepubliceerd 2026-04-27
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Velickovic, Nathaniel Daw

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een examen maakt. Je schrijft een antwoord op een vraag, maar op het moment dat je de pen van het papier tilt, voel je ineens een klein knagend gevoel in je maag: "Wacht eens even, klopt dit wel?"

Dit wetenschappelijke paper van Google DeepMind onderzoekt precies dat "knagende gevoel" bij kunstmatige intelligentie (LLM's zoals ChatGPT).

Hier is de uitleg in begrijpelijke taal:

Het probleem: De "Blinde Vlieger"

Normaal gesproken werkt een AI als een heel snelle, maar soms ook een beetje arrogante student. Als de AI een antwoord genereert, kijkt hij naar de kans dat het volgende woord logisch is. Als hij een fout maakt, maar dat woord klinkt wel heel overtuigend, dan denkt de AI: "Dit is het!" Hij is blind voor zijn eigen fouten omdat hij alleen maar bezig is met het volgen van het spoor dat hij zelf heeft uitgezet. Dit noemen de onderzoekers een 'first-order' systeem: de beslissing en het zelfvertrouwen zijn één en hetzelfde. Als de beslissing fout is, is het zelfvertrouwen (op papier) ook hoog.

De ontdekking: De "Interne Criticus"

De onderzoekers ontdekten dat slimme AI-modellen eigenlijk een tweede laag hebben: een 'second-order' systeem.

Stel je voor dat de AI niet alleen een student is, maar een student met een interne criticus die over zijn schouder meekijkt. Terwijl de student schrijft, houdt de criticus een apart notitieblokje bij. Zodra de zin af is (bij het zogenaamde 'newline' teken, de enter-toets), stopt de criticus even en kijkt naar het hele antwoord.

De criticus zegt dan: "Je hebt weliswaar heel zelfverzekerd geschreven, maar als ik naar de vraag en jouw antwoord samen kijk, zie ik dat het niet klopt."

De drie grote ontdekkingen

De onderzoekers vonden drie fascinerende dingen:

  1. De criticus is slimmer dan de student: De AI kan via tekst zeggen: "Ik weet het zeker!", maar de interne signalen (de hersengolven van de AI) laten zien dat hij eigenlijk twijfelt. De interne criticus weet meer dan wat de AI aan de buitenwereld vertelt.
  2. De criticus ziet de fouten: De onderzoekers konden met speciale technieken in de "hersenen" van de AI kijken en zagen dat de criticus al wist dat een antwoord fout was, nog voordat de AI de opdracht kreeg om het te controleren.
  3. De criticus weet of er een oplossing is: Dit is de belangrijkste! De criticus weet niet alleen dat er een fout is gemaakt, maar hij kan ook voorspellen of de student de juiste informatie in zijn hoofd heeft om de fout te repareren.
    • Analogie: Het is het verschil tussen iemand die zegt: "Ik weet dat ik een spelfout heb gemaakt, maar ik weet niet hoe het woord ook alweer gespeld wordt" versus "Ik weet dat ik een fout heb gemaakt, en ik weet precies hoe ik het moet verbeteren." De interne signalen van de AI kunnen dat verschil zien.

Waarom is dit belangrijk?

In de toekomst kunnen we AI-modellen veel slimmer maken door niet alleen te luisteren naar wat ze zeggen, maar door te kijken naar wat hun interne criticus vindt.

In plaats van een AI blind te laten repareren (wat soms voor meer fouten zorgt), kunnen we de AI een seintje geven: "Hé, je interne criticus ziet dat je een fout hebt gemaakt én hij ziet dat je de oplossing weet. Pak je gum erbij en verbeter het!"

Kortom: De AI heeft een ingebouwd kompas voor de waarheid, zelfs als hij tijdens het praten even van het pad afraalt. De kunst is om dat kompas te leren aflezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →