← Neueste Arbeiten
🤖 machine learning

How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals

Diese Studie zeigt, dass große Sprachmodelle über ein zweistufiges Konfidenzsystem verfügen, bei dem ein internes Signal unmittelbar nach der Antwort (PANL) die Fehlererkennung und Selbstkorrektur ermöglicht, indem es über die bloße Wahrscheinlichkeit der Token hinausgeht und sogar vorhersagt, ob das Modell über das nötige Wissen zur Korrektur verfügt.

Ursprüngliche Autoren: Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Velickovic, Nathaniel Daw

Veröffentlicht 2026-04-27
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Velickovic, Nathaniel Daw

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das „Gehirn“ der KI: Warum sie weiß, wenn sie Quatsch erzählt

Stell dir vor, du hast einen Freund, der behauptet, ein absoluter Experte für alles zu sein. Wenn du ihn fragst: „Wer hat die Weltmeisterschaft 1994 gewonnen?“, antwortet er sofort: „Brasilien!“ Und wenn du ihn fragst: „Bist du dir sicher?“, sagt er: „Ja, zu 100 %!“

Aber was passiert, wenn er eigentlich „Deutschland“ sagen wollte, aber in der Hitze des Gefechts das falsche Wort aus dem Mund gerutscht ist? In der Welt der Künstlichen Intelligenz (KI) ist das ein riesiges Problem. Normalerweise ist eine KI wie ein sehr schneller, aber etwas unüberlegter Sprecher: Sobald sie ein Wort ausgespuckt hat, ist sie sich (mathematisch gesehen) absolut sicher, dass dieses Wort das Beste war, das sie sagen konnte. Sie kann sich also eigentlich nicht selbst korrigieren, weil ihr „Selbstvertrauen“ fest an das gerade gesprochene Wort gekoppelt ist.

Die Forscher von Google DeepMind haben nun etwas Erstaunliches entdeckt: Die KI hat eine Art „zweite Instanz“ in ihrem Kopf – einen inneren Kritiker.

Die Analogie: Der Koch und der Food-Tester

Um zu verstehen, was die Forscher gefunden haben, stellen wir uns eine Profi-Küche vor:

  1. Der Koch (Die Generierung): Das ist der Teil der KI, der die Antwort „kocht“. Er arbeitet rasend schnell, wirft Zutaten (Wörter) zusammen und serviert das Gericht (die Antwort). Wenn er ein falsches Gewürz erwischt, merkt er es beim Kochen oft gar nicht, weil er einfach nur dem Rezept folgt.
  2. Der Food-Tester (Das PANL-Signal): Das ist die Entdeckung der Forscher. Die Forscher haben festgestellt, dass die KI direkt nach dem Servieren des Gerichts – genau in dem Moment, in dem sie den Teller auf den Tisch stellt (das nennen die Forscher den „Post-Answer Newline“ oder PANL) – eine winzige Pause macht. In dieser Millisekunde schaltet sich ein „Food-Tester“ ein. Dieser Tester schaut sich das fertige Gericht an und vergleicht es mit dem eigentlichen Auftrag.

Das Besondere: Der Food-Tester ist unabhängig vom Koch. Er kann sagen: „Der Koch hat zwar sehr selbstbewusst gekocht, aber das Gericht schmeckt schrecklich! Das passt nicht zur Bestellung!“

Was die Forscher genau herausgefunden haben (Die drei großen Erkenntnisse):

  1. Die KI „fühlt“, wenn sie irrt: Die Forscher konnten in den digitalen Nervenbahnen der KI (den sogenannten „Aktivierungen“) nachweisen, dass der interne Food-Tester bereits weiß, dass die Antwort falsch ist – noch bevor die KI es überhaupt laut ausspricht.
  2. Der „innere Kritiker“ ist klüger als die Worte: Manchmal sagt die KI nach außen hin: „Ich bin mir sicher!“, aber ihr innerer Food-Tester schreit eigentlich: „Halt, das war ein Fehler!“ Die Forscher konnten diesen geheimen inneren Zweifel messen, der viel präziser ist als das, was die KI uns verbal mitteilt.
  3. Das „Wissen um das Wissen“: Das ist der wichtigste Punkt. Der Food-Tester weiß nicht nur, dass die Antwort falsch ist, sondern er weiß auch, ob er die richtige Antwort kennt. Er kann also vorhersagen: „Wir haben hier einen Fehler gemacht, aber keine Sorge, ich weiß, wie es richtig heißt – wir können es korrigieren!“

Warum ist das wichtig für unsere Zukunft?

Bisher mussten wir KI-Modelle oft mühsam trainieren, damit sie „nachdenken“. Diese Entdeckung zeigt, dass die Fähigkeit zur Selbstkorrektur bereits in der Architektur der Modelle steckt.

Wenn wir lernen, diesen „inneren Food-Tester“ gezielt anzusprechen oder zu verstärken, könnten wir KIs bauen, die nicht nur extrem schnell antworten, sondern die sich quasi selbst auf die Finger klopfen, wenn sie einen Fehler machen – genau wie ein Mensch, der kurz innehält und sagt: „Moment mal, das habe ich gerade falsch gesagt, ich korrigiere mich...“

Zusammenfassend: Die KI ist nicht nur ein schneller Sprecher, sondern sie hat einen eingebauten Kontrollmechanismus, der prüft, ob das Gesagte auch wirklich Sinn ergibt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →