Even GPT-5.2 Can't Count to Five: The Case for Zero-Error Horizons in Trustworthy LLMs
Dieses Paper führt die Zero-Error Horizon (ZEH)-Metrik ein, um den maximalen fehlerfreien Denkbereich von großen Sprachmodellen zu bewerten, wobei aufgezeigt wird, dass selbst hochmoderne Systeme wie GPT-5.2 bei grundlegenden Aufgaben versagen, während gleichzeitig der Nutzen von ZEH bei der Analyse algorithmischer Emergenz sowie die Vorschläge für effiziente Rechenmethoden zur Skalierung seiner Evaluierung dargelegt werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie stellen einen brillanten, superintelligenten Assistenten ein, der Ihnen helfen soll, ein Kernkraftwerk zu steuern, eine Bank zu leiten oder eine Operation durchzuführen. Dieser Assistent kann komplexen Computercode schreiben, Quantenphysik erklären und eine Konversation über Kunst führen. Aber es gibt einen Haken: Dieser Assistent scheitert manchmal an Dingen, die ein 5-jähriges Kind bewältigen könnte.
Das Paper „Even GPT-5.2 Can't Count to Five“ führt eine neue Methode vor, um diese KI-Assistenten zu testen, namens Zero-Error Horizon (ZEH). Betrachten Sie ZEH nicht als Testergebnis, sondern als eine „Sicherheitszaun“.
Hier ist die Aufschlüsselung der Erkenntnisse des Papers unter Verwendung einfacher Analogien:
1. Das Konzept des „Sicherheitszauns“ (Was ist ZEH?)
Die meisten Menschen testen KI, indem sie ihr eine Mischung aus leichten und schweren Fragen geben und zählen, wie viele sie richtig beantwortet (wie eine Note von 95 %). Die Autoren sagen, dass dies für sicherheitskritische Aufgaben gefährlich ist. Wenn eine KI 99 % der Matheaufgaben richtig löst, aber bei einer spezifischen Zahl versagt, könnte dieser eine Fehler eine Katastrophe verursachen.
ZEH ist der „Zaun“ um die perfekte Zone der KI.
- Innerhalb des Zauns: Die KI ist garantiert zu 100 % korrekt.
- Außerhalb des Zauns: Die KI könnte einen Fehler machen.
- Die Höhe des Zauns: Wenn eine KI einen ZEH von 10 für Multiplikation hat, bedeutet das, dass sie jede Zahl bis 10 perfekt multiplizieren kann. Aber in dem Moment, in dem man sie bittet, 11 zu multiplizieren, könnte sie scheitern.
2. Die schockierende Entdeckung (Die „törichten“ Fehler)
Die Autoren testeten ein sehr fortgeschrittenes Modell (GPT-5.2) und fanden heraus, dass sein „Zaun“ für einfache Aufgaben überraschend niedrig war.
- Der Paritäts-Test: Kann die KI zählen, ob eine Folge von Zahlen wie
11000eine ungerade oder gerade Anzahl von Einsen hat? Die KI scheiterte bei dieser 5-stelligen Folge. Ihr Zaun lag bei 4. - Der Klammer-Test: Kann die KI erkennen, ob
((((())))))ausgewogene Klammern hat? Die KI sagte „Ja“, obwohl es eigentlich „Nein“ war. - Der Mathe-Test: Die KI konnte komplexe Physiksimulationen schreiben, aber die einfache Matheaufgabe
127 × 82falsch berechnet.
Die Analogie: Stellen Sie sich einen Meisterkoch vor, der ein 10-Gänge-Gourmetmenü kreieren kann, aber versehentlich ein einzelnes Salzkorn auf den Boden fallen lässt, während er ein Sandwich macht. In einer normalen Küche würde man das Salzkorn ignorieren. In einem Kernreaktor oder einer Bank könnte dieses einzelne Salzkorn (oder eine falsche Ziffer) katastrophal sein.
3. Warum ZEH besser ist als ein „Zeugnis“
Das Paper argumentt, dass Standard-Genauigkeitswerte wie das „Cherry-Picking eines Menüs“ sind.
- Die Falle: Ein Forscher könnte sagen: „Unsere neue KI ist großartig! Sie hat 99 % der Multiplikationsaufgaben richtig gelöst!“ Aber sie haben vielleicht nur Zahlen bis 20 getestet. Wenn man bis 100 testet, könnte die KI kläglich scheitern.
- Die ZEH-Lösung: ZEH lässt Sie das Menü nicht auswählen. Es zwingt die KI zu beweisen, dass sie alles bis zu einem gewissen Punkt bewältigen kann. Wenn die KI bei der Zahl 13 scheitert, wird der Zaun bei 12 gesetzt. Egal wie hoch die „Durchschnittsnote“ ist, der Zaun sagt Ihnen genau, wo die Gefahrenzone beginnt.
4. Wie KI „lernt“ (Auswendiglernen vs. Verstehen)
Die Autoren untersuchten eine Familie von Modellen (Qwen2.5) unterschiedlicher Größe, um zu sehen, wie sie sich verbessern.
- Kleine Modelle (Die Fotokopierer): Kleine KI-Modelle verlassen sich auf Auswendiglernen. Sie haben die Antwort
2 × 2 = 4in ihren Trainingsdaten „gesehen“. Aber wenn sie2 × 3nicht gesehen haben, könnten sie falsch raten. Ihr „Zaun“ ist wackelig und voller Löcher. - Große Modelle (Die Mathematiker): Wenn die Modelle größer werden, hören sie auf, nur auswendig zu lernen, und beginnen, die Regeln zu lernen (Algorithmen).
- Der Hinweis: Die Autoren fanden heraus, dass größere Modelle „strukturierte“ Fehler machen. Wenn das Ergebnis zum Beispiel 986 ist, könnte ein großes Modell 1006 sagen. Die Differenz beträgt exakt 20. Dies sieht aus wie ein Mensch, der einen „Übertragungsfehler“ bei der schriftlichen Multiplikation macht.
- Das Ergebnis: Dies beweist, dass das große Modell tatsächlich die Mathematik betreibt und nicht nur rät. Weil es Regeln verwendet, wächst sein „Sicherheitszaun“ (ZEH) stetig und vorhersehbar.
5. Die Kosten der Zaun-Prüfung
Die Autoren geben zu, dass das Überprüfen dieses „Zauns“ teuer ist. Um den exakten Punkt zu finden, an dem die KI versagt, muss man jede einzelne Aufgabe testen, beginnend bei 1, 2, 3... bis hin zu dem Punkt, an dem sie scheitert.
- Die Lösung: Sie entwickelten ein „Beschleunigungs-Toolkit“ (unter Verwendung von Baumstrukturen und intelligentem Caching), das diesen Testprozess um bis zu 10-mal schneller macht. Es ist wie ein Roboter, der jede Stufe einer Treppe in Sekunden prüfen kann, anstatt sie einzeln abzulaufen.
Zusammenfassung
Das Paper argumentiert, dass wir für sicherheitskritische Aufgaben (wie Finanzen oder Medizin) nicht nur fragen sollten: „Wie intelligent ist diese KI?“ Wir sollten fragen: „Wo genau liegt die Linie, an der diese KI aufhört, perfekt zu sein?“
Der Zero-Error Horizon ist diese Linie. Er offenbart, dass selbst die klügsten KIs bei überraschend einfachen Aufgaben „blinde Flecken“ haben, und er gibt uns einen konkreten, mathematischen Weg, um genau zu wissen, wie weit wir ihnen vertrauen können, bevor sie anfangen, Fehler zu machen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.