To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning
Diese Arbeit zeigt, dass ein Zusammenbruch der Unembedding-Vektoren für ungesehene Token die Generalisierungsfähigkeit von Transformern bei symbolischem Schlussfolgern einschränkt, und demonstriert, wie eine Kombination aus Architekturänderungen, Datendiversität und dem Einfrieren oder Zurücksetzen der Embeddings dieses Problem löst.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das Problem: Der "Blinde Fleck" der KI
Stell dir vor, du hast einen sehr intelligenten Schüler (den Transformer-Modell), der dir Logikrätsel löst. Du gibst ihm Regeln wie: "Wenn A dann B" und Fakten wie "A ist wahr". Der Schüler soll schlussfolgern: "Also ist B wahr".
Das klappt super, wenn die Buchstaben A und B sind, die er schon tausendmal gesehen hat. Aber was passiert, wenn du plötzlich neue Buchstaben benutzt, die er noch nie gesehen hat, wie U oder X?
Frühere Forschungen zeigten: Der Schüler scheitert. Er verwechselt die neuen Buchstaben oder ignoriert sie einfach. Es ist, als würde er denken: "Ich kenne dieses Wort nicht, also kann es in der Geschichte keine Rolle spielen."
Die Entdeckung: Der "Kleber-Effekt"
Die Autoren dieses Papers haben herausgefunden, warum das passiert. Es liegt an einem physikalischen Phänomen im Inneren des Gehirns der KI, das sie "Collapse" (Zusammenbruch) nennen.
Die Analogie:
Stell dir vor, jedes Wort in der KI hat einen eigenen "Ausweis" (eine mathematische Darstellung, ein Vektor).
- Bekannte Wörter (wie "A" oder "B") haben sehr unterschiedliche, bunte Ausweise. Die KI kann sie leicht unterscheiden.
- Neue, unbekannte Wörter (wie "U" oder "X") bekommen während des Trainings jedoch fast identische Ausweise.
Warum? Weil die KI im Training lernt, diese neuen Wörter zu ignorieren, um Fehler zu vermeiden. Durch diesen Lernprozess "kleben" ihre Ausweise zusammen. Am Ende sehen die Ausweise von "U", "X" und "Z" für die KI fast genau gleich aus.
Wenn die KI dann versucht, zwischen "Wenn U dann X" und "Wenn X dann U" zu unterscheiden, kann sie das nicht mehr, weil ihre Ausweise im Gehirn der KI ununterscheidbar geworden sind. Es ist, als würde man versuchen, zwei fast identische Schwalben in einem Sturm zu verfolgen – man verliert sie sofort aus den Augen.
Die Lösung: Drei Tricks für bessere Schüler
Die Forscher haben nicht nur das Problem gefunden, sondern auch eine Lösung entwickelt, die aus drei Teilen besteht:
Der "Kopier-Knopf" (Copy Attention):
Normalerweise muss die KI ein neues Wort auswendig lernen, um es zu benutzen. Das ist schwer. Die Forscher haben dem Schüler einen neuen Trick beigebracht: Er darf einfach kopieren. Wenn das Wort "U" im Text steht, darf die KI sagen: "Ich nehme einfach das Wort 'U' direkt von dort und schreibe es hier hin." Sie muss es nicht verstehen, sie muss es nur genau abtippen. Das ist wie ein Schüler, der bei einer Matheaufgabe nicht die Formel herleiten muss, sondern einfach die Zahlen aus der Aufgabenstellung in die Antwort überträgt.Vielfalt im Unterricht (Daten-Diversität):
Wenn der Schüler nur mit 10 verschiedenen Buchstaben trainiert, lernt er, sich auf diese zu verlassen. Wenn man ihm aber 10.000 verschiedene Buchstaben gibt, muss er lernen, mit beliebigen neuen Buchstaben umzugehen. Je mehr Vielfalt, desto besser funktioniert der "Kopier-Trick".Der "Gedächtnis-Waschgang" (Active Forgetting):
Da die Ausweise der neuen Wörter so schnell zusammenkleben, haben die Forscher einen radikalen Trick angewandt: Sie haben dem Schüler während des Trainings regelmäßig die Ausweise für unbekannte Wörter neu gemacht (zurückgesetzt).- Vergleich: Stell dir vor, du lernst eine Sprache. Wenn du immer wieder neue Wörter vergisst, weil sie sich alle gleich anfühlen, resettest du dein Gehirn alle paar Minuten und gibst den neuen Wörtern wieder frische, unterschiedliche Ausweise. Das verhindert, dass sie zusammenkleben.
Was bedeutet das für große KI-Modelle?
Die Forscher haben das auch an echten, großen Modellen (der "Gemma 3"-Familie) getestet. Diese Modelle haben 99 Wörter in ihrem Vokabular, die absichtlich nicht benutzt werden (wie Reservetickets für die Zukunft).
Das Ergebnis war erschreckend: Auch bei diesen riesigen Modellen waren die "Ausweise" dieser 99 ungenutzten Wörter untereinander fast identisch (sehr stark korreliert).
- Die Folge: Wenn man ein solches Modell später feinabstimmt (finetuning), um es auf eine neue Aufgabe zu trainieren, und dabei diese reservierten Wörter benutzt, dauert es extrem lange. Das Modell ist wie ein Auto, dessen Räder alle leicht schief sind – es kommt nur sehr langsam voran, bis es sich "eingefahren" hat.
Fazit
Die KI ist nicht dumm, sie ist nur in einer Falle gefangen: Sie lernt so gut, bekannte Muster zu erkennen, dass sie neue, unbekannte Symbole als "alle gleich" abtut.
Die Lösung ist eine Kombination aus:
- Einem Architektur-Update, das das Kopieren erlaubt.
- Viel Vielfalt beim Training.
- Dem regelmäßigen Reset der "Ausweise" für unbekannte Wörter, damit sie nicht zusammenkleben.
Damit können KIs endlich echte Logik mit völlig neuen Symbolen verstehen, statt nur auswendig gelernte Muster zu wiederholen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.