← Neueste Arbeiten
🔬 condensed matter

Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining

Dieses Paper führt das „natürliche Ungrokking“ ein, ein Phänomen, bei dem Sprachmodelle während des Pretrainings spontan spezifische Regeln erlernen und diese dann abrupt wieder vergessen, da die Häufigkeit der regelstützenden Evidenz im Trainingskorpus das Überleben einer Regel bestimmt, ein Prozess, der durch eine asymmetrische Kontrolle charakterisiert ist, bei der das Zerstören einer Regel einfach, aber das Wiederherstellen unmöglich ist.

Ursprüngliche Autoren: Juliana Li, Diya Sreedhar

Veröffentlicht 2026-06-25
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Juliana Li, Diya Sreedhar

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die Kernidee: Eine Regel lernen, dann sie wieder vergessen

Stellen Sie sich vor, Sie bringen einem sehr jungen Kind (dem KI-Modell) das Sprechen bei, indem Sie ihm eine riesige Bibliothek von Büchern vorlesen (die Trainingsdaten).

Mitten in diesem Prozess begreift das Kind plötzlich eine spezifische Grammatikregel: „Wenn ein Satz einen Mädchennamen erwähnt (wie ‚Sue‘), sollte das nächste Pronomen ‚she‘ (sie) sein.“ Das Kind wird darin richtig gut. Wenn man es fragt: „Sue weinte, weil...“, sagt es selbstbewusst „she“.

Doch dann passiert etwas Seltsames. Während das Kind weiter Bücher liest, vergisst es diese Regel plötzlich wieder komplett. Am Ende des Trainings, wenn man ihm dieselbe Frage stellt, rät es „he“ (er) – was das ist, was die allgemeine Menge meistens sagt, auch wenn es für ein Mädchen falsch ist.

Die Forschungsarbeit nennt dies „Natural Ungrokking“. Es ist das Gegenteil von „Grokking“ (bei dem ein Modell plötzlich etwas versteht). Hier lernt das Modell etwas, nutzt es eine Zeit lang und lässt es dann lautlos fallen, obwohl die Bücher, die es liest, die Regel immer noch enthalten.

Das Rätsel: Warum hat es vergessen?

Normalerweise vergisst ein Computermodell etwas, weil sich die Daten geändert haben oder die Daten verschwunden sind. In diesem Experiment blieben die Daten jedoch unverändert. Die Regel war die ganze Zeit über in den Büchern vorhanden.

Die Forscher fanden heraus, dass der entscheidende Faktor die Frequenz (wie oft etwas vorkommt) ist.

  • Die Regel: „Sue“ \rightarrow „she“.
  • Der Konkurrent: Eine allgemeine Gewohnheit in der Sprache, bei der Menschen oft „he“ als Standardvermutung verwenden.

In der speziellen Bibliothek, die das Modell las, trat die „he“-Gewohnheit viel häufiger auf als die „Sue \rightarrow she“-Regel. Obwohl die Regel vorhanden war, war die „he“-Gewohnheit so laut und häufig, dass sie die Regel übertönte. Das Modell hat die Regel nicht „gelöscht“; es hat einfach aufgehört, auf sie zu hören, weil die „he“-Gewohnheit den Wettbewerb gewann.

Das Experiment: Eine Einbahnstraße

Die Forscher wollten sehen, ob sie dies kontrollieren konnten. Sie behandelten die Trainingsdaten wie einen Regler, den man drehen kann.

1. Der „Kill-Schalter“ (Leicht zu zerstören)
Sie nahmen eine Bibliothek, in der die Regel stark war, und begannen, die Daten zu manipulieren. Sie änderten jedes Vorkommen von „Sue... she“ in „Sue... he“.

  • Ergebnis: Je mehr sie die Daten umkehrten, desto schneller vergaß das Modell die Regel. Es war ein glatter, vorhersehbarer Abstieg von „perfekt“ zu „null“.
  • Analogie: Wenn Sie einem Schüler ständig sagen: „Nein, die Antwort ist X“, selbst wenn im Buch „Y“ steht, wird der Schüler irgendwann aufhören, dem Buch zu glauben, und stattdig Ihnen glauben.

2. Der „Rettungs-Schalter“ (Unmöglich wiederherzustellen)
Dann versuchten sie das Gegenteil. Sie nahmen ein Modell, das die Regel bereits vergessen hatte (weil es die „he“-lastige Bibliothek las), und versuchten es zu „retten“. Sie injizierten massive Mengen an „Sue... she“-Beispielen zurück in die Daten – 300-mal mehr, als nötig gewesen wäre, um die Regel am Leben zu erhalten.

  • Ergebnis: Es passierte nichts. Das Modell vergaß die Regel immer noch.
  • Die Analogie: Stellen Sie sich einen Schüler vor, der bereits gelernt hat, dass „2+2=5“ ist, weil sein Lehrer es ihm ein Jahr lang so beigebracht hat. Wenn Sie ihm plötzlich einen Stapel von 1.000 Lehrbüchern überreichen, in denen steht „2+2=4“, wird er vielleicht verwirrt sein, aber er wird die „2+2=5“-Gewohnheit nicht verlernen. Der Schaden ist angerichtet; der „Pfad“ in seinem Gehirn wurde überbaut.

Das „Warum“: Es ist eine Verdrängung, keine Löschung

Die Forscher schauten in das „Gehirn“ des Modells (seine interne Mathematik), um zu sehen, was passierte.

  • Sie fanden heraus, dass das Modell nicht die Fähigkeit verlor, den Satzbau zu verstehen. Es wusste immer noch, wie man die Wörter verarbeitet.
  • Stattdessen verschob sich das interne Vertrauen. Das interne „Votum“ des Modells für „she“ wurde durch ein stärkeres „Votum“ für „he“ überstimmt.
  • Es ist wie in einem Gerichtssaal. Die „she“-Beweise waren noch da, aber die „he“-Beweise wurden so laut, dass der Richter (das Modell) aufhörte, dem „she“-Zeugen zuzuhören.

Das Fazit

Diese Arbeit lehrt uns drei wesentliche Dinge darüber, wie KI lernt:

  1. Zwischentrainings-Fähigkeiten sind zerbrechlich: Nur weil ein Modell mitten im Training eine Regel lernt, bedeutet das nicht, dass es sie auch behält.
  2. Frequenz regiert alles: Wenn eine Regel in den Daten selten ist, wird sie wahrscheinlich von einem häufigeren, konkurrierenden Muster erdrückt, selbst wenn die Regel noch vorhanden ist.
  3. Man kann es leicht kaputt machen, aber nicht leicht reparieren: Sob'_{\text{einmal}} ein Modell eine Regel aufgrund der Datenmischung verlernt hat, hilft es oft nicht, die Regel später einfach wieder hinzuzufügen. Das „Vergessen“ ist für diesen spezifischen Trainingslauf permanent.

Kurz gesagt: KI-Modelle sind wie Schüler, die auf die lauteste Stimme im Raum hören. Wenn die „falsche“ Stimme lauter ist als die „richtige“ Regel, lernt der Schüler das Falsche. Und wenn sie erst einmal das Falsche gelernt haben, hilft es oft nicht, die richtige Regel später noch einmal laut zu rufen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →