← Neueste Arbeiten
💬 NLP

Emergent retokenization symmetry in large language models: phenomenology and applications

Dieses Paper zeigt auf, dass große Sprachmodelle während des Trainings teilweise eine emergente Symmetrie zu semantisch äquivalenten Token-Segmentierungen entwickeln, was offenbart, dass „Retokenisierung“ – das Ersetzen kanonischer Tokenisierungen durch alternative gültige Segmentierungen – als ein sauberer Probeinstrument für kompositorisches Verständnis und als eine neuartige Sampling-Strategie zur Inferenzzeit dient, die in der Lage ist, Lösungen wiederherzustellen, die von konventionellen Methoden verpasst wurden.

Ursprüngliche Autoren: Kanishk Jain, Matthew Day, Tankut Can

Veröffentlicht 2026-06-16
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Kanishk Jain, Matthew Day, Tankut Can

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie lesen ein Buch, aber anstatt ganze Wörter zu lesen, ist das Buch in einem seltsamen Code gedruckt, bei dem jedes Wort in unterschiedlich große Stücke zerlegt wird. Manchmal ist „wahrscheinlich“ ein einzelnes Stück. Ein anderes Mal besteht es aus zwei Teilen: „wah“ und „rscheinlich“.

In der Welt der Large Language Models (LLMs) ist das genau so, wie sie lesen. Sie sehen nicht Buchstaben; sie sehen „Token“ (Textstücke). Normalerweise hat der Computer eine strikte Regel (einen Tokenizer), die besagt: „Zerlege 'wahrscheinlich' immer in 'wah' und 'rscheinlich'.“ Das ist der kanonische Weg.

Diese Arbeit stellt eine faszinierende Frage: Was wäre, wenn wir die Regeln brechen würden? Was wäre, wenn wir dem Modell denselben Satz füttern würden, ihn aber anders zerstückeln (z. B. „wa“ + „hr“ + „scheinlich“)? Würde das Modell verwirrt werden, oder würde es die Bedeutung immer noch verstehen?

Die Autoren nennen diesen Prozess Retokenisierung. Hier ist das, was sie herausgefunden haben, einfach erklärt:

1. Die „Geheimsprache“ des Modells

Die Forscher entdeckten, dass das Modell, obwohl es darauf trainiert ist, Wörter immer auf die „standardmäßige“ Weise zu lesen, die „nicht-standardmäßigen“ Wege im Geheimen auch versteht.

  • Die Analogie: Stellen Sie sich einen Koch vor, der darauf trainiert ist, Zwiebeln in perfekte, gleichmäßige Würfel zu schneiden. Wenn Sie ihm einen Haufen Zwiebeln geben, die in ungleichmäßige, seltsame Formen geschnitten sind, kann er vielleicht trotzdem die Suppe kochen. Er versteht, dass „Zwiebel“ „Zwiebel“ ist, ungeachtet der Form.
  • Das Ergebnis: Das Modell ist nicht perfekt blind gegenüber den seltsamen Formen. Es kann immer noch die Mathematik betreiben, den Code schreiben oder die Frage beantworten. Es ist jedoch auch nicht perfekt blind. Die seltsamen Formen führen dazu, dass das interne „Gehirn“ (seine verborgenen Zustände) des Modells etwas anders arbeitet. Es ist, als wäre der Koch leicht gestresst, wenn die Zwiebeln seltsam geschnitten sind, selbst wenn die Suppe am Ende immer noch gut schmeckt.

2. Eine neue Art, „die Würfel zu rollen“

Wenn wir eine KI bitten, ein Problem zu lösen, fragen wir sie normalerweise so oft, bis sie die beste Antwort findet. Dies nennt man Temperature Sampling. Es ist wie das Werfen eines Würfels, um zu sehen, was die KI als Nächstes sagt.

Die Autoren fanden einen neuen Weg, um unterschiedliche Antworten zu erhalten: Retokenization Sampling.

  • Die Analogie: Stellen Sie sich vor, Sie versuchen, ein Labyrinth zu lösen.
    • Standard Sampling: Sie gehen denselben Pfad, aber jedes Mal, wenn Sie an einer Gabelung ankommen, werfen Sie eine Münze, um zu entscheiden, ob Sie links oder rechts gehen.
    • Retokenization Sampling: Sie gehen denselben Pfad, aber Sie ändern die Karte leicht ab. Vielleicht zeichnen Sie die Wände neu oder ändern die Beschriftungen an den Abzweigungen. Obwohl das Ziel dasselbe ist, zwingt die neue Karte Ihr Gehirn dazu, einen anderen Weg zu nehmen, um dorthin zu gelangen.
  • Das Ergebnis: Manchmal hilft diese „neue Karte“ der KI, eine Lösung zu finden, die sie mit der Standardkarte übersehen hätte. Es ist, als würde man eine geheime Tür im Labyrinth finden, die man nur sieht, wenn man den Bauplan aus einem anderen Blickwinkel betrachtet.

3. Wo es funktioniert (und wo nicht)

Die Autoren testeten dies bei drei Arten von Aufgaben:

  • Mathematik (GSM8K): Das Modell kam ganz gut zurecht. Das seltsame Zerstückeln half nicht viel, aber es machte das Modell auch nicht kaputt.
  • Multiple Choice (MMLU): Das Modell war hier sehr empfindlich. Das Ändern der Stücke machte es etwas wahrscheinlicher, die falsche Antwort zu wählen.
  • Programmierung (HumanEval): Hier wurde es spannend. Programmierung hat viele Wege, dasselbe Problem zu lösen. Die Forscher fanden heraus, dass die KI durch das Ändern der Art und Weise, wie der Code zerstückelt wurde, manchmal völlig andere, korrekte Wege fand, um das Programm zu schreiben, die sie sonst nicht gefunden hätte.

4. Der Preis der Kreativität

Es gibt einen Haken.

  • Die Analogie: Stellen Sie sich vor, Sie versuchen, ein Buch schneller zu lesen.
    • Standardweg: Sie lesen die Wörter ganz normal.
    • Retokenization-Weg: Sie müssen jedes Wort erst einmal neu zerstückeln, bevor Sie es lesen können.
  • Das Ergebnis: Da das Modell diese „seltsam zerstückelten“ Wörter verarbeiten muss, benötigt es mehr Rechenleistung (und Zeit), um die Antwort zu erhalten. Es ist weniger effizient als die Standardmethode. Die Arbeit kommt zu dem Schluss, dass diese Methode zwar ein cooles Werkzeug ist, um neue Lösungen zu finden (besonders in der Programmierung), sie aber kein magisches Mittel ist, um die Standardnutzung von KI zu ersetzen, da sie langsamer und teurer ist.

Zusammenfassung

Die Arbeit zeigt, dass KI-Modelle klüger sind, als wir dachten. Sie memorieren nicht nur einen Weg, Wörter zu lesen; sie besitzen ein flexibles Verständnis, das es ihnen ermöglicht, mit verschiedenen „Zerstückelungen“ desselben Textes umzugehen.

Indem wir den Text absichtlich in seltsame Stücke zerlegen, können wir die KI dazu zwingen, auf leicht unterschiedliche Weise zu denken, wodurch sie manchmal korrekte Antworten (besonders in der Programmierung) findet, die sie sonst übersehen hätte. Es ist ein neues Werkzeug, um zu erforschen, wie KI denkt, und es beweist, dass die Art und Weise, wie wir Informationen an einen Computer liefern, genauso wichtig ist wie die Information selbst.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →