← Neueste Arbeiten
🤖 machine learning

OISD: On-Policy Internal Self-Distillation of Language Models

Das Papier stellt OISD vor, ein neuartiges on-policy-Interne-Selbst-Distillation-Framework, das das Schlussfolgern von Sprachmodellen verbessert, indem es durch Logit- und Aufmerksamkeitsausrichtung während der GRPO-Optimierung die Zwischendarstellungen mit den Vorhersagesignalen der letzten Schicht in Einklang bringt und dabei signifikante Verbesserungen gegenüber bestehenden RL-Baselines bei mathematischen Schlussfolgerungsaufgaben erzielt, ohne dass externe privilegierte Informationen erforderlich sind.

Ursprüngliche Autoren: Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

Veröffentlicht 2026-05-29
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie unterrichten einen Schüler bei der Lösung eines komplexen mathematischen Problems. Auf die traditionelle Weise lassen Sie den Schüler seinen gesamten Denkprozess aufschreiben und geben ihm erst am allerEnde eine Note: „Richtig" oder „Falsch". Wenn er einen Fehler macht, sagen Sie ihm nicht, wo er vom Weg abgekommen ist oder wie er anders hätte denken sollen; Sie sagen ihm einfach, er solle es noch einmal versuchen. So funktioniert das Training der meisten aktuellen KI-Modelle: Es konzentriert sich stark auf die endgültige Antwort und ignoriert den chaotischen Denkprozess, der in der Mitte stattgefunden hat.

Der Artikel „OISD: On-Policy Internal Self-Distillation of Language Models" schlägt einen intelligenteren Weg vor, KI-Modelle zu unterrichten. Hier ist die Aufschlüsselung mit einfachen Analogien:

Die Kernidee: Der „interne Mentor"

Normalerweise holen wir, wenn wir das Denken einer KI verbessern wollen, ein externes „Lehrer"-Modell (eine intelligentere KI) hinzu, um dem Schüler-KI-Modell zu zeigen, wie es denken soll. Doch dieser Artikel sagt: „Warum einen externen Lehrer holen, wenn die KI bereits einen in sich selbst hat?"

Die Autoren erkannten, dass ein großes KI-Modell wie ein mehrstöckiges Gebäude ist.

  • Das Erdgeschoss (frühe Schichten): Hier beginnt die KI zu denken. Es ist etwas verschwommen, sie betrachtet das Problem aus vielen Winkeln.
  • Das Penthouse (letzte Schicht): Hier wird die endgültige Antwort entschieden. Bis die KI die Spitze erreicht hat, hat sie alle Informationen verarbeitet und weiß genau, was die Antwort sein sollte.

OISD (On-Policy Internal Self-Distillation) ist eine Methode, bei der die KI ihre eigene „Penthouse"-Schicht (die letzte Schicht) nutzt, um ihre eigene „Erdgeschoss"-Schicht (eine mittlere Schicht) zu unterrichten, während sie das Problem löst.

Wie es funktioniert: Zwei Arten von Lektionen

Der Artikel führt zwei spezifische Wege ein, wie das „Penthouse" das „Erdgeschoss" unterrichtet:

  1. „Wie man denkt" (Logit-Ausrichtung):

    • Die Analogie: Stellen Sie sich vor, das Erdgeschoss rät: „Vielleicht ist die Antwort 4, vielleicht 5?" Das Penthouse schaut herab und sagt: „Nein, ich bin zu 99 % sicher, dass es 4 ist. Hören Sie auf, 5 zu raten."
    • Was es bewirkt: Es zwingt die frühen Denkphasen, sich mit dem Vertrauen und der Logik der endgültigen Antwort abzugleichen. Es lehrt das Modell, wie man eine korrekte Überzeugung bildet.
  2. „Wohin man schaut" (Aufmerksamkeitsausrichtung):

    • Die Analogie: Stellen Sie sich vor, das Erdgeschoss liest eine lange Geschichte, wird aber von den falschen Worten abgelenkt. Das Penthouse zeigt und sagt: „Schauen Sie nicht auf dieses Wort; schauen Sie auf diese spezifische Zahl hier. Das ist der Hinweis, den Sie brauchen."
    • Was es bewirkt: Es zwingt die frühen Schichten, ihre Aufmerksamkeit auf dieselben wichtigen Teile des Problems zu richten, die die letzte Schicht nutzt, um ihre Entscheidung zu treffen. Es lehrt das Modell, wo es die Beweise findet.

Warum dies besonders ist (Der „On-Policy"-Teil)

In der Vergangenheit mussten Sie, wenn Sie eine KI mit einem „Lehrer" unterrichten wollten, oft ein anderes, vortrainiertes Modell verwenden. Dies erzeugte eine Diskrepanz, da der Schüler von jemandes anderem Stil lernte, nicht von seinem eigenen.

OISD ist „On-Policy", was bedeutet:

  • Die KI generiert ihre eigenen Gedanken (den „Rollout").
  • Die eigene endgültige Antwort der KI fungiert als Lehrer für ihre eigenen frühen Gedanken.
  • Es gibt keinen externen Lehrer, keine speziellen „privilegierten" Hinweise und keine Diskrepanz. Es ist ein sich selbst verbessernder Kreislauf, der vollständig innerhalb eines einzigen Modells stattfindet.

Die Ergebnisse

Die Forscher testeten dies an mathematischen Problemen (wie denen, die in Schulwettbewerben vorkommen). Sie verglichen ihre Methode (OISD) mit anderen starken Methoden.

  • Das Ergebnis: Die OISD-Modelle erzielten deutlich bessere Scores. Sie bekamen nicht nur öfter die richtige Antwort; sie entwickelten einen konsistenteren und logischeren „Denkprozess" vom allerBeginn des Problems bis zum Ende.
  • Die Erkenntnis: Indem man die frühen Teile des Gehirns lehrt, wie die letzten Teile des Gehirns zu denken, wird das gesamte System intelligenter und zuverlässiger.

Zusammenfassung

Stellen Sie sich OISD als ein Modell vor, das nicht bis zum Ende eines Tests wartet, um zu sehen, ob es gescheitert ist. Stattdessen hat es einen eingebauten Coach (seine eigene letzte Schicht), der flüstert: „Sie schauen auf den falschen Hinweis" und „Sie sollten bei diesem Schritt selbstbewusster sein", während es das Problem noch löst. Dies hilft dem Modell, besser zu denken, nicht nur besser zu raten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →