← Neueste Arbeiten
🤖 machine learning

Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing

Das Papier schlägt Near-Policy Distillation (NPD) vor, ein asynchrones Framework, das die on-policy-Wissensdistillation beschleunigt, indem es die Generierung vom Training entkoppelt und Δ\Delta-IFD-Filterung zur Minderung von Policy-Verzögerungen einsetzt, wodurch eine 8,1-fache Geschwindigkeitssteigerung und eine überlegene Leistung im Vergleich zu standardmäßiger SFT und größeren Modellen erreicht wird.

Ursprüngliche Autoren: Miao Rang, Zhenni Bi, Hang Zhou, Kai Han, Xuechun Wang, An Xiao, Xinghao Chen, Yunhe Wang, Hanting Chen

Veröffentlicht 2026-05-08
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Miao Rang, Zhenni Bi, Hang Zhou, Kai Han, Xuechun Wang, An Xiao, Xinghao Chen, Yunhe Wang, Hanting Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Die „Lehrer-Schüler"-Diskrepanz

Stellen Sie sich vor, Sie unterrichten einen Schüler (ein kleines KI-Modell) darin, Aufsätze zu schreiben, indem Sie ihn einen Meisterlehrer (ein riesiges KI-Modell) kopieren lassen.

  • Der alte Weg (Standard-Distillation): Sie geben dem Schüler eine Liste von Aufsätzen, die der Lehrer bereits geschrieben hat. Der Schüler lernt sie auswendig. Doch wenn der Schüler eine Prüfung schreibt, muss er aus dem Nichts heraus schreiben. Da er nur die perfekten Antworten des Lehrers auswendig gelernt hat, gerät er in Verwirrung, wenn er seine eigenen Sätze generieren muss. Es ist wie ein Schüler, der ein Skript aufsagen kann, aber einfriert, wenn man ihn auffordert, zu improvisieren.
  • Der „On-Policy"-Weg (Die teure Lösung): Um dies zu beheben, lassen Sie den Schüler zuerst eigene Aufsätze schreiben und zeigen diese dann dem Lehrer zur Korrektur. Das funktioniert hervorragend, weil der Schüler aus seinen eigenen Fehlern lernt. Allerdings ist es unglaublich langsam. Jedes Mal, wenn der Schüler einen Satz schreibt, muss der Lehrer anhalten, ihn lesen, bewerten und Feedback geben, bevor der Schüler den nächsten Satz schreiben darf. Es ist wie ein Tutor, der dem Schüler verweigert, ein Wort zu schreiben, bis er den vorherigen Satz nicht bewertet hat.

Die Lösung: Near-Policy Distillation (NPD)

Die Autoren schlagen eine neue Methode namens Near-Policy Distillation vor. Stellen Sie sich dies als eine Hochgeschwindigkeits-Fertigungsstraße vor, die die Vorteile der „On-Policy"-Methode beibehält, ohne die Langsamkeit.

So funktioniert es, aufgeteilt in drei Teile:

1. Die asynchrone Fertigungsstraße (Entkopplung)

Anstatt dass Lehrer und Schüler in einem langsamen, eins-zu-eins-Gespräch arbeiten, trennt NPD sie voneinander.

  • Die Aufgabe des Schülers: Das Schülermodell läuft schnell auf einem Computer und generiert Tausende von Aufsätzen (Antworten) gleichzeitig, wie eine Fabrik, die Produkte herstellt. Es wartet nicht auf den Lehrer.
  • Die Aufgabe des Lehrers: Sobald der Schüler einen großen Stapel Aufsätze hat, betrachtet das Lehrermodell sie alle auf einmal. Da der Lehrer nicht darauf wartet, dass der Schüler tippt, kann er sie in „Paketen" verarbeiten (wie ein ganzes Buchkapitel auf einmal zu lesen, statt Seite für Seite).
  • Das Ergebnis: Dies ist 8,1-mal schneller als die alte langsame Methode, weil der Computer nicht untätig auf Feedback wartet.

2. Der „Sicherheitsfilter" (Der ∆-IFD-Mechanismus)

Es gibt einen Haken. Da der Schüler Aufsätze generiert, bevor der Lehrer sie bewertet, könnte der Schüler ein wenig „betrunken" von seinen eigenen Ideen werden. Er könnte beginnen, Unsinn zu schreiben oder Dinge, die völlig falsch sind, weil seine „Richtlinie" (seine Denkweise) von der des Lehrers abgewichen ist.

Um dies zu beheben, führt das Papier einen intelligenten Filter namens ∆-IFD ein.

  • Die Analogie: Stellen Sie sich vor, der Schüler ist ein Anfängerkoch und der Lehrer ein Michelin-Stern-Koch. Der Schüler kocht eine Reihe von Gerichten.
    • Zone 1 (Degeneriert): Der Schüler kocht etwas so Einfaches und Seltsames (wie eine Schüssel mit klarem Wasser), dass selbst der Lehrer denkt, es sei zu einfach, aber der Schüler verwirrt ist. Der Filter wirft dies weg.
    • Zone 2 (Kognitive Entkopplung): Der Schüler kocht ein Gericht, bei dem er sich sehr sicher ist, aber der Michelin-Koch hält es für Müll. Dies ist gefährlich, weil der Schüler stur im Unrecht ist. Der Filter wirft dies weg.
    • Zone 3 (Die proximale Lernzone): Der Schüler kocht etwas, das knapp über seinem Fähigkeitsniveau liegt, aber der Lehrer stimmt zu, dass es gut und hilfreich ist. Dies ist die einzige Zone, aus der der Schüler lernt.

Dieser Filter stellt sicher, dass der Schüler nur von „Goldilocks"-Beispielen lernt – nicht zu einfach, nicht zu schwer und nicht gefährlich falsch. Dies hält das Training stabil, obwohl Schüler und Lehrer nicht in Echtzeit miteinander sprechen.

3. Das „sparse Update" (Das gelegentliche Zurücksetzen)

Normalerweise könnten bei diesen schnellen Fertigungsstraßen die Ideen des Schülers im Laufe der Zeit zu weit vom Stil des Lehrers abweichen.

  • Die Lösung: Anstatt die gesamte Fabrik anzuhalten, um jede einzelne Sekunde zu synchronisieren (was langsam ist), stoppt NPD die Linie nur gelegentlich, um das Gehirn des Schülers auf den aktuellen Stil des Lehrers zurückzusetzen.
  • Das Ergebnis: Das Papier stellte fest, dass ein solches „Zurücksetzen" nur ein- oder zweimal während des gesamten Trainingsprozesses ausreicht, um alles auf Kurs zu halten, was enorme Mengen an Zeit spart.

Das große Finale: Ein Super-Schüler

Das Papier zeigt, dass diese Methode nicht nur den Schüler schneller trainiert, sondern ihn auch klüger macht.

  • Das Ergebnis: Sie nahmen ein kleines 1-Milliarden-Parameter-Modell (eine „winzige" KI) und trainierten es mit dieser Methode.
  • Der Vergleich: Dieses winzige Modell erzielte nach dem Training mit NPD und etwas zusätzlichem Reinforcement Learning 68,73 % in einem schwierigen Reasoning-Test.
  • Der Schock: Es schlug ein viel größeres, berühmtes Modell (Qwen3-1.7B) mit 1,7 Milliarden Parametern, das 63,69 % erreichte.

Zusammenfassung

Near-Policy Distillation ist wie die Einrichtung einer Hochgeschwindigkeits-Fabrik, in der ein Schüler aus dem Feedback eines Lehrers lernt, ohne in einer Schlange warten zu müssen. Es verwendet einen intelligenten Filter, um schlechte Beispiele zu verwerfen, und gelegentliche Zurücksetzungen, um den Schüler auf dem richtigen Weg zu halten. Das Ergebnis ist eine winzige KI, die schneller, günstiger lernt und am Ende klüger ist als viel größere Modelle.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →