← Neueste Arbeiten
🤖 AI

Finding the Evidence: Discovering Decision-Supporting Tokens for On-Policy Reasoning Distillation

Das Papier schlägt DEAR vor, ein neuartiges On-Policy-Distillations-Framework, das den Reasoning-Transfer verbessert, indem es nicht nur Entscheidungspunkte über die Unsicherheit des Studenten identifiziert, sondern auch kritische unterstützende Evidenz-Token durch Ähnlichkeit und Divergenz der Hidden States, wodurch es Standardmethoden bei Mathe- und Code-Benchmarks übertrifft.

Ursprüngliche Autoren: Jinwei Xiao, Zhuowen Han, Yueqing Sun, Zhengxi Lu, Yuxin Liu, Zhiyuan Yao, Wentao Chen, Qi Gu, Xunliang Cai

Veröffentlicht 2026-06-23
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jinwei Xiao, Zhuowen Han, Yueqing Sun, Zhengxi Lu, Yuxin Liu, Zhiyuan Yao, Wentao Chen, Qi Gu, Xunliang Cai

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem jungen Lehrling (dem Schüler) beizubringen, komplexe Rätsel zu lösen, indem er einem Meisterhandwerker (dem Lehrer) zusieht.

In der Welt der KI wird dieser Prozess als On-Policy Distillation bezeichnet. Der Lehrling versucht, ein Problem zu lösen, während der Lehrer zuschaut und jedes einzelne Wort korrigiert, das der Lehrling schreibt.

Das Paper argumentiert, dass die derzeitige Art und Weise, dies zu tun, fehlerhaft ist. Es ist, als würde der Lehrer jedes einzelne Wort korrigieren, das der Lehrling schreibt, von „Lass uns anfangen“ bis hin zu „Die Antwort ist 42“. Dies überfordert den Lehrling mit zu viel Rauschen.

Die Autoren haben entdeckt, dass nicht alle Wörter gleichwertig sind. Sie fanden heraus, dass Denkketten tatsächlich zwei sehr unterschiedliche Arten von „Wissen“ enthalten, und dass man sie auf zwei verschiedene Arten lehren muss.

Die zwei Arten von Wissen: Die „Wendung“ und der „Beweis“

Um die Entdeckung des Papers zu verstehen, stellen Sie sich vor, der Lehrling navigiert durch ein Labyrinth.

  1. Entscheidungs-Token (Die Wendungen): Dies sind die Momente, in denen der Lehrling einen Pfad wählen muss. „Soll ich links oder rechts gehen?“ „Soll ich addieren oder subtrahieren?“

    • Wie wir sie finden: Wenn der Lehrling unsicher ist, zögert er. In der KI-Sprache bedeutet dies hohe Unsicherheit (oder hohe „Entropie“). Aktuelle Methoden sind gut darin, diese Momente zu erkennen, weil der Lehrling sichtlich verwirrt ist.
    • Analogie: Dies sind die Kreuzungen. Der Lehrer weiß, wann er stoppen und sagen muss: „Hey, schau hier her! Hier musst du intensiv nachdenken.“
  2. Evidenz-Token (Der Beweis): Dies sind die Schritte, die der Lehrling nach einer Entscheidung unternimmt. „Ich habe mich für links entschieden, also werde ich 10 Schritte gehen.“

    • Das Problem: Manchmal ist der Lehrling selbstbewusst, aber falsch. Er sagt vielleicht selbstbewusst: „Ich werde 10 Schritte gehen“, aber der Lehrer weiß, dass der Pfad eigentlich 12 Schritte lang ist. Weil der Lehrling so selbstbewusst ist, zögert er nicht. Sein „Unsicherheitsmesser“ bleibt niedrig.
    • Der blinde Fleck: Aktuelle Lehrmethoden suchen nur nach den „unsicheren“ Momenten (den Wendungen). Sie übersehen diese „selbstbewusst falschen“ Schritte komplett. Der Lehrling lernt zwar, wo er abbiegen muss, aber nicht, wie er den Pfad korrekt beschreitet. Er lernt das Skelett der Argumentation, aber nicht das Fleisch und Blut.

Die Lösung: DEAR (Decision-Evidence Aware Reasoning)

Die Autoren schlagen eine neue Methode namens DEAR vor. Anstatt nur nach Verwirrung zu suchen, nutzt DEAR einen zweistufigen Detektivprozess, um die verborgenen „selbstbewusst falschen“ Schritte zu finden.

Schritt 1: Finde die Wendungen (Entscheidungen)
Genau wie zuvor sucht das System nach den Momenten, in denen der Lehrling unsicher ist. Dies sind die „Entscheidungs-Token“.

Schritt 2: Finde den Beweis (Evidenz)
Dies ist der clevere Teil. Sob es das System eine „Wendung“ findet, fragt es: „Welche anderen Schritte in diesem Satz sind mit dieser Wendung verbunden?“

  • Die Analogie: Stellen Sie sich vor, der Lehrling schreibt eine Geschichte. Die „Wendung“ ist der Plot-Twist. Die „Evidenz“ ist der Absatz, der erklärt, warum dieser Twist passiert ist. Selbst wenn der Lehrling die Erklärung selbstbewusst schreibt (und vielleicht ein Detail falsch wiedergibt), ist dieser Absatz dennoch tief mit dem Plot-Twist verbunden.
  • Wie DEAR es macht: Es untersucht die „verborgenen Gedanken“ (interne Daten) der KI. Es prüft, ob die „selbstbewussten“ Wörter eine ähnliche „Vibe“ oder einen ähnlichen Kontext mit den „unsicheren“ Entscheidungswörtern teilen. Wenn sie dies tun, markiert DEAR sie als wichtige Evidenz-Token, die korrigiert werden müssen, selbst wenn der Lehrling keine Verwirrung gezeigt hat.

Es fügt zudem eine „Lückenprüfung“ hinzu: Wenn Lehrer und Schüler sich bei einem Schritt stark uneinig sind, erhält dieser Schritt besondere Aufmerksamkeit.

Warum das wichtig ist (Die Ergebnisse)

Das Paper hat dies an Mathematikproblemen und Programmieraufgaben getestet.

  • Das Ergebnis: Indem man dem Lehrling nicht nur beibrachte, wo er abbiegt, sondern auch, wie er den Pfad beschreitet (die Evidenz), wurde der Schüler viel besser.
  • Die Zahlen:
    • In Mathematik-Wettbewerben verbesserte die neue Methode die Punktzahlen um bis zu 2,5 Prozentpunkte.
    • In der Programmierung verbesserte sie die Punktzahlen um bis zu 5,7 Prozentpunkte.
    • Entscheidend ist, dass sie am meisten bei den schwierigsten Problemen half, bei denen lange Denkketten erforderlich sind.

Zusammenfassung in Kürze

Denken Sie an die alte Methode als einen Lehrer, der den Schüler nur dann stoppt, wenn er an einer Kreuzung verloren wirkt.
DEAR ist ein Lehrer, der den Schüler an der Kreuzung stoppt UND auch die Schritte kontrolliert, die er unmittelbar danach unternommen hat, um ihn zu korrigieren, selbst wenn der Schüler selbstbewusst in die falsche Richtung gelaufen ist.

Durch das Finden dieser „verborgenen“ Fehler lernt der Schüler die vollständige Logik der Lösung, nicht nur die übergeordneten Entscheidungen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →