← Neueste Arbeiten
💻 computer science

EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

Der Artikel stellt EvoLM vor, eine selbstüberwachte Nachtrainierungsmethode, die Sprachmodeln ermöglicht, sich iterativ zu verbessern, indem sie zwischen der Generierung instanzspezifischer diskriminativer Bewertungskriterien und der Optimierung der Politikleistung unter Verwendung dieser Kriterien als Belohnungen alternieren, wodurch überlegene Ergebnisse erzielt werden, ohne auf externe menschliche oder modellbasierte Überwachung angewiesen zu sein.

Ursprüngliche Autoren: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

Veröffentlicht 2026-05-06
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Schüler (dem Policy-Modell) beizubringen, perfekte Aufsätze zu schreiben. Auf die alte Weise bräuchten Sie einen strengen Lehrer (einen Menschen oder eine superintelligente KI), der jeden Aufsatz liest, benotet und dem Schüler sagt, was er falsch gemacht hat. Das ist teuer, langsam und durch die Intelligenz dieses Lehrers begrenzt.

EVOLM ist eine neue Methode, die es dem Schüler erlaubt, sein eigener Lehrer zu werden, jedoch mit einem cleveren Trick. Anstatt nur zu raten, wie ein „guter" Aufsatz aussieht, lernt der Schüler für jeden einzelnen Aufsatz, den er schreibt, eine spezifische Checkliste (eine Rubrik) zu erstellen.

So funktioniert der Prozess, aufgeschlüsselt in einfache Schritte:

1. Die zwei Rollen: Der Schreiber und der Checklisten-Ersteller

In diesem System spielt dasselbe KI-Modell gleichzeitig zwei Rollen:

  • Der Schreiber (Policy): Dieser Teil generiert Antworten auf Fragen.
  • Der Checklisten-Ersteller (Rubrik-Generator): Dieser Teil betrachtet die Frage und schreibt eine spezifische Reihe von Regeln (eine Rubrik), wie die Antwort zu bewerten ist.

Stellen Sie sich einen Koch vor, der nicht nur das Mahl zubereitet, sondern auch nach dem Kochen die Rezeptkarte schreibt und genau erklärt, warum das Gericht gut oder schlecht ist.

2. Die „Zeitreise"-Feedback-Schleife

Wie weiß das System, ob die Checkliste gut ist? Es braucht keinen Menschen, der sagt „Gut gemacht!". Stattdessen nutzt es Zeitreisen.

  • Schritt A: Die KI schreibt heute eine Antwort.
  • Schritt B: Sie blickt auf eine Antwort zurück, die sie vor ein paar Tagen geschrieben hat (eine „frühere Version" ihrer selbst).
  • Schritt C: Sie geht davon aus, dass die neue Antwort besser ist, weil die KI gelernt hat.
  • Schritt D: Der Checklisten-Ersteller erstellt eine Rubrik, um beide Antworten zu bewerten.

Das Ziel ist einfach: Die Rubrik muss in der Lage sein, klar den Unterschied zwischen der „neuen, besseren" Antwort und der „alten, schlechteren" Antwort zu erkennen. Ist die Rubrik vage, wird sie den Unterschied nicht erkennen. Ist die Rubrik scharf und spezifisch, wird sie der neuen Antwort eine hohe Punktzahl und der alten eine niedrige Punktzahl geben.

3. Der Ko-Evolutions-Tanz

Hier passiert die Magie. Die beiden Rollen verbessern sich im Wechsel in einer Schleife gegenseitig:

  1. Der Schreiber wird besser: Mit Hilfe der Checklisten lernt der Schreiber, bessere Antworten zu produzieren, um höhere Punktzahlen zu erzielen.
  2. Der Checklisten-Ersteller wird schärfer: Da der Schreiber besser wird, wirken die alten Antworten im Vergleich noch schlechter. Um weiterhin den Unterschied zwischen „gut" und „großartig" zu erkennen, muss der Checklisten-Ersteller spezifischere und detailliertere Regeln schreiben. Er kann nicht einfach sagen „Gute Grammatik"; er muss sagen „Der Satz muss ein Komma nach dem einleitenden Nebensatz verwenden."

Im Laufe der Zeit entwickeln sich die Checklisten von vagen Bezeichnungen wie „Mach es interessant" zu konkreten, überprüfbaren Anweisungen wie „Die Antwort muss die Zahl 144 enthalten, die aus dem Umfang von 48 abgeleitet ist."

4. Der Trick mit dem „kleinen Richter"

Normalerweise benötigen Sie eine riesige, superintelligente KI, um komplexe Aufsätze zu bewerten. Aber EVOLM verwendet einen winzigen, eingefrorenen KI-Modell (einen kleinen Richter), um die eigentliche Bewertung vorzunehmen.

Da der Checklisten-Ersteller gelernt hat, so spezifische, konkrete Regeln zu schreiben (z. B. „Prüfen, ob das Wort 'Innovation' zweimal vorkommt"), kann selbst eine kleine, einfache KI die Anweisungen perfekt befolgen. Es ist, als würde man einem kleinen Kind eine sehr spezifische Schatzkarte geben: Es muss kein Detektiv sein; es muss nur der Karte folgen.

Warum ist das eine große Sache?

  • Keine externen Lehrer erforderlich: Das System braucht keine Menschen, die Tausende von Aufsätzen bewerten oder teure KI-APIs bezahlen. Es erzeugt sein eigenes Trainingssignal aus seiner eigenen vergangenen Leistung.
  • Es durchbricht die Decke: Wenn Sie sich auf einen menschlichen Lehrer verlassen, kann die KI niemals besser werden als dieser Mensch. Wenn Sie sich auf eine spezifische KI als Lehrer verlassen, bleibt die KI auf dem Niveau dieses Lehrers stecken. Mit EVOLM entwickelt sich die „Lehrerin" der KI (die Rubrik) mit der KI weiter, sodass die Decke weiter steigt.
  • Es funktioniert: Die Studie zeigt, dass diese selbstunterrichtete KI (unter Verwendung eines kleinen Modells mit 8 Milliarden Parametern) Systeme tatsächlich übertroffen hat, die GPT-4 (ein viel größeres, teureres Modell) zur Generierung der Regeln verwendet haben.

Kurz gesagt: EVOLM ist eine sich selbst verbessernde Schleife, in der eine KI lernt, ihre eigenen detaillierten Bewertungsrichtlinien zu schreiben. Indem sie sich ständig mit ihrer vergangenen selbst vergleicht, zwingt sie sich dazu, zunehmend präzisere Regeln zu schreiben, was ihr wiederum hilft, bessere Antworten zu schreiben – alles ohne dass ein Mensch eingreifen muss.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →