← Neueste Arbeiten
💬 NLP

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

GoLongRL ist ein Open-Source-Framework, das das Reinforcement Learning mit langen Kontexten durch einen kompetenzorientierten Datensatz mit 23.000 diversen RLVR-Stichproben und einen neuartigen TMN-Reweight-Algorithmus für heterogene Multitask-Optimierung verbessert und dabei eine Leistung erzielt, die mit führenden Closed-Source-Modellen vergleichbar ist.

Ursprüngliche Autoren: Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

Veröffentlicht 2026-05-20
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem sehr intelligenten, aber leicht ablenkbaren Schüler beizubringen, eine riesige Bibliothek von Büchern zu lesen und zu verstehen, nicht nur eine einzelne Seite. Dies ist die Herausforderung der „Long-Context"-KI. Die Arbeit GoLongRL präsentiert ein neues Rezept zum Trainieren dieser KI-Modelle mit Fokus auf zwei Hauptprobleme: was man ihnen beibringt (die Daten) und wie man ihre Hausaufgaben bewertet (der Algorithmus).

Hier ist die Aufschlüsselung mit einfachen Analogien:

1. Das Problem: Der alte Weg war zu eng

Frühere Methoden, um KI das Lesen langer Bücher beizubringen, waren wie das Trainieren eines Schülers nur auf Rätseln vom Typ „Wo ist die Nadel im Heuhaufen?".

  • Das Problem: Sie erstellten Daten, indem sie die KI dazu brachten, nach spezifischen Fakten in langen Texten zu suchen. Während dies der KI half, Nadeln zu finden, lehrte es sie nicht, den gesamten Heuhaufen zusammenzufassen, die wichtigsten Teile zu priorisieren oder komplexe Geschichten zu verstehen.
  • Das Ergebnis: Die KI wurde gut darin, spezifische Fakten zu finden, war aber schlecht in anderen Fähigkeiten wie dem Zusammenfassen eines Romans oder dem Ordnen eines unübersichtlichen Berichts. Es war wie ein Schüler, der ein bestimmtes Wort im Wörterbuch finden, aber keinen Aufsatz schreiben konnte.

2. Die Lösung: Ein „fähigkeitsorientierter" Lehrplan

Die Autoren von GoLongRL beschlossen, aufhören, nur „Nadelsuche"-Aufgaben zu erstellen, und stattdessen einen umfassenden Lehrplan aufzubauen, der auf neun verschiedenen Fähigkeiten basiert, die ein intelligenter Leser benötigt.

  • Der Datensatz (Die Lehrbücher): Sie bauten einen neuen Datensatz mit 23.000 Übungsaufgaben.
    • Echte Bücher, keine Fälschungen: Anstatt erfundener Geschichten zu verwenden, nutzten sie echte Bücher, wissenschaftliche Arbeiten und juristische Dokumente. Sie forderten die KI auf, Fragen über diese echten Texte zu generieren. Dies stellt sicher, dass die KI lernt, die unordentliche, natürliche Art zu handhaben, wie Menschen schreiben.
    • Die 9 Fähigkeiten: Der Datensatz deckt vielfältige Aufgaben ab, wie zum Beispiel:
      • Präzises Abrufen: Finden eines spezifischen Faktums.
      • Zusammenfassung: Verdichten eines langen Kapitels in ein paar Sätze.
      • Priorisierung: Entscheiden, welches von mehreren Suchergebnissen am nützlichsten ist.
      • Schlussfolgern: Lösen von Matheaufgaben, die in einem Finanzbericht versteckt sind.
    • Die Analogie: Stellen Sie sich vor, statt einem Schüler 10.000 identische Tests „Finde den roten Ball" zu geben, erhalten sie eine Mischung aus 10.000 Tests: Manche bitten sie, einen roten Ball zu finden, andere bitten sie, das Spiel zusammenzufassen, wieder andere bitten sie, die Spieler zu priorisieren, und andere bitten sie, eine Matheaufgabe über den Spielstand zu lösen.

Das Ergebnis: Selbst ohne ausgeklügelte neue mathematische Tricks führte die Verwendung dieses besseren „Lehrplans" dazu, dass die KI besser abschnitt als ein hochrangiger Konkurrent mit geschlossenem Quellcode (QwenLong-L1.5).

3. Der Algorithmus: Das System „Faire Bewertung" (TMN-Reweight)

Sobald Sie einen vielfältigen Lehrplan haben, benötigen Sie eine Möglichkeit, den Schüler fair zu bewerten. Die Standardbewertungsmethode (genannt GRPO) hatte einen Fehler beim Umgang mit verschiedenen Fragetypen.

  • Das Problem: Stellen Sie sich einen Mathe-Test vor, bei dem eine richtige Antwort 100 Punkte bringt, und einen Leseverstehens-Test, bei dem eine richtige Antwort nur 1 Punkt bringt. Wenn Sie diese mischen, dominieren die Mathefragen das Gehirn des Schülers, und er ignoriert das Lesen. Außerdem kann es sein, dass bei einer extrem schwierigen Frage die Standardbewertung verwirrt ist und dem Schüler zu viel Gutschrift für einen glücklichen Treffer gibt oder zu wenig für eine knappe Verfehlung.
  • Die Lösung (TMN-Reweight): Die Autoren entwickelten ein neues Bewertungssystem mit zwei Schritten:
    1. Chancengleichheit herstellen (Task-Level Normalization): Sie passten die Punktzahlen so an, dass eine „perfekte" Punktzahl bei einer Matheaufgabe sich genauso anfühlt wie eine „perfekte" Punktzahl bei einer Priorisierungsaufgabe. Dies verhindert, dass die KI schwierige Aufgaben ignoriert, nur weil die Zahlen kleiner aussehen.
    2. Auf die Anstrengung fokussieren (Difficulty-Adaptive Reweighting):
      • Wenn der Schüler eine einfache Frage richtig beantwortet, sagt der Lehrer: „Gut gemacht, aber das wussten Sie bereits", und gibt eine kleinere Belohnung.
      • Wenn der Schüler eine schwierige Frage richtig beantwortet (was selten ist), sagt der Lehrer: „Wow, das war hart! Tolle Arbeit, das herauszufinden!", und gibt eine riesige Belohnung.
      • Wenn der Schüler eine schwierige Frage falsch beantwortet, wird der Lehrer nicht wütend; er sagt einfach: „Versuchen wir es noch einmal", und reduziert die Strafe, damit der Schüler nicht entmutigt wird.

Die Analogie: Es ist wie ein Trainer, der nicht nur Punkte zählt. Der Trainer passt die Punktzahl basierend darauf an, wie schwer der Spielzug war, und konzentriert übermäßiges Lob auf die Spielzüge, die schwer auszuführen waren. Dies hilft der KI, schneller und gleichmäßiger über alle Fähigkeiten hinweg zu lernen.

4. Die Ergebnisse: Ein vielseitiger Schüler

Als sie diese neue Methode testeten:

  • Besser in allem: Die KI verbesserte sich signifikant bei allen 9 Fähigkeiten, nicht nur bei den „Nadelsuche"-Aufgaben.
  • Keine Kompromisse: Normalerweise wird ein Schüler, den man darin trainiert, in einer Sache großartig zu sein (wie dem Lesen langer Bücher), in anderen Dingen schlechter (wie allgemeine Logik oder Gedächtnis). Diese Methode verbesserte tatsächlich die allgemeinen Schlussfolgerungs- und Gedächtnisfähigkeiten der KI, während sie ihr das Lesen im Langkontext beibrachte.
  • Open Source: Die Autoren veröffentlichten den gesamten „Lehrplan" (Datensatz), den „Unterrichtsplan" (Code) und die „Bewertungsrichtlinie" (Algorithmus) für jedermann zur Nutzung.

Zusammenfassung

GoLongRL ist wie die Aufwertung der Bildung einer KI von einem langweiligen, repetitiven Drill (Nadeln finden) zu einem reichen, vielfältigen Lehrplan (Lesen, Zusammenfassen, Priorisieren und Schlussfolgern), kombiniert mit einem fairen, intelligenten Bewertungssystem, das weiß, wann es den Schüler stärker fordern und wann es ihm eine Pause gönnen soll. Das Ergebnis ist eine KI, die nicht nur ein Faktenfinder ist, sondern ein echter Denker für lange Texte.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →