← Neueste Arbeiten
🤖 machine learning

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

Dieses Paper stellt RECAP vor, eine End-to-End-Replay-Strategie mit dynamischer Zielgewichtung, die effektiv das Vergessen allgemeiner Fähigkeiten in großen Reasoning-Modellen, die mittels Reinforcement Learning trainiert wurden, abmildert und gleichzeitig die Reasoning-Leistung durch flexible Reward-Abwägungen steigert.

Ursprüngliche Autoren: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

Veröffentlicht 2026-06-19
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

Originalarbeit unter CC0 1.0 der Gemeinfreiheit gewidmet (http://creativecommons.org/publicdomain/zero/1.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Die „Spezialisten“-Falle

Stellen Sie sich vor, Sie stellen einen brillanten Alleskönner-Koch ein, der alles zubereiten kann: Er kann einen perfekten Kuchen backen, Gemüse mit Präzision schneiden und sogar einen tropfenden Wasserhahn in der Küche reparieren (eine Metapher für die Fähigkeit eines Modells, Mathematik, Vision und Allgemeinwissen zu bewältigen).

Dann entscheiden Sie sich, diesen Koch speziell darauf zu trainieren, einen hochkarätigen Kuchen-Ess-Wettbewerb zu gewinnen. Sie sperren ihn in einen Raum mit nur Kuchenrezepten und strengen Regeln dazu, wie man die Gabel halten muss.

Was passiert?
Nach einigen Wochen intensiven Trainings wird der Koch ein Weltklasse-Kuchenesser. Er befolgt die Regeln für die Gabel perfekt. Aber weil er seine gesamte Zeit mit dem Üben von Kuchen verbracht hat, beginnt er zu vergessen, wie man Gemüse schneidet oder den Wasserhahn repariert. Wenn Sie ihn bitten, eine Zwiebel zu schneiden, starrt er sie vielleicht nur leer an oder versucht, sie im Ganzen zu essen.

In der Welt der KI passiert genau das. Forscher nutzen eine Technik namens RLVR (Reinforcement Learning with Verifiable Rewards), um Large Language Models (LLMs) beizubringen, wie man „schlussfolgert“ (komplexe mathematische Probleme löst oder komplexer Logik folgt). Während die Modelle im Schlussfolgern (Reasoning) fantastisch werden, beginnen sie, ihre anderen Fähigkeiten zu vergessen, wie zum Beispiel das Erkennen von Objekten in einem Bild, das Lesen von Text in einem Bild oder das Sicher und Ehrlich bleiben.

Die Lösung der Arbeit: „RECAP“

Die Autoren schlagen eine neue Methode namens RECAP (Replay-Enhanced CApability Preservation) vor. Denken Sie bei RECAP an einen intelligenten Trainingsplan für diesen Koch.

Anstatt dem Koch nicht nur den ganzen Tag Kuchenrezepte zu füttern, tut RECAP zwei Dinge:

  1. Das Grundlegende wiederholen: Es bringt gelegentlich die alten Rezepte für das „Gemüseschneiden“ und das „Wasserhah-Reparieren“ zurück, damit der Koch sie nicht vergisst.
  2. Dynamische Gewichtung: Es fungiert wie ein intelligenter Coach, der den Fortschritt des Kochs in Echtzeit beobachtet.

Wie der „intelligente Coach“ funktioniert (Die Analogie)

Stellen Sie sich vor, der Koch übt drei Dinge gleichzeitig:

  • Die Gabel-Regel (Format): Wie man die Gabel hält.
  • Der Geschmack (Genauigkeit): Schmeckt der Kuchen gut?
  • Das Aufräumen (Allgemeine Fähigkeiten): Die Küche sauber halten.

In einer normalen Trainingseinheit würde der Coach vielleicht sagen: „Übe alle drei gleichmäßig!“ Aber das ist ineffizient.

  • Die Gabel-Regel ist einfach. Der Koch beherrscht sie in 5 Minuten. Wenn der Coach ihn zwingt, eine Stunde lang weiter zu üben, ist das Verschwendung von Zeit.
  • Der Geschmack ist schwer. Der Koch kämpft damit.
  • Das Aufräumen wird unordentlich, weil der Koch abgelenkt ist.

RECAPs Coach analysiert die Daten und sagt:

„Hey, der Koch hat die Gabel-Regel bereits gemeistert. Hören wir auf, uns darauf zu konzentrieren (senke das Gewicht). Lassen Sie uns mehr Zeit für den Geschmack und das Aufräumen aufwenden, da dies die Bereiche sind, in denen er noch Schwierigkeiten hat oder die instabil werden.“

RECAP erkennt automatisch, welche Fähigkeiten „gesättigt“ (bereits gelernt) und welche „volatil“ (schwierig oder in schneller Veränderung) sind. Es verlagert den Trainingsfokus auf die schwierigen Fähigkeiten, damit das Modell nicht das Einfache überlernt, während es das Schwierige vergisst.

Was sie herausgefunden haben (Die Ergebnisse)

Die Forscher testeten dies an leistungsstarken KI-Modellen (speziell der Qwen2.5-VL-Familie). Hier ist, was sie entdeckten:

  1. Das „Vergessen“ ist real: Als sie die Modelle nur auf Reasoning-Aufgaben trainierten, wurden die Modelle besser in Mathematik, verschlechterten sich aber signifikant in Dingen wie dem Lesen von Text in Bildern oder dem Erkennen von Objekten.
  2. RECAP rettet die Situation: Durch die Verwendung ihres dynamischen Zeitplans behielten die Modelle ihre Reasoning-Fähigkeiten hoch (manchmal verbesserten sie sich sogar) und verloren nicht ihre allgemeinen Fähigkeiten. Tatsächlich schnitten sie bei allgemeinen Aufgaben oft besser ab als Modelle, die mit Standardmethoden trainiert wurden.
  3. Effizienz: Die mit RECAP trainierten Modelle wurden nicht nur intelligenter, sondern auch effizienter. Sie begannen, kürzere, direktere Antworten zu geben, anstatt um den heißen Brei herumzureden, weil das System aufhörte, sie auf Aufgaben, die kein langes „Nachdenken“ (Schreiben langer Textketten) erforderten, zu zwingen.

Das Fazit

Die Arbeit argumenttiert, dass wir KI-Modelle nicht einfach nur dazu zwingen sollten, „Reasoning-Maschinen“ zu werden, indem wir alles andere ignorieren. Wenn wir das tun, werden sie zu Ein-Trick-Ponys, die vergessen, wie man in der realen Welt hilfreich ist.

RECAP ist ein einfaches, modular anwendbares Werkzeug, das wie eine ausgewogene Ernährung für das KI-Training wirkt. Es stellt sicher, dass, während das Modell lernt, komplemxe Rätsel zu lösen, es nicht vergisst, die Welt um sich herum zu sehen, zu lesen und zu verstehen. Es geht darum, die KI vielseitig zu halten, während sie gleichzeitig ein Genie in ihrem Job bleibt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →