← Nieuwste papers
💬 NLP

Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow

Dit artikel introduceert Jet-RL, een verenigd FP8-reinforcement learning-framework dat de trainingsinstabiliteit en nauwkeurigheidsinstorting veroorzaakt door mixed-precision-strategieën oplost door consistente FP8-precisie toe te passen op zowel de rollout als de training, waardoor significante versnellingen worden bereikt terwijl een stabiele convergentie behouden blijft.

Oorspronkelijke auteurs: Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

Gepubliceerd 2026-01-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Langzame Wandeling" in AI-training

Stel je voor dat je een zeer slimme robot (een Large Language Model) traint om complexe wiskundige problemen op te lossen. Om hier echt goed in te worden, moet de robot oefenen met "hardop denken" (het genereren van lange ketens van redeneringen) voordat hij een antwoord geeft.

In de wereld van AI-training wordt deze oefensessie een Rollout genoemd.

  • De Bottleneck: Het paper wijst erop dat deze "hardop denk"-fase ongelooflijk traag is. Het beslaat 70% van de totale tijd die aan het trainen van de robot wordt besteed. Het is alsof een student 7 uur lang studeert voor een toets, maar 5 van die uren alleen maar naar het lege blad staart, terwijl hij probeert de eerste zin te bedenken.
  • Het Doel: We willen deze "denk"-fase versnellen zonder de robot dommer te maken.

De Mislukte Afkorting: "De Fout van de Dubbele Boekhouding"

Om het sneller te maken, probeerden ingenieurs een simpele truc: Quantization (kwantisatie).

  • De Analogie: Stel je voor dat het brein van de robot normaal gesproken werkt met hoog-definitie, 16-bit "HD"-getallen (BF16). Om sneller te gaan, probeerden ze de "denk"-modus van de robot over te schakelen naar een laag-definitie, 8-bit "SD"-modus (FP8) tijdens de oefensessie, terwijl ze de "beoordelings"-sessie in HD hielden.
  • Het Idee: "Laten we de snelle, laag-resolutie modus gebruiken voor de lange denk-delen, maar de hoog-resolutie modus behouden voor de werkelijke leer-updates."
  • De Ramp: Het paper stelt vast dat deze aanpak een ramp is voor lange of moeilijke taken.
    • De Mismatch: Het is alsof je een student vraagt een essay van 10 pagina's in potlood te schrijven (laag-resolutie), maar hem vervolgens beoordeelt alsof hij het in inkt heeft geschreven (hoog-resolutie). De kleine foutjes in de potloodschets stapelen zich op. Tegen de tijd dat het essay lang is (16.000 woorden), lijkt de "potlood"-versie totaal niet meer op de "inkt"-versie.
    • Het Resultaat: De robot raakt in de war. Hij begint te hallucineren, de training crasht en de prestaties van de robot storten in. Het paper noemt dit "catastrophic accuracy collapse" (catastrofale nauwkeurigheidsinstorting).

De Oplossing: Jet-RL (De "Verenigde Taal"-aanpak)

De auteurs stellen een nieuw systeem voor genaamd Jet-RL. In plaats van tussen talen te wisselen tussen oefenen en beoordelen, laten ze de robot voor alles dezelfde taal (FP8) spreken.

  • De Analogie: Stel je voor dat de robot nu zijn oefenessays in potlood schrijft, en de leraar de essays ook beoordeelt met een potlood-gebaseerd beoordelingsschema.
    • Consistentie: Omdat het "denken" en het "leren" plaatsvinden in exact hetzelfde laag-resolutie formaat, is er geen verwarring. De robot leert precies wat hij heeft geoefend.
    • Stabiliteit: Zelfs voor zeer lange essays (lange rollouts) of zeer moeilijke onderwerpen, blijft de robot stabiel omdat de "potlood"-foutjes consistent zijn door het hele proces heen.

Hoe het Werkt (De Technische Magie)

Om dit werkend te krijgen, moest het team zeer slim omgaan met de wiskunde:

  1. Unified Flow (Verenigde Stroom): Ze zorgden ervoor dat de data die door de computerchips stroomt, vanaf de allereerste stap van het denken tot de allerlaatste stap van het updaten van het brein, als FP8 (laag-resolutie) wordt behandeld.
  2. Smart Grouping (Slimme Groepering): Ze hebben niet blindelings alles verkleind. Ze hebben getallen bij elkaar gegroepeerd (zoals boeken op een plank ordenen), zodat de "laag-resolutie" versie accuraat genoeg blijft om van te leren.
  3. Geen Kalibratie: Normaal gesproken, wanneer je van formaat wisselt, moet je tijd besteden aan "kalibreren" (testen en aanpassen) om te zorgen dat het werkt. Jet-RL slaat deze stap volledig over omdat het systeem vanaf het begin consistent is ontworpen.

De Resultaten: Snel en Accuraat

Het paper testte dit op verschillende modellen en vond:

  • Snelheid: Het maakte de "denk"-fase 33% sneller en het hele trainingsproces 16% sneller.
  • Nauwkeurigheid: In tegenstelling tot de mislukte afkorting (die de robot deed falen), hield Jet-RL de intelligentie van de robot bijna exact gelijk aan de trage, hoog-definitie versie. De daling in prestaties was verwaarloosbaar (minder dan 1%).
  • Betrouwbaarheid: Het werkte zelfs wanneer de robot zeer lange antwoorden moest schrijven (16.000 woorden) of zeer moeilijke wiskundige problemen moest oplossen, waar de oude methode zou zijn gecrasht.

Samenvatting

Jet-RL is een nieuwe manier om AI te trainen die voorkomt dat de robot in de war raakt door te wisselen tussen "snelle modus" en "slimme modus". Door voor zowel het denken als het leren dezelfde "snelle taal" te spreken, maakt het AI-training veel sneller zonder de AI dommer te maken. Het verandert een gebroken, instabiele afkorting in een betrouwbare, hogesnelheidsweg.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →