← नवीनतम पेपर
💬 NLP

Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow

यह शोध पत्र Jet-RL को प्रस्तुत करता है, जो एक एकीकृत FP8 सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो रोलआउट और प्रशिक्षण दोनों में सुसंगत FP8 परिशुद्धता लागू करके मिश्रित-परिशुद्धता रणनीतियों के कारण होने वाली प्रशिक्षण अस्थिरता और सटीकता पतन को हल करता है, जिससे स्थिर अभिसरण बनाए रखते हुए महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

प्रकाशित 2026-01-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ Jet-RL पेपर का स्पष्टीकरण दिया गया है, जिसे रोज़मर्रा के उदाहरणों के साथ सरल अवधारणाओं में विभाजित किया गया है।

बड़ी समस्या: AI प्रशिक्षण में "धीमी चाल" (The "Slow Walk")

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) को जटिल गणितीय समस्याओं को हल करने के लिए प्रशिक्षित कर रहे हैं। इसमें वास्तव में कुशल होने के लिए, रोबोट को उत्तर देने से पहले "ज़ोर से सोचने" (लंबे तर्क श्रृंखला उत्पन्न करने) का अभ्यास करने की आवश्यकता होती है।

AI प्रशिक्षण की दुनिया में, इस अभ्यास सत्र को रोलआउट (Rollout) कहा जाता है।

  • बाधा (The Bottleneck): पेपर बताता है कि यह "ज़ोर से सोचने" वाला चरण अविश्वसनीय रूप से धीमा है। यह रोबोट के प्रशिक्षण में लगने वाले कुल समय का 70% हिस्सा ले लेता है। यह एक छात्र की तरह है जो परीक्षा के लिए 7 घंटे पढ़ाई करता है, लेकिन उन 7 घंटों में से 5 घंटे तो केवल खाली पन्ने को घूरने और पहला वाक्य सोचने में निकल जाते हैं।
  • लक्ष्य: हम इस "सोचने" वाले चरण को तेज़ करना चाहते हैं बिना रोबोट को कम बुद्धिमान बनाए।

विफल शॉर्टकट: "डबल-बुककीपिंग की गलती" (The "Double-Bookkeeping Mistake")

तेज़ करने के लिए, इंजीनियरों ने एक सरल ट्रिक आज़माई: क्वांटाइजेशन (Quantization)

  • उपमा (The Analogy): कल्पना कीजिए कि रोबोट का मस्तिष्क आमतौर पर हाई-डेफिनिशन, 16-बिट "HD" नंबरों (BF16) के साथ काम करता है। तेज़ चलने के लिए, उन्होंने अभ्यास सत्र के लिए केवल रोबोट के "सोचने" के मोड को लो-डेफिनिशन, 8-बिट "SD" मोड (FP8) में बदलने की कोशिश की, जबकि "ग्रेडिंग" सत्र को HD में रखा।
  • विचार: "आइए लंबे सोचने वाले हिस्सों के लिए तेज़, लो-रेज़ मोड का उपयोग करें, लेकिन वास्तविक लर्निंग अपडेट्स के लिए हाई-रेज़ मोड को बनाए रखें।"
  • तबाही (The Disaster): पेपर ने पाया कि लंबे या कठिन कार्यों के लिए यह दृष्टिकोण एक तबाही है।
    • मेल का अभाव (The Mismatch): यह एक छात्र को पेंसिल (लो-रेज़) से 10 पन्नों का निबंध लिखने के लिए कहने जैसा है, लेकिन फिर उसे स्याही (हाई-रेज़) से लिखे गए निबंध की तरह ग्रेड करने जैसा है। पेंसिल स्केच की छोटी गलतियाँ जमा होती जाती हैं। जब तक निबंध लंबा (16,000 शब्द) हो जाता है, तब तक "पेंसिल" वाला संस्करण "स्याही" वाले संस्करण से बिल्कुल अलग दिखता है।
    • परिणाम: रोबोट भ्रमित हो जाता है। वह मतिभ्रम (hallucinations) करने लगता है, प्रशिक्षण क्रैश हो जाता है, और रोबोट का प्रदर्शन ढह जाता है। पेपर इसे "विनाशकारी सटीकता पतन" (catastrophic accuracy collapse) कहता है।

समाधान: Jet-RL (एक "एकीकृत भाषा" दृष्टिकोण)

लेखकों ने Jet-RL नामक एक नई प्रणाली प्रस्तावित की है। अभ्यास और ग्रेडिंग के बीच भाषा बदलने के बजाय, वे रोबोट को हर चीज़ के लिए एक ही भाषा (FP8) बोलने के लिए प्रेरित करते हैं।

  • उपमा: कल्पना कीजिए कि अब रोबोट अपने अभ्यास निबंध पेंसिल से लिखता है, और शिक्षक भी निबंधों को पेंसिल-आधारित रूब्रिक (मानदंड) का उपयोग करके ग्रेड करता है।
    • निरंतरता (Consistency): क्योंकि "सोचना" और "सीखना" दोनों बिल्कुल एक ही लो-रेज़ फ़ॉर्मेट में होते हैं, इसलिए कोई भ्रम नहीं होता। रोबोट वही सीखता है जिसका उसने अभ्यास किया था।
    • स्थिरता (Stability): बहुत लंबे निबंधों (लॉन्ग रोलआउट्स) या बहुत कठिन विषयों के लिए भी, रोबोट स्थिर रहता है क्योंकि पूरे प्रोसेस के दौरान "पेंसिल" की त्रुटियाँ सुसंगत रहती हैं।

यह कैसे काम करता है (तकनीकी जादू)

इसे काम करने योग्य बनाने के लिए, टीम को गणित को संभालने के तरीके में बहुत चतुर होना पड़ा:

  1. एकीकृत प्रवाह (Unified Flow): उन्होंने सुनिश्चित किया कि कंप्यूटर चिप्स के माध्यम से बहने वाला डेटा सोचने के पहले चरण से लेकर मस्तिष्क को अपडेट करने के अंतिम चरण तक FP8 (लो-रेज़) के रूप में माना जाए।
  2. स्मार्ट ग्रुपिंग (Smart Grouping): उन्होंने सब कुछ अंधाधुंध छोटा नहीं किया। उन्होंने नंबरों को एक साथ समूहबद्ध किया (जैसे किताबों को शेल्फ पर व्यवस्थित करना) ताकि "लो-रेज़" संस्करण सीखने के लिए पर्याप्त सटीक बना रहे।
  3. कोई कैलिब्रेशन नहीं (No Calibration): आमतौर पर, जब आप फ़ॉर्मेट बदलते हैं, तो आपको यह सुनिश्चित करने के लिए "कैलिब्रेशन" (परीक्षण और समायोजन) में समय बिताना पड़ता है कि यह काम करे। Jet-RL इस चरण को पूरी तरह से छोड़ देता है क्योंकि सिस्टम शुरू से ही सुसंगत होने के लिए डिज़ाइन किया गया है।

परिणाम: तेज़ और सटीक

पेपर ने कई मॉडलों पर इसका परीक्षण किया और पाया:

  • गति (Speed): इसने "सोचने" के चरण को 33% तेज़ बनाया और पूरी प्रशिक्षण प्रक्रिया को 16% तेज़ कर दिया।
  • सटीकता (Accuracy): विफल शॉर्टकट के विपरीत (जिसने रोबोट को विफल कर दिया था), Jet-RL ने रोबोट की बुद्धिमत्ता को लगभग वैसा ही बनाए रखा जैसा कि धीमा, हाई-डेफिनिशन संस्करण था। प्रदर्शन में गिरावट नगण्य (1% से कम) थी।
  • विश्वसनीयता (Reliability): यह तब भी काम कर गया जब रोबोट को बहुत लंबे उत्तर (16,000 शब्द) लिखने थे या कठिन गणितीय समस्याओं को हल करना था, जहाँ पुराना तरीका क्रैश हो जाता।

सारांश

Jet-RL AI को प्रशिक्षित करने का एक नया तरीका है जो "फास्ट मोड" और "स्मार्ट मोड" के बीच स्विच करने से रोबोट को भ्रमित होने से रोकता है। सोचने और सीखने दोनों के लिए एक ही "फास्ट भाषा" बोलकर, यह AI प्रशिक्षण को बहुत तेज़ बनाता है बिना AI को कम बुद्धिमान बनाए। यह एक टूटे हुए, अस्थिर शॉर्टकट को एक विश्वसनीय, हाई-स्पीड हाईवे में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →