← नवीनतम पेपर
🤖 machine learning

SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts

SpecRoll एक नवीन स्पेक्युलेटिव रोलआउट इंजन है जो सुव्यवस्थित समानांतर प्रस्तावों (parallel proposals) को एक दोहरे-टाइमस्केल अनुकूलन तंत्र के साथ जोड़कर प्रशिक्षण में तेजी लाता है—जिसमें तत्काल हिडन-स्टेट सुधार के लिए विलंबित फीडबैक और दीर्घकालिक स्थिरता के लिए आवधिक अपडेट का उपयोग किया जाता है—ताकि लक्षित मॉडल के सैंपलिंग वितरण को सुरक्षित रखते हुए जनरेशन और एंड-टू-एंड ट्रेनिंग में महत्वपूर्ण गति प्राप्त की जा सके।

मूल लेखक: Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui

प्रकाशित 2026-08-06
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को जटिल गणितीय समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं। आप उसे केवल उत्तर नहीं देते; आप उसे प्रयास करने देते हैं, अपना काम जांचने देते हैं, और फिर उसे सही दिशा में धकेलते हैं। इस प्रक्रिया को 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) कहा जाता है। रोबोट कदम-दर-कदम सोचता है, अपने तर्क को एक बार में एक शब्द के रूप में लिखता है, जैसे कोई छात्र एक लंबा होमवर्क भर रहा हो। समस्या यह है कि यह "सोचना" अविश्वसनीय रूप से धीमा है। रोबोट को हर एक शब्द लिखना पड़ता है, कंप्यूटर के द्वारा जांच किए जाने का इंतज़ार करना पड़ता है, और फिर अगला शब्द लिखना पड़ता है। यह एक स्विमिंग पूल को चम्मच से भरने जैसा है जबकि पानी लगातार वाष्पित (evaporate) हो रहा है।

इस गति को बढ़ाने के लिए, वैज्ञानिकों ने "स्पेक्टुलेटिव डिकोडिंग" (speculative decoding) नामक एक तरकीब आजमाई है। कल्पना कीजिए कि एक छात्र गणित में इतना अच्छा है कि वह उत्तर के अगले तीन शब्दों को लिखने से पहले ही उनका अनुमान लगा सकता है। वह कुछ अनुमान लिखता है, और एक शिक्षक (सत्यापनकर्ता/verifier) जल्दी से जांचता है कि क्या अनुमान सही हैं। यदि वे सही हैं, तो बहुत अच्छा! छात्र धीमी सोच को छोड़कर उन शब्दों को स्वीकार कर लेता है। यदि वे गलत हैं, तो शिक्षक उन्हें ठीक करता है, और छात्र फिर से शुरू करता है। यह सामान्य कार्यों के लिए चमत्कार की तरह काम करता है, लेकिन जब रोबोट सीख रहा होता है, तो यह कठिन हो जाता है। रोबोट का मस्तिष्क नए नियम सीखते समय लगातार बदल रहा होता है, इसलिए एक अनुमान लगाने वाला (guesser) जो कल तक एकदम सही था, आज पूरी तरह से गलत हो सकता है। यदि आप पुराने अनुमान लगाने वाले का उपयोग करते रहते हैं, तो वह विफल हो जाता है। यदि आप अनुमान लगाने वाले को हर सेकंड फिर से प्रशिक्षित (retrain) करने की कोशिश करते हैं, तो कंप्यूटर इतना व्यस्त हो जाता है कि वह वास्तव actually गणित का होमवर्क करना ही भूल जाता है।

यह पहेली है जिसे SpecRoll हल करने की कोशिश करता है। लेखकों ने, जो वियतनाम की एक टीम है, एक नया सिस्टम बनाया है जो एक "फास्ट-स्लो" (तेज़-धीमा) लर्निंग इंजन की तरह काम करता है। उन्होंने महसूस किया कि पूरे अनुमान लगाने वाले मॉडल को लगातार फिर से प्रशिक्षित करने के बजाय, वे दो अलग-अलग उपकरणों को एक साथ काम में ला सकते हैं। पहला, उनके पास एक "रिफ्लेक्स" (Reflex) मॉड्यूल है—एक सुपर-फास्ट, अस्थायी समाधान जिसमें भारी कंप्यूटिंग की आवश्यकता नहीं होती है। यह एक ऐसे छात्र की तरह है, जो यह महसूस करने पर कि उसने अपने पिछले अनुमान में एक छोटी सी गलती की है, तुरंत अपने अगले अनुमान के लिए अपनी मानसिक स्थिति को समायोजित करता है, बिना पूरे विषय को फिर से सीखे। दूसरा, एक "स्लो पाथ" (धीमा मार्ग) है जो केवल तभी अपडेट होता है जब वह देखता है कि गलतियाँ लंबे समय तक लगातार बढ़ रही हैं।

लेख बताते हैं कि यह दो-गति वाला दृष्टिकोण अविश्वसनीय रूप से अच्छा काम करता है। अनुमान लगाने वाले के अनुमानों को जांचने के स्मार्ट तरीके के साथ मिलकर, SpecRoll रोबोट को गणित की समस्याओं को सीखने में 1.26 से 2.15 गुना तेज़ बनाता है। यह पिछले सबसे अच्छे तरीके (जिसे FastGRPO कहा जाता है) को हर उस परीक्षण में हरा देता है जो उन्होंने चलाया, जिससे समय और कंप्यूटर पावर दोनों की बचत होती है। लेखकों ने केवल अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने इसे पांच अलग-अलग रोबोट दिमागों (1.5 बिलियन से 14 बिलियन पैरामीटर वाले मॉडल्स) और तीन गणितीय डेटासेट्स पर परखा। परिणाम बताते हैं कि "त्वरित सुधारों" को "दीर्घकालिक सीखने" से अलग करके, आप सटीकता खोए बिना AI प्रशिक्षण को बहुत अधिक कुशल बना सकते हैं।

SpecRoll की कहानी: एक तेज़-धीमी नृत्य (A Fast-Slow Dance)

AI को गणित की समस्याएं हल करने के लिए प्रशिक्षित करने को एक विशाल टीम द्वारा खेले जाने वाले "टेलीफोन" के उच्च-दांव वाले खेल की तरह समझें। लक्ष्य यह है कि टीम (AI) समस्या को हल करने के लिए तर्क की एक लंबी श्रृंखला उत्पन्न करे। मानक संस्करण (जिसे GRPO कहा जाता है) में, टीम को एक बार में एक शब्द फुसफुसाना पड़ता है, रेफरी द्वारा उसे जांचे जाने का इंतजार करना पड़ता है, और फिर अगला शब्द फुसफुसाना पड़ता है। यह सटीक है, लेकिन यह कष्टदायक रूप से धीमा है।

यहाँ आता है SpecRoll, नया कोच जो एक "स्पेक्टुलेटिव" रणनीति पेश करता है। कोच कहता है, "आइए हर एक शब्द के लिए रेफरी के चेक करने का इंतज़ार न करें। आइए एक 'ड्राफ्टर' (अनुमान लगाने वाला) रखें जो कुछ शब्द पहले ही चिल्लाकर बता दे, और हम उन सभी को एक साथ जांच लेंगे!"

पुराने तरीके के साथ समस्या

सीखने के वातावरण में एक अनुमान लगाने वाले (guesser) का उपयोग करने में समस्या यह है कि टीम की रणनीति लगातार बदल रही है। कल्पना कीजिए कि टीम एक नया नियम सीख रही है: "'however' के बाद हमेशा एक अल्पविराम (comma) लगाएं।" कल, अनुमान लगाने वाला एकदम सही था। आज, टीम ने एक नया नियम सीखा है, और अनुमान लगाने वाला अब बिना अल्पविराम के शब्द चिल्ला रहा है। यदि आप पुराने अनुमान लगाने वाले का उपयोग करते रहते हैं, तो वह विफल हो जाता है। यदि आप खेल खेलते समय ही अनुमान लगाने वाले को फिर से प्रशिक्षित करने की कोशिश करते हैं, तो कंप्यूटर अभिभूत हो जाता है। यह चलते हुए कार को पेंट करने की कोशिश करने जैसा है; या तो आप दुर्घटनाग्रस्त हो सकते हैं, या आप अपना सारा समय पेंट करने में बिता देंगे और वास्तव में कभी गाड़ी नहीं चला पाएंगे।

FastGRPO जैसे पिछले प्रयासों ने ऑनलाइन एक अलग अनुमान लगाने वाले मॉडल को प्रशिक्षित करके इसे हल करने की कोशिश की। लेकिन इसके लिए बहुत भारी काम की आवश्यकता थी—लगातार पीछे की गणनाएं (backward calculations) चलाना और अनुमान लगाने वाले के मस्तिष्क को अपडेट करना। यह प्रभावी था, लेकिन यह भारी और धीमा था।

SpecRoll का समाधान: रिफ्लेक्स और स्लो पाथ

SpecRoll एक अलग, हल्का दृष्टिकोण अपनाता है। यह अनुमान लगाने वाले की गलतियों को संभालने के लिए दो अलग-अलग गतियों का उपयोग करता है:

  1. द फास्ट पाथ (रिफ्लेक्स): यह "रिफ्लेक्स" मॉड्यूल है। इसे एक छात्र की तत्काल सहज भावना (gut feeling) के रूप में सोचें। जब रेफरी (सत्यापनकर्ता) कहता है, "हे, वह अनुमान गलत था," तो रिफ्लेक्स मॉड्यूल छात्र के मस्तिष्क को फिर से प्रशिक्षित नहीं करता है। इसके बजाय, यह अगले अनुमान के लिए छात्र की वर्तमान मानसिक स्थिति में एक छोटा, अस्थायी समायोजन करता है। यह एक त्वरित "ओह, मेरा मतलब यह था" सुधार की तरह है जो पलक झपकते ही होता है। यह बिना किसी भारी गणित (backpropagation) के, तत्काल प्रक्षेपवक्र (trajectory) को ठीक करने के लिए "विलंबित फीडबैक" (delayed feedback) का उपयोग करता है। यह तेज़ है, मुफ्त है, और केवल वर्तमान समस्या के लिए है।

  2. द स्लो पाथ (परसिस्टेंट एडाप्टेशन): कभी-कभी, अनुमान लगाने वाला केवल एक बार की गलती नहीं कर रहा होता है; वह लगातार गलत होता है क्योंकि टीम की रणनीति मौलिक रूप से बदल गई है। यहीं पर "स्लो पाथ" काम आता है। यह तब तक इंतजार करता है जब तक कि वह निरंतर त्रुटियों का पैटर्न नहीं देख लेता। केवल तभी यह अनुमान लगाने वाले के मापदंडों (उसके मस्तिष्क के भार/weights) को वास्तव में अपडेट करता है। यह एक शिक्षक की तरह है जो यह तय करता है कि छात्र को एक पूरा अध्याय फिर से तभी पढ़ाए जब वह हफ्तों तक एक ही प्रकार के प्रश्न में लगातार असफल होता देखे।

व्यवहार में यह कैसे काम करता है

यह सिस्टम "लाइटवेट फ्यूचर-टोकन हेड्स" (lightweight future-token heads) का उपयोग करता है। कल्पना कीजिए कि ये रोबोट के सिर पर छोटे एंटीना हैं जो समानांतर में अगले कुछ शब्दों की भविष्यवाणी करते हैं।

  • कन्करेंसी अवेयरनेस (Concurrency Awareness): सिस्टम इस बात के प्रति स्मार्ट है कि वह कितने अनुमान लगाता है। यदि रोबोट एक साथ कई समस्याओं पर काम कर रहा है (उच्च कन्करेंसी), तो वह स्थान बचाने के लिए प्रति समस्या कम अनुमान लगाता है। जैसे-जैसे समस्याएं समाप्त होती हैं और रोबोट के पास अधिक जगह होती है, वह अधिक अनुमान लगाता है। यह एक ऐसे शेफ की तरह है जो भीड़ होने पर कम व्यंजन बनाता है लेकिन ऑर्डर कम होने पर बढ़ा देता है।
  • सटीक सत्यापन (Exact Verification): महत्वपूर्ण रूप से, SpecRoll अपनी सटीकता से समझौता नहीं करता है। भले ही वह अनुमान लगाता है, वह हमेशा रोबोट के वास्तविक मस्तिष्क के विरुद्ध एक अंतिम, सटीक जांच चलाता है। यदि अनुमान गलत है, तो उसे सुधारा जाता है। यह सुनिश्चित करता है कि रोबोट सही तरीके से सीखता है, बस तेज़ गति से।

परिणाम: दौड़ में तेजी लाना

लेखकों ने पांच अलग-अलग AI मॉडल्स (1.5 बिलियन से 14 बिलियन पैरामीटर्स) और तीन गणितीय डेटासेट्स (GSM8K, SimpleRL, और DAPO-Math) पर SpecRoll का परीक्षण किया।

  • गति: मानक पद्धति की तुलना में, SpecRoll ने उत्तरों के निर्माण को 1.26 से 2.15 गुना तेज़ बनाया।
  • एंड-टू-एंड: जब आप पूरी प्रशिक्षण प्रक्रिया (उत्तरों की जांच और रोबोट को अपडेट करने का समय सहित) को गिनते हैं, तो यह 1.21 से 2.04 गुना तेज़ था।
  • प्रतिस्पर्धा को हराना: FastGRPO (पिछले स्टेट-ऑफ-द-आर्ट) के खिलाफ आमने-सामने के परीक्षणों में, SpecRoll ने सभी 15 अलग-अलग सेटिंग्स (मॉडल्स और डेटासेट्स के संयोजन) में जीत हासिल की। औसतन, यह एंड-टू-एंड में 1.18 गुना तेज़ था।

लेखकों ने "एब्लेशन स्टडीज" (ऐसे परीक्षण जहाँ उन्होंने सिस्टम के कुछ हिस्सों को बंद कर दिया) भी चलाईं ताकि यह साबित किया जा सके कि 'फास्ट' (रिफ्लेक्स) और 'स्लो' दोनों पथ आवश्यक हैं। उन्होंने पाया कि केवल रिफ्लेक्स या केवल स्लो पाथ का उपयोग करने से मदद मिली, लेकिन दोनों को एक साथ उपयोग करने से सबसे अच्छे परिणाम मिले। यह एक गेंद से बचने के लिए त्वरित रिफ्लेक्स और अपने निशाने को सुधारने के लिए दीर्घकालिक रणनीति दोनों रखने जैसा है; चैंपियन बनने के लिए आपको दोनों की आवश्यकता है।

यह क्यों मायने रखता है

SpecRoll की खूबसूरती यह है कि यह AI के सीखने के बुनियादी नियमों को नहीं बदलता है। यह "ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन" (GRPO) के पीछे के गणित या AI को मिलने वाले रिवॉर्ड्स को नहीं बदलता है। यह केवल "रोलआउट" (उत्तर उत्पन्न करने की प्रक्रिया) को बहुत अधिक कुशल बनाता है।

लेखकों का सुझाव है कि यह दृष्टिकोण जटिल तर्क कार्यों पर AI को प्रशिक्षित करने के लिए गेम-चेंजर हो सकता है। तत्काल, अस्थायी सुधारों को दीर्घकालिक सीखने से अलग करके, वे एक अलग अनुमान लगाने वाले मॉडल को लगातार प्रशिक्षित करने की भारी कम्प्यूटेशनल लागत के बिना भारी गति लाभ प्राप्त करने में सफल रहे।

अंत में, SpecRoll दिखाता है कि कभी-कभी, तेज़ चलने का सबसे अच्छा तरीका तेज़ दौड़ना नहीं है, बल्कि यह सीखना है कि आप दो अलग-अलग तरीकों से अपनी चाल को कैसे समायोजित करें: वर्तमान क्षण के लिए एक त्वरित कदम, और लंबी यात्रा के लिए एक धीमा, स्थिर अपडेट। और सबसे अच्छी बात? लेखकों ने अपना कोड उपलब्ध करा दिया है, ताकि अन्य लोग भी इस तेज़-धीमी नृत्य को स्वयं आजमा सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →