← नवीनतम पेपर
📊 statistics

Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning

यह शोध पत्र स्लो-फास्ट पॉलिसी ऑप्टिमाइज़ेशन (SFPO) को प्रस्तुत करता है, जो एक प्लग-कम्पैटिबल फ्रेमवर्क है जो प्रत्येक अपडेट को फास्ट इनर स्टेप्स, ऑफ-पॉलिसी ड्रिफ्ट को नियंत्रित करने के लिए एक रिपोजिशन मैकेनिज्म और एक स्लो करेक्शन में विभाजित करके LLM रीजनिंग ट्रेनिंग की स्थिरता और दक्षता को बढ़ाता है, जिससे यह कम रोलआउट्स और तेज़ अभिसरण (कन्वर्जेंस) के साथ GRPO से बेहतर प्रदर्शन करता है।

मूल लेखक: Ziyan Wang, Zheng Wang, Jie Fu, Xingwei Qu, Qi Cheng, Shengpu Tang, Minjia Zhang, Xiaoming Huo

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyan Wang, Zheng Wang, Jie Fu, Xingwei Qu, Qi Cheng, Shengpu Tang, Minjia Zhang, Xiaoming Huo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े अराजक छात्र (AI) को जटिल गणितीय समस्याओं को हल करना सिखा रहे हैं। आप उन्हें एक समस्या देते हैं, वे उसे हल करने की कोशिश करते हैं, और फिर आप उन्हें कहते हैं, "बहुत अच्छा!" या "फिर से प्रयास करें।" इस तरह से लार्ज लैंग्वेज मॉडल्स (LLMs) के लिए रीइन्फोर्समेंट लर्निंग (RL) काम करता है।

वर्तमान में, इन छात्रों को सिखाने का सबसे लोकप्रिय तरीका GRPO नामक एक विधि है। GRPO को एक ऐसे शिक्षक के रूप में सोचें जो कहता है: "यहाँ एक समस्या है। 8 अलग-अलग उत्तर लिखो। मैं उन्हें ग्रेड दूँगा, सबसे अच्छे वाले को चुनूँगा, और फिर तुम उस एक ग्रेड के आधार पर अपने मस्तिष्क में एक ही बड़ा बदलाव करोगे।"

समस्या:
प्रशिक्षण के शुरुआती चरणों में, छात्र के उत्तर अक्सर अस्त-व्यst या गलत होते हैं। यदि शिक्षक केवल एक शोर भरे ग्रेड के आधार पर मस्तिष्क में एक विशाल बदलाव करता है, तो छात्र भ्रमित हो सकता है, जो वह जानता था उसे भूल सकता है, या बेतरतीब ढंग से अनुमान लगाना शुरू कर सकता है। यह एक विशाल जहाज को एक एकल, अस्थिर दिशा-सूचक यंत्र (compass) रीडिंग के आधार पर अचानक, तीखा मोड़ लेने की कोशिश करने जैसा है। जहाज (AI) डगमगाता है, ईंधन (कंप्यूटिंग पावर) बर्बाद करता है, और मंजिल तक पहुँचने में बहुत समय लेता है।

समाधान: SFPO (स्लो-फास्ट पॉलिसी ऑप्टिमाइज़ेशन)
लेखकों ने एक नई शिक्षण विधि प्रस्तावित की है जिसे SFPO कहा जाता है। एक बड़े, जोखिम भरे बदलाव के बजाय, यह सीखने की प्रक्रिया को तीन विशिष्ट चरणों में तोड़ देता है, जैसे कि एक तीन-चरणीय नृत्य (three-step dance):

1. "फास्ट" डांस (द स्प्रिंट)

केवल एक बदलाव करने के बजाय, AI उसी उत्तरों के सेट का उपयोग करके कई छोटे कदम लेता है जो उसने अभी-अभी उत्पन्न किए थे।

  • उपमा: कल्पना कीजिए कि एक छात्र धुंधले कमरे में निकास खोजने की कोशिश कर रहा है। एक विशाल, अंधेरे छलांग लगाने के बजाय, वह तीन त्वरित, परीक्षण कदम आगे बढ़ाता है, हर बार फर्श को महसूस करते हुए। वे पहले से मौजूद डेटा का उपयोग करके दिशा का बेहतर बोध प्राप्त करने के लिए "स्प्रिंट" कर रहे हैं।
  • यह क्यों मदद करता है: यह शोर को कम करता है। यदि एक कदम एक इत्तेफाक था, तो अगले दो कदम उसे ठीक कर देंगे। दिशा बहुत अधिक स्पष्ट हो जाती है।

2. "रिपोजिशन" (द सेफ्टी नेट)

यही वह चतुर हिस्सा है। क्योंकि AI ने वे अतिरिक्त कदम उठाए हैं, वह उस "मूल" स्थिति से दूर चला गया है जहाँ उसने उत्तर उत्पन्न किए थे। यदि वह वहीं रहता है, तो यह उस नक्शे के आधार पर अनुमान लगाने जैसा है जो अब कमरे से मेल नहीं खाता (इसे "ऑफ-पॉलिसी ड्रिफ्ट" कहा जाता है)।

  • उपमा: शिक्षक छात्र को धीरे से उसके शुरुआती स्थान की ओर आधा वापस खींचता है। यह ऐसा है जैसे कहना, "ठीक है, तुमने आगे की ओर स्प्रिंट किया और बहुत कुछ सीखा, लेकिन रास्ते से बहुत दूर मत भागो। चलो, हम तुम्हें थोड़ा पीछे खींचते हैं ताकि तुम खो न जाओ।"
  • यह क्यों मदद करता है: यह AI को जमीन से जोड़े रखता है। यह स्प्रिंट से प्राप्त नए विचारों का उपयोग करता है लेकिन यह भी सुनिश्चित करता है कि AI मूल उत्तरों के संदर्भ को न भूले।

3. "स्लो" करेक्शन (द फाइनल पॉलिश)

अंत में, AI इस नए, संतुलित स्थान से एक आखिरी, सावधानीपूर्वक कदम उठाता है।

  • उपमा: अब जब छात्र एक स्थिर स्थान पर है, तो वह निकास की ओर एक विचारशील, आत्मविश्वासी कदम उठाता है।
  • यह क्यों मदद करता है: यह अंतिम कदम सीखने को सूक्ष्म रूप से परिष्कृत (fine-tune) करता है, यह सुनिश्चित करता है कि AI बिना ओवरशूट किए सही दिशा में आगे बढ़े।

परिणाम: यह बेहतर क्यों है?

  • कम बर्बाद प्रयास: पुराने तरीके (GRPO) में, AI को अक्सर अपनी गलती सुधारने के लिए हजारों नए उत्तर (rollouts) उत्पन्न करने पड़ते थे क्योंकि सीखना अस्थिर था। SFPO के साथ, AI प्रत्येक उत्तर के सेट से अधिक सीखता है।
    • वास्तविक दुनिया का आंकड़ा: पेपर दिखाता है कि SFPO को समान स्तर की बुद्धिमत्ता तक पहुँचने के लिए 5 गुना कम प्रयासों की आवश्यकता होती है।
  • तेज़ प्रशिक्षण: क्योंकि यह तेजी से सीखता है और कम समय बर्बाद करता है, यह 4 गुना कम वास्तविक समय में प्रशिक्षण पूरा कर लेता है।
  • अधिक स्थिर: प्रशिक्षण के दौरान AI क्रैश नहीं होता या पागल नहीं होता। यह स्थिरता से सीखता है, जैसे एक मैराथन धावक अपनी गति बनाए रखता है, न कि एक स्प्रिंटर की तरह जो अपने ही पैरों से टकराकर गिर जाता है।

सारांश

GRPO को एक ऐसे छात्र के रूप में सोचें जो हर बार फीडबैक मिलने पर एक विशाल, जोखिम भरी छलांग लगाकर सीखने की कोशिश करता है।
SFPO को एक ऐसे छात्र के रूप में सोचें जो जमीन को परखने के लिए कुछ त्वरित कदम उठाता है, सुरक्षित रहने के लिए थोड़ा पीछे खींचा जाता है, और फिर एक अंतिम, आत्मविश्वासी कदम उठाता है।

यह "अपडेट-से-पहले-रिपोजिशन" रणनीति यह अनुमति देती है कि AI बेहतर तर्क दे सके, तेजी से सीख सके और कम कंप्यूटिंग पावर का उपयोग कर सके, जो रोबोटों को सोचने के लिए सिखाने की दिशा में एक बड़ी छलांग है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →