Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
यह शोध पत्र स्लो-फास्ट पॉलिसी ऑप्टिमाइज़ेशन (SFPO) को प्रस्तुत करता है, जो एक प्लग-कम्पैटिबल फ्रेमवर्क है जो प्रत्येक अपडेट को फास्ट इनर स्टेप्स, ऑफ-पॉलिसी ड्रिफ्ट को नियंत्रित करने के लिए एक रिपोजिशन मैकेनिज्म और एक स्लो करेक्शन में विभाजित करके LLM रीजनिंग ट्रेनिंग की स्थिरता और दक्षता को बढ़ाता है, जिससे यह कम रोलआउट्स और तेज़ अभिसरण (कन्वर्जेंस) के साथ GRPO से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े अराजक छात्र (AI) को जटिल गणितीय समस्याओं को हल करना सिखा रहे हैं। आप उन्हें एक समस्या देते हैं, वे उसे हल करने की कोशिश करते हैं, और फिर आप उन्हें कहते हैं, "बहुत अच्छा!" या "फिर से प्रयास करें।" इस तरह से लार्ज लैंग्वेज मॉडल्स (LLMs) के लिए रीइन्फोर्समेंट लर्निंग (RL) काम करता है।
वर्तमान में, इन छात्रों को सिखाने का सबसे लोकप्रिय तरीका GRPO नामक एक विधि है। GRPO को एक ऐसे शिक्षक के रूप में सोचें जो कहता है: "यहाँ एक समस्या है। 8 अलग-अलग उत्तर लिखो। मैं उन्हें ग्रेड दूँगा, सबसे अच्छे वाले को चुनूँगा, और फिर तुम उस एक ग्रेड के आधार पर अपने मस्तिष्क में एक ही बड़ा बदलाव करोगे।"
समस्या:
प्रशिक्षण के शुरुआती चरणों में, छात्र के उत्तर अक्सर अस्त-व्यst या गलत होते हैं। यदि शिक्षक केवल एक शोर भरे ग्रेड के आधार पर मस्तिष्क में एक विशाल बदलाव करता है, तो छात्र भ्रमित हो सकता है, जो वह जानता था उसे भूल सकता है, या बेतरतीब ढंग से अनुमान लगाना शुरू कर सकता है। यह एक विशाल जहाज को एक एकल, अस्थिर दिशा-सूचक यंत्र (compass) रीडिंग के आधार पर अचानक, तीखा मोड़ लेने की कोशिश करने जैसा है। जहाज (AI) डगमगाता है, ईंधन (कंप्यूटिंग पावर) बर्बाद करता है, और मंजिल तक पहुँचने में बहुत समय लेता है।
समाधान: SFPO (स्लो-फास्ट पॉलिसी ऑप्टिमाइज़ेशन)
लेखकों ने एक नई शिक्षण विधि प्रस्तावित की है जिसे SFPO कहा जाता है। एक बड़े, जोखिम भरे बदलाव के बजाय, यह सीखने की प्रक्रिया को तीन विशिष्ट चरणों में तोड़ देता है, जैसे कि एक तीन-चरणीय नृत्य (three-step dance):
1. "फास्ट" डांस (द स्प्रिंट)
केवल एक बदलाव करने के बजाय, AI उसी उत्तरों के सेट का उपयोग करके कई छोटे कदम लेता है जो उसने अभी-अभी उत्पन्न किए थे।
- उपमा: कल्पना कीजिए कि एक छात्र धुंधले कमरे में निकास खोजने की कोशिश कर रहा है। एक विशाल, अंधेरे छलांग लगाने के बजाय, वह तीन त्वरित, परीक्षण कदम आगे बढ़ाता है, हर बार फर्श को महसूस करते हुए। वे पहले से मौजूद डेटा का उपयोग करके दिशा का बेहतर बोध प्राप्त करने के लिए "स्प्रिंट" कर रहे हैं।
- यह क्यों मदद करता है: यह शोर को कम करता है। यदि एक कदम एक इत्तेफाक था, तो अगले दो कदम उसे ठीक कर देंगे। दिशा बहुत अधिक स्पष्ट हो जाती है।
2. "रिपोजिशन" (द सेफ्टी नेट)
यही वह चतुर हिस्सा है। क्योंकि AI ने वे अतिरिक्त कदम उठाए हैं, वह उस "मूल" स्थिति से दूर चला गया है जहाँ उसने उत्तर उत्पन्न किए थे। यदि वह वहीं रहता है, तो यह उस नक्शे के आधार पर अनुमान लगाने जैसा है जो अब कमरे से मेल नहीं खाता (इसे "ऑफ-पॉलिसी ड्रिफ्ट" कहा जाता है)।
- उपमा: शिक्षक छात्र को धीरे से उसके शुरुआती स्थान की ओर आधा वापस खींचता है। यह ऐसा है जैसे कहना, "ठीक है, तुमने आगे की ओर स्प्रिंट किया और बहुत कुछ सीखा, लेकिन रास्ते से बहुत दूर मत भागो। चलो, हम तुम्हें थोड़ा पीछे खींचते हैं ताकि तुम खो न जाओ।"
- यह क्यों मदद करता है: यह AI को जमीन से जोड़े रखता है। यह स्प्रिंट से प्राप्त नए विचारों का उपयोग करता है लेकिन यह भी सुनिश्चित करता है कि AI मूल उत्तरों के संदर्भ को न भूले।
3. "स्लो" करेक्शन (द फाइनल पॉलिश)
अंत में, AI इस नए, संतुलित स्थान से एक आखिरी, सावधानीपूर्वक कदम उठाता है।
- उपमा: अब जब छात्र एक स्थिर स्थान पर है, तो वह निकास की ओर एक विचारशील, आत्मविश्वासी कदम उठाता है।
- यह क्यों मदद करता है: यह अंतिम कदम सीखने को सूक्ष्म रूप से परिष्कृत (fine-tune) करता है, यह सुनिश्चित करता है कि AI बिना ओवरशूट किए सही दिशा में आगे बढ़े।
परिणाम: यह बेहतर क्यों है?
- कम बर्बाद प्रयास: पुराने तरीके (GRPO) में, AI को अक्सर अपनी गलती सुधारने के लिए हजारों नए उत्तर (rollouts) उत्पन्न करने पड़ते थे क्योंकि सीखना अस्थिर था। SFPO के साथ, AI प्रत्येक उत्तर के सेट से अधिक सीखता है।
- वास्तविक दुनिया का आंकड़ा: पेपर दिखाता है कि SFPO को समान स्तर की बुद्धिमत्ता तक पहुँचने के लिए 5 गुना कम प्रयासों की आवश्यकता होती है।
- तेज़ प्रशिक्षण: क्योंकि यह तेजी से सीखता है और कम समय बर्बाद करता है, यह 4 गुना कम वास्तविक समय में प्रशिक्षण पूरा कर लेता है।
- अधिक स्थिर: प्रशिक्षण के दौरान AI क्रैश नहीं होता या पागल नहीं होता। यह स्थिरता से सीखता है, जैसे एक मैराथन धावक अपनी गति बनाए रखता है, न कि एक स्प्रिंटर की तरह जो अपने ही पैरों से टकराकर गिर जाता है।
सारांश
GRPO को एक ऐसे छात्र के रूप में सोचें जो हर बार फीडबैक मिलने पर एक विशाल, जोखिम भरी छलांग लगाकर सीखने की कोशिश करता है।
SFPO को एक ऐसे छात्र के रूप में सोचें जो जमीन को परखने के लिए कुछ त्वरित कदम उठाता है, सुरक्षित रहने के लिए थोड़ा पीछे खींचा जाता है, और फिर एक अंतिम, आत्मविश्वासी कदम उठाता है।
यह "अपडेट-से-पहले-रिपोजिशन" रणनीति यह अनुमति देती है कि AI बेहतर तर्क दे सके, तेजी से सीख सके और कम कंप्यूटिंग पावर का उपयोग कर सके, जो रोबोटों को सोचने के लिए सिखाने की दिशा में एक बड़ी छलांग है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।