GFlowRL: Scaling Distribution-Matching RL to Large Language Models
GFlowRL एक स्केलेबल, स्थिर GFlowNet-शैली का सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम बड़े भाषा मॉडलों के लिए पेश करता है जो इन-बैच मोंटे कार्लो अनुमानों और विशिष्ट स्टेबलाइजर्स का उपयोग करके सीखे गए पार्टिशन फंक्शन की आवश्यकता को समाप्त करता है, जिससे 235B पैरामीटर्स तक घने (dense) और विरल (sparse) दोनों आर्किटेक्चर में गणित, कोड और प्रतिकूल (adversarial) बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान, सुपर-फास्ट छात्र को दुनिया की सबसे कठिन पहेलियाँ हल करना सिखा रहे हैं, जिसमें जटिल गणितीय समस्याएँ से लेकर ऐसा कंप्यूटर कोड लिखना शामिल है जो कभी क्रैश न हो। आर्टिफिशियल इंटेलिजेंस की दुनिया में, यह छात्र एक "लार्ज लैंग्वेज मॉडल" (LLM) है, और जिस तरीके से हम उन्हें सिखाते हैं उसे "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) कहा जाता है। इसे एक वीडियो गेम की तरह समझें जहाँ AI को सही काम करने के लिए अंक (रिवॉर्ड्स) मिलते हैं। लंबे समय तक, मानक रणनीति एक लालची गेमर की तरह कार्य करने की थी: "अभी जो भी चाल सबसे अधिक अंक दे रही है, उसे खोजो और बार-बार वही करो।" यह अच्छी तरह काम करता है, लेकिन इसमें एक दोष है। यह उस छात्र की तरह है जो गणित की समस्या को हल करने का एक विशिष्ट तरीका रट लेता है और किसी अन्य तरीके को आज़माने से इनकार कर देता है, भले ही वह दूसरा तरीका उतना ही अच्छा क्यों न हो। वे सोचने के एक ही तरीके में "फँस" जाते हैं, जिससे वे नई, पेचीदा स्थितियों को संभालने के लिए आवश्यक रचनात्मकता और विविधता को खो देते हैं।
इसे ठीक करने के लिए, वैज्ञानिकों ने हाल ही में एक अलग दृष्टिकोण अपनाया जिसे "जेनरेटिव फ्लो नेटवर्क्स" (GFlowNets) कहा जाता है। केवल सबसे अच्छी चाल की तलाश करने के बजाय, यह विधि AI को सभी अच्छे विकल्पों को खोजने के लिए प्रशिक्षित करती है, जिससे उन्हें उनके प्रदर्शन के आधार पर उपयोग करने का अवसर मिलता है। यह ऐसा है जैसे छात्र को कहना, "भूलभुलैया के हर वैध रास्ते से गुजरने की कोशिश करो, न कि केवल उस रास्ते की जो सबसे तेज़ दिखता है।" लक्ष्य एक विविध, लचीला विचारक बनाना है। हालाँकि, इस प्रक्रिया को विशाल, सुपर-स्मार्ट AI मॉडल तक स्केल करना (बड़ा करना) एक दुःस्वप्न रहा है। वैज्ञानिकों ने इसे काम करने के लिए जो उपकरण बनाए थे, वे इतने जटिल और अस्थिर थे कि वे अक्सर AI को क्रैश कर देते थे या उसे कुछ भी सीखने नहीं देते थे, विशेष रूपकर जब मॉडल बहुत बड़े हो जाते या कार्य बहुत अव्यवधर हो जाते।
यह शोध पत्र, जिसका शीर्षक "GFlowRL" है, ठीक इसी सिरदर्द को हल करता है। लेखकों ने पाया कि पिछले "विविध सोच" वाले नुस्खे का सबसे जटिल हिस्सा ही वास्तव में समस्या थी। उन्होंने पाया कि एक विशिष्ट गणितीय उपकरण, जिसे AI के सीखने को संतुलित करने में मदद करने के लिए बनाया गया था, वह एक सहायक मार्गदर्शक के बजाय एक शोर भरे, टूटे हुए रेडियो की तरह काम कर रहा था। उस टूटे हुए उपकरण को फेंककर और उसकी जगह एक बहुत ही सरल, ऑन-द-फ्लाई (तुरंत होने वाली) गणना का उपयोग करके, उन्होंने एक नई विधि बनाई जिसे GFlowRL कहा जाता है। यह दृष्टिकोण स्थिर, तेज़ और आश्चर्यजनक रूप से प्रभावी है। यह विशाल AI मॉडलों को बिना क्रैश हुए विविध समस्या-समाधान रणनीतियों को सीखने की अनुमति देता है, यहाँ तक कि सबसे कठिन गणित और कोडिंग चुनौतियों पर भी। वास्तव में, उनकी नई विधि ने पिछले रिकॉर्ड-धारकों को पीछे छोड़ दिया, और प्रतिस्पर्धी प्रोग्रामिंग में एक ऐसा कौशल स्तर प्राप्त किया जो वर्तमान में उपलब्ध सर्वश्रेष्ठ AI सिस्टमों के बराबर है, और यह सब प्रशिक्षण प्रक्रिया को सुचारू और स्थिर रखते हुए किया गया।
समस्या: "मैजिक कैलकुलेटर" जिसने सब कुछ तोड़ दिया
इस सफलता को समझने के लिए, हमें पहले पुराने तरीके को देखना होगा। जब शोधकर्ताओं ने विविधता के साथ AI को प्रशिक्षित करने के लिए GFlowNets का उपयोग किया, तो वे इस संतुलन को बनाए रखने के लिए एक विशेष "कैलकुलेटर" (तकनीकी रूपकी पार्टिशन फंक्शन) पर निर्भर थे। कल्पना कीजिए कि आप एक कक्षा के 1,000 छात्रों को ग्रेड देने की कोशिश कर रहे हैं। आप यह सुनिश्चित करना चाहते हैं कि यदि कोई छात्र एक चतुर, अनूठा समाधान खोजता है, तो उसे श्रेय मिले, लेकिन आपको यह भी सुनिश्चित करने की आवश्यकता है कि ग्रेड इतने अधिक न हो जाएं कि पूरा सिस्टम ही टूट जाए।
पुराना तरीका इस "कैलकुलेटर" के रूप में एक नया, छोटा AI मॉडल बनाने की कोशिश करता था। समस्या यह थी कि इस छोटे कैलकुलेटर को शून्य से सीखना था जबकि विशाल छात्र (मुख्य AI) पहले से ही एक जीनियस था। यह एक अरब डॉलर की कंपनी का बजट प्रबंधित करने के लिए एक बच्चे को नियुक्त करने जैसा था जबकि सीईओ निर्णय ले रहा हो। वह बच्चा (कैलकुलेटर) भ्रमित हो जाता, बेतरतीब नंबर चिल्लाता, और पूरे सिस्टम में घबराहट पैदा कर देता। शोधकर्ताओं ने पाया कि यह "कैलकुलेटर" वास्तव में मदद करने के बजाय नुकसान पहुँचा रहा था। यह इतना अस्थिर था कि इसने AI की सीखने की प्रक्रिया को त्रुटियों के साथ विस्फोटित कर दिया, और कई मामलों में, AI ने कैलकुलेटर को केवल रैंडम नॉइज़ (यादृच्छिक शोर) से बदलने से बेहतर कुछ भी नहीं सीखा।
समाधान: कैलकुलेटर को छोड़ें, समूह का उपयोग करें
GFlowRL के लेखकों ने एक सरल, साहसी प्रश्न पूछा: "क्या हमें वास्तव में इस टूटे हुए कैलकुलेटर की आवश्यकता है?"
उन्होंने महसूस किया कि AI पहले से ही वह काम कर रहा था जो कैलकुलेटर को करने के लिए कहा गया था। जब AI अभ्यास करता है, तो वह केवल एक उत्तर नहीं देता; वह एक साथ कई उत्तरों के एक समूह (जैसे एक फोकस ग्रुप) को आज़माता है। शोधकर्ताओं ने देखा कि वे संतुलन को समझने के लिए उसी डेटा का उपयोग कर सकते हैं जो AI ने पहले से ही उत्पन्न किया है। एक अलग, नाजुक मशीन बनाने के बजाय, उन्होंने बस अपने सामने मौजूद डेटा का उपयोग किया।
इसे ऐसे समझें: एक अलग, घबराए हुए अकाउंटेंट को यह बताने के लिए नियुक्त करने के बजाय कि टीम ने कितना कमाया है, आप बस उन रसीदों को देख लेते हैं जो टीम ने अभी आपको सौंपी हैं। यह वही जानकारी है, लेकिन यह तत्काल है, वास्तविक है, और इसके लिए किसी नई, महंगी मशीन की आवश्यकता नहीं है जो टूट सकती है।
यह सरल बदलाव—जटिल, सीखे हुए कैलकुलेटर को समूह से प्राप्त त्वरित, ऑन-द-स्पॉट अनुमान से बदलना—सब कुछ बदल गया।
- स्थिरता: जंगली, विस्फोटित त्रुटियां गायब हो गईं। प्रशिक्षण आज के मानक तरीकों की तरह सुचारू हो गया।
- सरलता: उन्हें दूसरा, अतिरिक्त मॉडल प्रशिक्षित करने की आवश्यकता नहीं थी। इससे कंप्यूटिंग शक्ति और समय की भारी बचत हुई।
- प्रदर्शन: आश्चर्यजनक रूप से, AI केवल रुका नहीं; वह बेहतर भी हुआ।
परिणाम: क्रैश होने से चैंपियन बनने तक
टीम ने इस नई विधि, GFlowRL, का परीक्षण कुछ सबसे कठिन चुनौतियों पर किया:
- गणित: उन्होंने कठिन गणित प्रतियोगिताओं पर मॉडलों को प्रशिक्षित किया। नई विधि ने AI को विविधता को बढ़ावा देने वाले किसी भी पिछले तरीके की तुलना में अधिक समस्याओं को हल करने में मदद की।
- कोडिंग: उन्होंने Codeforces जैसी प्रतिस्पर्धी प्रोग्रामिंग साइटों पर इसका परीक्षण किया। GFlowRL के साथ प्रशिक्षित एक 14-बिलियन-पैरामीटर मॉडल ने 2048 की रेटिंग प्राप्त की। संदर्भ के लिए, यह एक ऐसा कौशल स्तर है जो अविश्वसनीय रूप से उच्च है, जो पिछले ओपन-सोर्स रिकॉर्ड्स को हरा देता है और उपलब्ध सर्वश्रेष्ठ क्लोज्ड-सोर्स AI (o3-mini) के बहुत करीब, केवल 25 अंक की दूरी पर है।
- सुरक्षा (रेड टीमिंग): उन्होंने "रेड-टीमिंग" पर भी परीक्षण किया, जो AI सुरक्षा नियमों को तोड़ने का एक तरीका है ताकि यह देखा जा सके कि वे कितने मजबूत हैं। इस शोर भरे, अव्यवधर वातावरण में जहाँ पिछले तरीके पूरी तरह से विफल रहे थे, GFlowRL सफल रहा, जिसने सुरक्षा फिल्टरों पर हमला करने में उच्चतम सफलता दर हासिल की, जिससे यह सिद्ध हुआ कि यह भ्रमित करने वाले फीडबैक के बावजूद जटिल, विविध रणनीतियों को सीख सकता है।
सबसे प्रभावशाली हिस्सा यह था कि यह कितनी अच्छी तरह से स्केल (विस्तारित) हुआ। जब उन्होंने इस विधि को विशाल "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) मॉडल—सैकड़ों अरबों पैरामीटर्स वाले AI सिस्टम—पर उपयोग करने की कोशिश की, तो पिछले तरीके तुरंत क्रैश हो गए। हालाँकि, GFlowRL ने 235 बिलियन पैरामीटर्स वाले मॉडल पर भी पूरी तरह से काम करना जारी रखा।
यह क्यों मायने रखता है
यहाँ मुख्य बात यह नहीं है कि उन्होंने एक बेहतर AI ट्रेनर बनाया है; बल्कि यह है कि उन्होंने महसूस किया कि "सर्वश्रेष्ठ" तरीका हमेशा सबसे जटिल तरीका नहीं होता है। पुराने नुस्खे के अनावश्यक, अस्थिर हिस्सों को हटाकर, उन्होंने एक ऐसा रास्ता खोजा जो सरल भी है और शक्तिशाली भी।
GFlowRL सुझाव देता है कि AI को वास्तव में स्मार्ट और विविध बनाने के लिए, हमें अधिक जटिल मशीनरी की परतों को जोड़ने की आवश्यकता नहीं है। कभी-कभी, एक सुपर-इंटेलिजेंट छात्र को सिखाने का सबसे अच्छा तरीका यह है कि आप अत्यधिक इंजीनियरिंग वाले लेसन प्लान को छोड़ दें और बस उन्हें उन विचारों के समूह से सीखने दें जो वे पहले से ही उत्पन्न कर रहे हैं। यह साबित हुआ कि AI तर्क क्षमता को स्केल करने की कुंजी अधिक उपकरण जोड़ना नहीं, बल्कि यह जानना था कि किन उपकरणों को फेंक देना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।