SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation
यह शोध पत्र SoftmaxGRPO को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो आसान प्रॉम्प्ट्स पर विचलनकारी वेटिंग (divergent weighting) को रोकने के लिए z-स्कोर नॉर्मलाइजेशन के स्थान पर टेम्परेचर-स्केल्ड सॉफ्टमैक्स एडवांटेज का उपयोग करती है, जिससे ग्रेडिएंट बजट को अधिक प्रभावी ढंग से पुनर्वितरित किया जा सके और मानक GRPO की तुलना में DeepMath और Poetry जैसे कार्यों पर रीजनिंग प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को पहेलियाँ सुलझाना सिखाने की कोशिश कर रहे हैं। आप उसे समस्याओं का एक ढेर देते हैं, और हर बार जब वह एक को हल करने की कोशिश करता है, तो उसे एक सरल "हाँ" या "नहीं" ग्रेड मिलता है। यदि वह सही करता है, तो उसे एक हाई-फाइव मिलता है; यदि वह गलत करता है, तो उसे एक कोमल "फिर से प्रयास करें" मिलता है। यह रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) की दुनिया है, जहाँ एक AI परीक्षण और त्रुटि (trial and error) के माध्यम से सीखता है। लेकिन यहाँ पेचीदा हिस्सा यह है: आप रोबोट को यह कैसे बताएंगे कि सीखने के लिए किन विशिष्ट प्रयासों पर सबसे अधिक ध्यान देना चाहिए?
अतीत में, शोधकर्ताओं ने GRPO (ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन) नामक एक विधि का उपयोग किया था। GRPO को एक ऐसे शिक्षक के रूप में सोचें जो दस छात्रों के उत्तरों के एक समूह को देखता है। यदि नौ छात्र एक प्रश्न सही हल करते हैं और एक गलत करता है, तो शिक्षक उस एक पर बहुत अधिक ध्यान केंद्रित करता है जो असफल रहा। लेकिन यदि सभी दस छात्र एक प्रश्न सही हल करते हैं (एक "आसान" प्रश्न), तो शिक्षक भ्रमित हो जाता है। क्योंकि GRPO में इस्तेमाल होने वाली गणित "औसत" अंतर को खोजने की कोशिश करती है, यह अनजाने में उन प्रश्नों पर सबसे ज़ोर से चिल्लाती है जिन्हें छात्र पहले से ही हल करना जानते हैं, जबकि कठिन वाले पर फुसफुसाती है। यह एक कोच की तरह है जो एक स्टार खिलाड़ी पर एक आसान ले-अप मिस करने के लिए चिल्लाता है, जबकि उस नौसिखिया को अनदेखा कर देता है जो ड्रिबल करने के लिए संघर्ष कर रहा है। यह रोबोट की दिमागी शक्ति को उन चीजों पर बर्बाद करता है जो वह पहले से जानता है, जिससे वह नया सीखने के लिए अटक जाता है।
यह पेपर SoftmaxGRPO नामक एक नई विधि पेश करता है। उस भ्रमित करने वाले "औसत" गणित के बजाय, लेखक एक "टेम्परेचर-स्केल्ड सॉफ्टमैक्स" (temperature-scaled softmax) दृष्टिकोण का सुझाव देते हैं। एक हीट मैप की कल्पना करें जहाँ रोबलेट का ध्यान स्वाभाविक रूप से सबसे दिलचस्प प्रयासों की ओर आकर्षित होता है। यदि कोई प्रश्न आसान है और रोबोट उसे सही करता है, तो विधि कहती है, "अच्छा काम किया, लेकिन हमें इस पर बहुत अधिक अध्ययन करने की आवश्यकता नहीं है।" यदि कोई प्रश्न कठिन है और रोबोट संघर्ष करता है, तो विधि कहती है, "यह वह है जिस पर हमें ध्यान देने की आवश्यकता है!" यह एक स्मार्ट फिल्टर की तरह कार्य करता है जो स्वचालित रूप से रोबोट का ध्यान आसान समस्याओं से हटाकर उन पर केंद्रित करता है जहाँ वह वास्तव में सीख सकता है। शोधकर्ताओं ने गणितीय समस्याओं, रचनात्मक लेखन और मीटिंग सारांश (summarizing meetings) पर इसका परीक्षण किया, और पाया कि उनकी नई विधि ने पुराने तरीके की तुलना में लगातार रोबोट को तेज़ी से और बेहतर तरीके से सीखने में मदद की, भले ही उन्हें प्राप्त "ग्रेड" केवल अनुमानित स्कोर ही क्यों न हों।
समस्या: वह शिक्षक जो सितारों पर चिल्लाता है
आइए AI और उसके शिक्षक की कहानी में गहराई से उतरें। AI की दुनिया में, हम अक्सर ग्रुप-बेस्ड रीइन्फोर्समेंट लर्निंग नामक एक तकनीक का उपयोग करते हैं। कल्पना कीजिए कि आप एक AI को गणित की समस्या हल करने के लिए कहते हैं। केवल एक बार प्रयास करने के बजाय, आप उसे दस अलग-अलग तरीकों से प्रयास करने के लिए कहते हैं (इन्हें "रोलआउट्स" कहा जाता है)। फिर आप उन सभी दस उत्तरों को एक साथ देखते हैं।
पुरानी विधि, GRPO, एक ऐसे शिक्षक की तरह काम करती है जो समूह के "औसत" प्रदर्शन की गणना करता है। यदि AI किसी प्रश्न को सही हल करता है, तो GRPO उसे एक रिवॉर्ड (पुरस्कार) देता है। यदि वह गलत होता है, तो यह कम रिवॉर्ड देता है। समस्या आसान प्रश्नों के साथ आती है। यदि AI गणित के एक विशिष्ट प्रकार के प्रश्न में पहले से ही बहुत अच्छा है, तो वह लगभग दसों प्रयासों को सही हल करेगा। पुराने GRPO गणित में, यह एक अजीब स्थिति पैदा करता है: क्योंकि "औसत" बहुत अधिक है, "परफेक्ट" उत्तरों और "लगभग परफेक्ट" उत्तरों के बीच के सूक्ष्म अंतर को बहुत बढ़ा-चढ़ाकर दिखाया जाता है। गणित अंततः AI को उन प्रश्नों पर अपना व्यवहार बदलने के लिए चिल्लाकर निर्देश देने लगता है जिन्हें उसने पहले ही महारत हासिल कर ली है। यह एक कोच की तरह है जो एक पेशेवर बास्केटबॉल खिलाड़ी को एक इंच की चूक के लिए फ्री थ्रो मिस करने पर डांट रहा है, जबकि एक नौसिखिए को अनदेखा कर रहा है जो गेंद पकड़ने तक के लिए संघर्ष कर रहा है। AI अपनी ऊर्जा उन चीजों को "ठीक" करने में बर्बाद करता है जो पहले से ही ठीक हैं, जिससे उसके पास कुछ नया सीखने के लिए कोई ऊर्जा नहीं बचती।
समाधान: एक स्मार्ट हीट मैप
राइस यूनिवर्सिटी के लेखकों ने SoftmaxGRP0 नामक एक समाधान प्रस्तावित किया। उन्होंने महसूस किया कि "z-score" (जो एक संख्या के औसत से अंतर को मापता है) का उपयोग करने के बजाय, उन्हें softmax फ़ंक्शन का उपयोग करना चाहिए।
सॉफ्टमैक्स को ध्यान के लिए एक "हीट मैप" के रूप में सोचें। यह रिवॉर्ड्स (ग्रेड) को लेता है और उन्हें एक विशेष फॉर्मूले का उपयोग करके वेट्स (weights) में बदल देता है जिसमें एक "तापमान" सेटिंग (जिसे कहा जाता है) शामिल होती है।
- उच्च तापमान (High Temperature): हीट मैप सपाट है। प्रत्येक प्रयास को लगभग समान ध्यान मिलता है। यह पुराने REINFORCE मेथड की तरह है, जहाँ AI धीरे और बेतरतीब ढंग से सीखता है।
- कम तापमान (Low Temperature): हीट मैप बहुत तीक्ष्ण (sharp) हो जाता है। AI सबसे अच्छे प्रयासों पर तीव्रता से ध्यान केंद्रित करता है और बाकी को अनदेखा कर देता है। यह MaxRL मेथड की तरह है, जो एक एकल सर्वश्रेष्ठ उत्तर खोजने के लिए बेहतरीन है लेकिन अस्थिर हो सकता है।
SoftmaxGRPO बिल्कुल बीच में स्थित है। यह एक सुचारू वक्र (smooth curve) बनाने के लिए तापमान सेटिंग का उपयोग करता है। यदि AI एक आसान प्रश्न सही करता है, तो हीट मैप ठंडा रहता है, जो AI को कहता है, "अच्छा काम किया, आगे बढ़ो।" यदि AI एक कठिन प्रश्न गलत करता है, तो हीट मैप गर्म रहता है, जो AI को कहता, "यह महत्वपूर्ण है, इसे पढ़ो!"
जादू यह है कि यह विधि वेट्स को सीमित (bounded) रखती है। प्रश्न कितना भी आसान क्यों न हो, "चिल्लाना" कभी अनंत नहीं होता। यह AI को आसान प्रॉम्प्ट्स पर अपनी दिमागी शक्ति बर्बाद करने से रोकता है।
उन्होंने क्या पाया: प्रमाण के साथ निष्कर्ष
लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने गणित लगाया और परीक्षण किए।
1. गणित ठोस है (बाइनरी रिवॉर्ड्स के लिए)
उन प्रश्नों के लिए जिनके उत्तर सरल "सही" या "गलत" (बाइनरी रिवॉर्ड्स) होते हैं, उन्होंने सिद्ध किया कि SoftmaxGRPO एक आदर्श, सुचारू ऑब्जेक्टिव बनाता है। उन्होंने दिखाया कि जैसे-जैसे तापमान कम होता है, यह विधि स्वाभाविक रूप से MaxRL (एक ऐसी विधि जो सर्वोत्तम परिणाम पर ध्यान केंद्रित करती है) में बदल जाती है, और जैसे-जैसे समूह का आकार बहुत बड़ा होता है, यह Maximum Likelihood (सीखने का स्वर्ण मानक) की तरह व्यवहार करती है। महत्वपूर्ण रूप से, उन्होंने सिद्ध किया कि GRPO के विपरीत, SoftmaxGRPO आसान प्रश्नों पर कभी भी अनियंत्रित (blow up) नहीं होता है।
2. जादू की सीमाएँ
उन्होंने एक सीमा भी पाई। यदि रिवॉर्ड केवल "सही" या "गलत" नहीं हैं बल्कि कई स्तरों के हैं (जैसे 1 से 100 तक के कई चरणों वाला स्कोर), तो गणित जटिल हो जाता है। उन्होंने दिखाया कि तीन या अधिक रिवॉर्ड स्तरों वाले समूहों के लिए, आप हमेशा एक एकल, पूर्ण "स्केलर ऑब्जेक्टिव" (एक सरल सूत्र) नहीं पा सकते जो हर समूह आकार के लिए काम करे। इसका मतलब है कि यह विधि सरल "सही/गलत" परिदृश्यों के लिए सैद्धांतिक रूप से सबसे सटीक है, लेकिन जटिल स्कोर के लिए भी व्यावहारिक रूप से अच्छी तरह काम करती है।
3. वास्तविक दुनिया के परिणाम
उन्होंने एक 1.5-बिलियन-पैरामीटर वाले मॉडल (एक मध्यम आकार का AI) पर कई कार्यों के लिए परीक्षण किया:
- गणित (GSM8K, Countdown, DeepMath): जब "परफेक्ट वर्िफायर" रिवॉर्ड्स (जहाँ कंप्यूटर सटीक उत्तर की जाँच करता है) का उपयोग किया गया, तो SoftmaxGRPO ने DeepMath पर 51.8% सटीकता प्राप्त की, जो पुराने GRPO को पीछे छोड़ देती है। Countdown पर, इसने 58.1% हासिल किया।
- रचनात्मक लेखन (कविता): यहाँ मामला बहुत दिलचस्प हो गया। कविता के लिए, कोई "सही" उत्तर नहीं होता। आप केवल एक "समानता स्कोर" (कविता एक अच्छे उदाहरण के कितने करीब है) का उपयोग कर सकते हैं। ये "कमजोर" और शोर वाले रिवॉर्ड्स हैं। पुराना GRPO यहाँ संघर्ष करता था। हालाँकि, SoftmaxGRPO ने एक मॉडल को जो 35.0% से शुरू हुआ था, उसे कविता पर 68.0% तक पहुँचा दिया। यह एक विशाल उछाल है, जो सिद्ध करता है कि यह विधि तब भी काम करती है जब शिक्षक पूर्ण न हो।
- सारांश (MeetingBank): इसने सारांश स्कोर को 35% से बढ़ाकर 70% कर दिया।
4. ध्यान कहाँ जाता है
सबसे महत्वपूर्ण प्रमाण यह देखकर मिला कि AI ने अपने "ग्रेडिएंट बजट" (उसकी सीखने की ऊर्जा) को कहाँ खर्च किया।
- पुराना GRPO: इसने "लगभग हल किए गए" प्रॉम्प्ट्स (वे प्रश्न जिन्हें AI पहले से ही 90%+ संभावना के साथ सही हल करने वाला था) पर अपनी 36.4% ऊर्जा खर्च की। यह आसान चीजों पर समय बर्बाद कर रहा था।
- SoftmaxGRPO: इसने उन आसान प्रॉम्प्ट्स पर केवल 10.0% ऊर्जा खर्च की। इसने उस ऊर्जा को कठिन प्रश्नों की ओर स्थानांतरित कर दिया जहाँ AI संघर्ष कर रहा था (20% से 90% की सीमा में)।
मुख्य निष्कर्ष
यह पेपर सुझाव देता है कि केवल "महत्व" की गणना करने के तरीके को एक मानक औसत से बदलकर एक तापमान-स्केल्ड सॉफ्टमैक्स में बदलकर, हम AI के सीखने के तरीके में एक बड़ी खामी को ठीक कर सकते हैं। यह AI को उन चीजों के प्रति जुनूनी होने से रोकता है जिन्हें वह पहले से जानता है और उसे उन चुनौतियों पर ध्यान केंद्रित करने के लिए मजबूर करता है जो वास्तव में उसे स्मार्ट बनाएंगी।
हालाँकि गणित "सही/गलत" रिवॉर्ड्स के लिए सबसे अधिक सटीक है, प्रयोगों से पता चलता है कि यह कविता लिखने या मीटिंग सारांश जैसे धुंधले, कमजोर रिवॉर्ड्स के साथ भी अद्भुत काम करता है। यह एक "ड्रॉप-इन" रिप्लेसमेंट है, जिसका अर्थ है कि यह कोड में एक छोटा सा बदलाव है जो यह सुधार लाता है कि AI कैसे तर्क करना सीखता है। लेखक निष्कर्ष निकालते हैं कि यह विधि सीखने के संकेतों को पुनर्वितरित करने का एक मजबूत तरीका है, जो यह सुनिश्चित करता है कि AI अपना समय वहीं बिताए जहाँ इसकी सबसे अधिक आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।