Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization
यह शोध पत्र LLM सुदृढीकरण शिक्षण (reinforcement learning) में अन्वेषण पतन (exploration collapse) को PPO-Clip के यूक्लिडियन मेट्रिक्स और नीतियों के अंतर्निहित रीमैनियन मैनिफोल्ड (Riemannian manifold) के बीच ज्यामितीय बेमेल के परिणाम के रूप में पहचानता है, और इस दोष को सुधारने के लिए रीमैनियन आइसोमेट्रिक पॉलिसी ऑप्टिमाइज़ेशन (RIPO) का प्रस्ताव करता है, जो कई बेंचमार्क में काफी बेहतर प्रदर्शन और स्थिरता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को अविश्वसनीय रूप से कठिन गणितीय पहेलियों को हल करने के लिए प्रशिक्षित कर रहे हैं। आप चाहते हैं कि रोबोट नए, अजीब और रचनात्मक तरीकों को आज़माए, न कि केवल उन्हीं पुराने तरीकों पर टिका रहे जिन्हें वह पहले से जानता है। इसे "एक्सप्लोरेशन" (अन्वेषण) कहा जाता है। लेकिन यहाँ एक समस्या है: इस रोबोट को सिखाने के लिए उपयोग की जाने वाली मानक विधि (जिसे PPO-Clip कहा जाता है) में एक छिपा हुआ बग है। यह ऐसा है जैसे आप सड़क की व्यस्तता के आधार पर खिंचने और सिकुड़ने वाले पैमाने (रूलर) का उपयोग करके दो शहरों के बीच की दूरी मापने की कोशिश कर रहे हों।
बग: "एक ही आकार का" पैमाना (The "One-Size-Fits-All" Ruler)
वर्तमान विधि रोबोट द्वारा किए गए प्रत्येक बदलाव को इस बात की परवाह किए बिना एक ही आकार का मानती है कि वह कदम उठाने की संभावना कितनी थी।
- उच्च-संभावना वाला जाल (The High-Probability Trap): यदि रोबोट पहले से ही किसी निश्चित पथ पर चलने के लिए 80% आश्वस्त है, तो मानक विधि उसे बहुत आक्रामक तरीके से आगे बढ़ने देती है, जिससे वह पथ और भी प्रभावी हो जाता है। यह स्कूल के एक लोकप्रिय बच्चे की तरह है जिसे और अधिक ध्यान मिलता है, जबकि एक शांत बच्चे को अनदेखा कर दिया जाता है।
- कम-संभावना वाला जाल (The Low-Probability Trap): यदि रोबोट किसी दुर्लभ, संभावित रूप से शानदार पथ के लिए केवल 1% आश्वस्त है, तो मानक विधि उसे बहुत कम हिलने-डुलने की अनुमति देती है। यह एक भारी पत्थर को पंख से धकेलने की कोशिश करने जैसा है। भले ही वह दुर्लभ पथ पहेली को हल करने की कुंजी हो, रोबोट उसे आज़माने से बहुत डरता है।
इस शोध पत्र के लेखकों ने पाया कि यह "एक ही आकार का" दृष्टिकोण गणितीय रूप से गलत है। उन्होंने पाया कि जहाँ रोबोट के निर्णय लिए जाते हैं, वह स्थान एक कागज़ की तरह सपाट (यूक्लिडियन) नहीं है; बल्कि वह एक ग्लोब की सतह की तरह घुमावदार (रीमानियन) है। एक घुमावदार सतह पर, एक ही आकार का कदम अलग-तलग स्थानों पर बहुत अलग दिखता है। पुराने तरीके ने इस घुमाव को अनदेखा कर दिया, जिससे रोबोट एक ही ढर्रे में फंस गया और उसने अन्वेषण करना छोड़ दिया। इसे ही शोध पत्र में "एक्सप्लोरेशन कोलैप्स" (अन्वेषण पतन) कहा गया है।
समाधान: "स्मार्ट रूलर" (RIPO)
इस समस्या को ठीक करने के लिए, लेखकों ने एक नई विधि बनाई जिसे रीमानियन आइसोमेट्रिक पॉलिसी ऑप्टिमाइज़ेशन (RIPO) कहा जाता है। RIPO को एक ऐसे "स्मार्ट रूलर" के रूप में सोचें जो इलाके को जानता है।
- लोकप्रिय पथों के लिए: यह लगाम को कस देता है, जिससे रोबोट को बहुत अधिक आत्मविश्वासी होने और केवल एक ही समाधान पर टिके रहने से रोका जा सके।
- दुर्लभ पथों के लिए: यह लगाम को ढीला कर देता है, जिससे रोबोट को उन छिपे हुए, रचनात्मक समाधानों को खोजने के लिए बड़े और साहसी कदम उठाने की अनुमति मिलती है।
ऐसा करके, RIPO यह सुनिश्चित करता है कि रोबोट द्वारा लिया गया प्रत्येक कदम उस घुमावदार निर्णय मानचित्र पर तय की गई वास्तविक दूरी के संदर्भ में "निष्पक्ष" हो। यह रोबोट को संतुलित रखता है: वह जो काम करता है उसका उपयोग करना जारी रखता है (एक्सप्लॉइटेशन) लेकिन बेहतर कुछ खोजने के लिए कभी भी रुकता नहीं है (एक्सप्लोरेशन)।
शोध पत्र क्या कहता है (और क्या नहीं कहता)
लेखक अपने निष्कर्षों के बारे में बहुत स्पष्ट हैं। वे इस विचार को खारिज करते हैं कि केवल पुराने तरीके में संख्याओं को थोड़ा बदलने से (जैसे कि दुर्लभ चालों के लिए "लगाम" को थोड़ा लंबा करना) वास्तविक समाधान मिल जाएगा। उनका तर्क है कि पिछले प्रयास केवल "लक्षण संबंधी सुधार" थे—जैसे कि हड्डी को ठीक किए बिना टूटी हुई टांग पर बैंड-एड लगाना। शोध पत्र दिखाता है कि बिना निर्णय स्थान की ज्यामिति (आकार) को ठीक किए, रोबोट अंततः एक उबाऊ और गैर-रचनात्मक अवस्था में गिर जाएगा।
परिणाम: एक बड़ी छलांग
टीम ने विभिन्न आकारों के चार अलग-अलग रोबोट मस्तिष्क (LLMs) पर इस नए "स्मार्ट रूलर" का परीक्षण किया और उन्हें सात अन्य शीर्ष-स्तरीय प्रशिक्षण विधियों के साथ सात अत्यंत कठिन गणित प्रतियोगिताओं (जैसे AIME24, AMC23, और HMMT25) में मुकाबला कराया।
परिणाम चौंकाने वाले थे। AIME24 बेंचमार्क पर, नई विधि (RIPO) ने GRPO एल्गोरिदम के प्रदर्शन में 60% तक सुधार किया। वास्तव में, Qwen3-8B मॉडल पर, RIPO ने AIME24 पर 43.8 स्कोर किया, जबकि अगली सर्वश्रेष्ठ विधि (DCPO) केवल 36.3 ही प्राप्त कर सकी।
लेकिन यह केवल गणित के बारे में नहीं था। शोध पत्र ने यह भी दिखाया कि यह विधि कोडिंग कार्यों (जैसे Codeforces) और खोज कार्यों (जैसे TriviaQA) पर भी काम करती है, जो यह सिद्ध करता है कि "घुमावदार मानचित्र" की समस्या एक सार्वभौमिक मुद्दा है, न कि केवल गणित की समस्या।
यह क्यों महत्वपूर्ण है? लेखकों ने केवल यह नहीं कहा कि "यह बेहतर काम करता है।" उन्होंने रोबोट की "एंट्रॉपी" (एक फैंसी शब्द जिसका अर्थ है उसके विकल्पों की विविधता) को मापा। पुराने तरीकों में रोबोट के विकल्प शून्य के करीब गिरते देखे गए (उसने रचनात्मक रूप से सोचना बंद कर दिया), जबकि RIPO ने रोबोट के विकल्पों को विविध और स्वस्थ बनाए रखा। उन्होंने "ग्रेडिएंट नॉर्म" (सीखने की प्रक्रिया कितनी अस्थिर थी) को भी देखा। पुराने तरीके जंगली स्पाइक्स के साथ एक रोलरकोस्टर की तरह थे, लेकिन RIPO एक सुचारू, स्थिर सवारी की तरह था।
संक्षेप में, शोध पत्र सुझाव देता है कि रोबोट कैसे निर्णय लेते हैं, इसके वास्तविक, घुमावदार आकार का सम्मान करके, हम उन्हें फंसने से रोक सकते हैं और उन्हें उन समस्याओं को हल करने में मदद कर सकते हैं जो पहले असंभव थीं। यह एक सपाट, टूटे हुए पैमाने के बजाय एक घुमावदार, पूर्ण पैमाने का उपयोग करने की ओर एक बदलाव है, और डेटा दिखाता है कि यह रोबोट कितने स्मार्ट बन सकते हैं, इसमें कितना बड़ा अंतर पैदा करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।