ReLaX: Reasoning with Latent Exploration for Large Reasoning Models
यह शोध पत्र ReLaX को प्रस्तुत करता है, जो एक नया डायनेमिक स्पेक्ट्रल डिस्पर्शन (Dynamic Spectral Dispersion) मीट्रिक के माध्यम से लार्ज रीजनिंग मॉडल्स (Large Reasoning Models) की लेटेंट डायनेमिक्स का विश्लेषण और विनियमन करने के लिए कूपमैन ऑपरेटर थ्योरी (Koopman operator theory) का लाभ उठाता है, जिससे मानक RLVR विधियों के ओवर-डिटरमिनिज्म (over-determinism) पर विजय प्राप्त होती है और अधिक प्रभावी एक्सप्लोरेशन-एक्सप्लोइटेशन ट्रेडऑफ के माध्यम से बेहतर रीजनिंग प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान लेकिन जिद्दी छात्र (AI) को जटिल पहेलियाँ, जैसे कि उन्नत गणित की समस्याएँ या दृश्य पहेलियाँ (visual riddles) हल करना सिखा रहे हैं। आप चाहते हैं कि वे सबसे अच्छा समाधान खोजने के लिए सोचने के विभिन्न तरीकों को खोजें।
कुछ समय से, ऐसे छात्रों को सिखाने का मानक तरीका Reinforcement Learning with Verifiable Rewards (RLVR) रहा है। इसे एक सख्त कोच की तरह समझें जो केवल तभी "अच्छा काम किया!" कहता है जब छात्र सही उत्तर देता है।
समस्या: "सुरक्षित दांव" का जाल (The "Safe Bet" Trap)
यह शोध पत्र तर्क देता है कि इस सख्त कोचिंग का एक दुष्प्रभाव होता है। छात्र गलतियाँ करने से डरने लगता है। वह नए, रचनात्मक दृष्टिकोणों को आज़माना बंद कर देता है और उन्हीं कुछ "सुरक्षित" रणनीतियों को दोहराने लगता है जो आमतौर पर काम करती हैं। AI के संदर्भ में, इसे entropy collapse कहा जाता है। छात्र बहुत कठोर, बहुत नियत (deterministic) हो जाता है, और अन्वेषण (explore) करना बंद कर देता है। वह एक ढर्रे में फंस जाता है, और कठिन समस्याओं को हल करने में असमर्थ हो जाता है क्योंकि वह लीक से हटकर सोचना भूल गया है।
मौजूदा समाधानों ने इसे ठीक करने की कोशिश की, जैसे कि छात्र को शब्द स्तर पर "रैंडम" होने के लिए मजबूर करना (उदाहरण के लिए, "यहाँ एक अलग शब्द बोलो!")। लेकिन लेखक कहते हैं कि यह कार को अलग रंग से पेंट करके इंजन को ठीक करने की कोशिश करने जैसा है। यह सतह को बदलता है, लेकिन आंतरिक यांत्रिकी (mechanics) को नहीं।
समाधान: ReLaX (Reasoning with Latent Exploration)
लेखक एक नया ढांचा प्रस्तावित करते हैं जिसे ReLaX कहा जाता है। छात्र के बोले गए शब्दों को देखने के बजाय, ReLaX छात्र के बोलने से पहले के छिपे हुए, आंतरिक विचारों को देखता है।
यहाँ उपमा दी गई है:
- पुराना तरीका (Token-Level): आप छात्र के मुँह को देखते हैं। यदि वे कहते हैं "उत्तर 5 है," तो आप जाँचते हैं कि क्या यह सही है। यदि वे अटक जाते हैं, तो आप उनसे कहते हैं, "इसके बजाय '4' बोलने की कोशिश करो।"
- ReLaX का तरीका (Latent Exploration): आप छात्र के मस्तिष्क के भीतर देखते हैं। आप देखते हैं कि उनकी आंतरिक विचार प्रक्रिया एक कठोर, दोहराव वाले लूप में बदल गई है। ReLaX एक विशेष गणितीय उपकरण (Koopman Operator Theory) का उपयोग करता है ताकि इन छिपे हुए विचारों को एक स्पष्ट, रैखिक चार्ट (linear chart) में मैप किया जा सके।
जादुई मीट्रिक: DSD
एक बार जब वे इन छिपे हुए विचारों को स्पष्ट रूप से देख पाते हैं, तो वे एक नया स्कोर पेश करते हैं जिसे DSD (Dynamic Spectral Dispersion) कहा जाता है।
कल्पना कीजिए कि छात्र का मस्तिष्क एक संगीत ऑर्केस्ट्रा है।
- कम DSD (समस्या): ऑर्केस्ट्रा बार-बार वही तीन स्वर बजा रहा है। यह उबाऊ, कठोर और अनुमानित है। छात्र फंसा हुआ है।
- उच्च DSD (लक्ष्य): ऑर्केस्ट्रा एक समृद्ध, जटिल सिम्फनी बजा रहा है जिसमें कई अलग-अलग वाद्य यंत्र और धुनें हैं। छात्र कई अलग-अलग कोणों की खोज कर रहा है।
ReLaX इस DSD स्कोर का उपयोग "कोच की सीटी" के रूप में करता है। यह AI को बताता है: "हे, तुम्हारी आंतरिक सोच बहुत उबाऊ होती जा रही है (कम DSD)। तुम्हें चीज़ों को बदलने और अधिक विविध रास्तों की खोज करने की आवश्यकता है, लेकिन केवल तभी जब वे रास्ते वास्तव में आपको सही उत्तर तक पहुँचा रहे हों।"
यह बेहतर क्यों है?
- यह मूल कारण को ठीक करता है: यह केवल रैंडम शब्द बोलने के बजाय, लचीली सोच को प्रोत्साहित करता है।
- यह स्मार्ट अन्वेषण है: यह केवल यह नहीं कहता कि "रैंडम बनो।" यह कहता है, "रचनात्मक बनो, लेकिन उस पथ पर रहो जो पुरस्कार की ओर ले जाता है।" यह exploration (नया प्रयास करना) और exploitation (जो काम करता है उसका उपयोग करना) के बीच संतुलन बनाता है।
- यह हर चीज़ के लिए काम करता है: पेपर ने टेक्स्ट-ओनली मॉडल (जैसे गणित ट्यूटर) और मल्टीमॉडल मॉडल (जैसे एक रोबोट जो चित्र देखता है और टेक्स्ट पढ़ता है) दोनों पर इसका परीक्षण किया। दोनों ही मामलों में, ReLaX ने AI को पहले की तुलना में कठिन समस्याओं को हल करने में मदद की।
परिणाम
ReLaX का उपयोग करके, AI मॉडल केवल थोड़े बेहतर नहीं हुए; वे नए स्टेट-ऑफ-द-आर्ट स्तरों तक पहुँच गए। उन्होंने अपने "सुरक्षित दांव" के ढर्रों से बाहर निकलना, संभावित समाधानों के विशाल परिदृश्य की खोज करना और अधिक विश्वसनीय रूप से सर्वोत्तम उत्तर खोजना सीख लिया।
संक्षेप में: ReLaX AI को केवल उत्तर याद करने वाले रोबोट बनने से रोकता है और उसे एक वास्तविक विचारक में बदल देता है जो खोज करता है, अनुकूलित होता है, और गहराई से तर्क करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।