Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models
यह शोध पत्र लेटेंट एक्सप्लोरेशन डिकोडिंग (LED) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त डिकोडिंग रणनीति है जो पोस्ट-ट्रेन्ड लार्ज रीजनिंग मॉडल्स में एक्सप्लोरेशन कोलैप्स का मुकाबला करने के लिए हाई-एन्ट्रॉपी इंटरमीडिएट लेयर पोस्टीरियर्स का लाभ उठाती है, जिससे कई बेंचमार्क पर सटीकता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र "Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
बड़ी समस्या: "अति-आत्मविश्वासी" जीनियस
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र (एक AI मॉडल) है जो गणित और कोडिंग में कमाल का है। उन्हें और भी बेहतर बनाने के लिए, आप उन्हें रीइन्फोर्समेंट लर्निंग (RL) नामक एक कठोर प्रशिक्षण शिविर (training camp) में डालते हैं।
इस शिविर में, छात्र को एक समस्या दी जाती है। यदि वे पहली बार में ही सही उत्तर देते हैं, तो उन्हें एक गोल्ड स्टार मिलता है। यदि वे गलत होते हैं, तो उन्हें लाल 'X' मिलता है। हजारों प्रयासों के बाद, छात्र अविश्वसनीय रूप से आत्मविश्वासी हो जाता है। वह सही उत्तर तक पहुँचने का ठीक एक रास्ता सीख लेता है और उसे पूरी तरह से याद कर लेता है।
समस्या:
अब, कल्पना कीजिए कि आप इस छात्र को एक समस्या हल करने के लिए कहते हैं, लेकिन आप उनसे कहते हैं, "हे, इस समस्या को हल करने के अलग-अलग तरीके सोचने की कोशिश करो। शायद किसी अलग कोण से देखो?"
चूंकि छात्र अपने प्रशिक्षण के कारण इतना अति-आत्मविश्वासी हो गया है, वह आपकी बात अनसुनी कर देता है। वह कहता है, "नहीं, मुझे पता है कि सही तरीका क्या है। मुझे कुछ और आज़माने की ज़रूरत नहीं है।"
तकनीकी शब्दों में, AI "एक्सप्लोरेशन कोलैप्स" (Exploration Collapse) का शिकार हो गया है। वह अपने अंतिम उत्तर के प्रति इतना आश्वस्त हो गया है कि वह अन्य संभावनाओं को तलाशने से इनकार करता है, भले ही वे अन्य संभावनाएँ एक बेहतर समाधान की ओर ले जा सकती हों। यदि आप "रैंडमनेस डायल" (temperature) को बढ़ाकर उसे "कम निश्चित" बनाने की कोशिश करते हैं, तो वह भ्रमित हो जाता है और उसका प्रदर्शन और भी खराब हो जाता है।
खोज: "छिपी हुई लाइब्रेरी"
शोधकर्ताओं ने कुछ बहुत ही दिलचस्प देखा। जबकि छात्र का अंतिम उत्तर (उनके मस्तिष्क की अंतिम परत) कठोर और अति-आत्मविश्वासी है, उनकी विचार प्रक्रिया (मध्यवर्ती परतें/intermediate layers) अभी भी अव्यवस्थित, अनिश्चित और विचारों से भरी हुई है।
इसे इस तरह सोचें:
- अंतिम परत (The Final Layer): यह छात्र का मुँह है। यह 100% निश्चितता के साथ कहता है, "उत्तर 42 है!"
- मध्यवर्ती परतें (The Intermediate Layers): यह छात्र का आंतरिक एकालाप (internal monologue) है। यह फुसफुसा रहा है, "शायद यह 42 है... लेकिन रुकिए, क्या होगा अगर मैं 43 आज़माऊं? या क्या होगा अगर मैं इसे किसी अलग नज़रिए से देखूँ? हम्म, मैं अभी भी पक्का नहीं हूँ।"
शोधकर्ताओं ने महसूस किया कि जबकि मुँह बंद है, आंतरिक एकालाप अभी भी खुला है और खोज (explore) कर रहा है। उन्होंने इसे "लेटेंट एंट्रॉपी रिज़र्वोइर" (Latent Entropy Reservoir) कहा (एक फैंसी तरीका जिसका अर्थ है "अनिश्चितता का छिपा हुआ भंडार")।
समाधान: "लेटेंट एक्सप्लोरेशन डिकोडिंग" (LED)
शोधकर्ताओं ने AI से बात करने का एक नया तरीका बनाया जिसे "लेटेंट एक्सप्लोरेशन डिकोडिंग" (LED) कहा जाता है। केवल AI के आत्मविश्वासी अंतिम उत्तर को सुनने के बजाय, LED एक स्मार्ट संपादक की तरह काम करता है जो छात्र की पूरी विचार प्रक्रिया को सुनता है।
LED कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:
- फुसफुसाहटों को सुनें: अंतिम उत्तर का इंतज़ार करने के बजाय, LED AI के मस्तिष्क की मध्य परतों से आने वाली "फुसफुसाहटों" (संभावनाओं) को देखता है।
- शोर को फ़िल्टर करें: यह पागल और असंभव विचारों (जैसे "उत्तर बैंगनी है") को अनदेखा करता है और केवल तर्कसंगत विचारों (जैसे "शायद 42, शायद 43") को रखता है।
- "क्या-अगर" का मिश्रण: यह मध्य-परत के विचारों को आपस में मिलाता है। यह पूछता है, "यदि हम इन सभी 'शायद' वाले विचारों को मिला दें, तो कौन सा संयोजन सबसे दिलचस्प विविधता देगा?"
- सबसे अच्छा रास्ता चुनें: यह विचार प्रक्रिया के उस विशिष्ट क्षण को ढूँढता है जहाँ AI नए विचारों के लिए सबसे अधिक खुला (उच्चतम एंट्रॉपी) होता है और अगले शब्द को तय करने के लिए उसका उपयोग करता है।
- जानें कि कब रुकना है: यदि AI किसी स्पष्ट चीज़ के बारे में बात कर रहा है (जैसे "आसमान नीला है"), तो LED उसे आत्मविश्वास से बोलने देता है। लेकिन यदि AI किसी कठिन गणित की समस्या पर अटका हुआ है, तो LED उसे रुकने और अलग-अलग कोणों से सोचने के लिए मजबूर करता है।
उपमा: जासूस और जासूसों की टीम
कल्पना कीजिए कि एक जासूस (AI) अपराध को सुलझाने की कोशिश कर रहा है।
- पुराना तरीका (Standard Decoding): जासूस अपने पहले संदेह के प्रति इतना आत्मविश्वासी है कि वह केवल उसी एक सुराग का पीछा करता है। यदि वह गलत है, तो वह असली अपराधी को मिस कर देता है।
- "टेम्परेचर" (Temperature) के साथ समस्या: यदि आप जासूस को "कम आत्मविश्वासी" होने के लिए कहते हैं, तो वह बस रैंडम सुरागों का पीछा करने लगता है और खो जाता है।
- LED का तरीका: जासूस के पास जूनियर जासूसों (मध्यवर्ती परतें) की एक टीम है जो अभी भी मंथन (brainstorming) कर रही है। सीनियर जासूस (अंतिम परत) आमतौर पर उन्हें अनदेखा कर देता है। LED एक नया नियम है जो कहता है: "अपना अंतिम सिद्धांत तय करने से पहले, देखें कि जूनियर जासूस क्या फुसफुसा रहे हैं। यदि उनके पास कई अलग-अलग, तर्कसंगत सिद्धांत हैं, तो उस एक को चुनें जो सबसे अधिक विकल्प खुले रखता है।"
परिणाम
जब शोधकर्ताओं ने इस नई पद्धति का परीक्षण किया:
- बेहतर सफलता दर: AI ने पहली बार में ही अधिक समस्याओं को सही ढंग से हल किया।
- बेहतर एक्सप्लोरेशन: जब 16 बार प्रयास करने की अनुमति दी गई, तो AI ने सही उत्तर बहुत अधिक बार ढूँढा क्योंकि वह वास्तव में अलग-अलग रास्तों को आज़मा रहा था, न कि केवल अपने एक ही आत्मविश्वासी (लेकिन गलत) रास्ते को दोहरा रहा था।
- कोई अतिरिक्त लागत नहीं: इसके लिए AI को फिर से प्रशिक्षित करने या अधिक कंप्यूटिंग पावर जोड़ने की आवश्यकता नहीं थी। यह केवल AI के सोचने के दौरान उसके मन को पढ़ने का एक स्मार्ट तरीका था।
सारांश
यह शोध पत्र उस बग (bug) को ठीक करता है जहाँ स्मार्ट AI मॉडल बहुत अधिक आत्मविश्वासी हो जाते हैं और रचनात्मक रूप से सोचना बंद कर देते हैं। AI के "अंतिम उत्तर" को सुनने के बजाय उसके "मध्य विचारों" में झाँककर, शोधकर्ताओं ने AI को फिर से एक्सप्लोर करना सिखाया, जिससे वह कठिन पहेलियों को सुलझाने में अधिक स्मार्ट और विश्वसनीय बन गया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।