Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR
यह शोध पत्र REFT को प्रस्तुत करता है, जो एक हल्का RLVR तरीका है जो रीजनिंग मार्कर के बाद पहले टोकन के लिए पॉलिसी के शीर्ष- उम्मीदवारों से समान रूप से नमूना लेकर रोलआउट विविधता को बढ़ाता है और रीजनिंग प्रदर्शन में सुधार करता है, जिससे शुद्धता संकेत (correctness signal) को बदले बिना अन्वेषण का विस्तार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस शोध पत्र "Where Rollouts Begin: Low-Load, High-Leverage" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।
मुख्य समस्या: "पहला कदम" का जाल (The "First Step" Trap)
कल्पना कीजिए कि आप एक छात्र को जटिल गणित के सवाल हल करना सिखा रहे हैं। उन्हें उत्तर कुंजी (answer key) देने के बजाय, आप उनसे सवाल को आठ अलग-अलग तरीकों से हल करने के लिए कहते हैं (इसे "रोलआउट ग्रुप" कहा जाता है)। फिर आप उनके उत्तरों को ग्रेड करते हैं और उन्हें बताते हैं कि कौन से प्रयास सही थे और कौन से गलत। छात्र इस फीडबैक का उपयोग करके अधिक बुद्धिमान बनता है।
समस्या क्या है? छात्र अपने शुरुआत करने के तरीके को लेकर अविश्वसनीय रूप से जिद्दी है। हर बार, वे अपने समाधान की शुरुआत बिल्कुल एक ही वाक्यांश के साथ करते हैं, जैसे "Let’s see..." (देखते हैं...) या "First," (सबसे पहले,)।
क्योंकि वे हमेशा एक ही तरह से शुरुआत करते हैं, उनके आठों प्रयास बहुत मिलते-जुलते दिखते हैं। यदि वे उत्तर गलत देते हैं, तो वे संभवतः उन सभी आठ प्रयासों में गलत ही होंगे क्योंकि वे एक ही "सोचने वाली लेन" (thinking lane) में फंसे हुए थे। शिक्षक (AI ट्रेनर) उपयोगी फीडबैक नहीं दे पाता क्योंकि तुलना करने के लिए विविधता (variety) की कमी है।
अधिकांश AI शोधकर्ताओं ने सोचा, "खैर, पहला शब्द ज्यादा मायने नहीं रखता। यह सिर्फ एक विनम्र शुरुआत है। आइए हम समाधान के मध्य या अंत को बदलने पर ध्यान केंद्रित करें ताकि विविधता पैदा हो सके।"
यह शोध पत्र तर्क देता है कि यह एक गलती है। यह सुझाव देता है कि सबसे पहला शब्द वास्तव में एक हाई-लेवरेज (high-leverage) बिंदु है—एक छोटा सा बदलाव जो बड़ी नई संभावनाओं के द्वार खोल देता है।
खोज: "दरवाजे का प्रभाव" (The "Doorway" Effect)
शोधकर्ताओं ने उस पहले शब्द का बारीकी से अध्ययन किया जो AI तब उत्पन्न करता है जब वह तर्क (reasoning) शुरू करने का निर्णय लेता है (जिसे एक विशेष टैग जैसे <think> द्वारा चिह्नित किया जाता है)। उन्होंने दो आश्चर्यजनक चीजें पाईं:
- AI अति-आत्मविश्वासी है: AI अपने पहले शब्द को लेकर अत्यधिक आश्वस्त है। वह अपने शुरुआती शब्द को 50-60% बार चुनता है, भले ही अन्य कई वैध तरीके मौजूद हों।
- सत्यता की परवाह नहीं करती: चाहे AI "Let," "First," या किसी दुर्लभ शब्द जैसे "Consider" से शुरुआत करे, अंतिम गणितीय उत्तर सही होने की संभावना लगभग एक समान रहती है।
उपमा (Analogy): पहले शब्द को एक घर में प्रवेश करने वाले दरवाजे के रूप में सोचें।
- AI हमेशा सामने वाले दरवाजे का उपयोग करता है क्योंकि वह सबसे स्पष्ट है।
- लेकिन 19 अन्य दरवाजे (साइड डोर, बैक डोर, गैराज डोर) भी हैं जो उसी घर में ले जाते हैं।
- AI इन अन्य दरवाजों को अनदेखा करता है क्योंकि वह सामने वाले दरवाजे की ओर झुका हुआ है।
- हालाँकि, एक बार जब आप उन दरवाजों में से किसी से भी अंदर कदम रख लेते हैं, तो आप घर के भीतर विभिन्न कमरों (तर्क पथों/reasoning paths) का पता लगा सकते हैं। केवल सामने वाले दरवाजे का उपयोग करके, AI घर के बाकी हिस्सों को खोजने का अवसर खो रहा है।
समाधान: REFT (Rollout Exploration with First-Token Diversification)
लेखकों ने REFT नामक एक सरल तकनीक बनाई है। यह AI के मस्तिष्क या उसकी ग्रेडिंग प्रणाली को नहीं बदलता है। यह केवल इस बात को बदलता है कि AI से उसके प्रयासों को कैसे शुरू करने के लिए कहा जाता है।
यह कैसे काम करता है:
- AI अपने शीर्ष 20 संभावित पहले शब्दों को देखता है।
- हर बार सबसे लोकप्रिय शब्द चुनने के बजाय, REFT कहता है: "इस सूची में से यादृच्छिक (random) रूप से 4 अलग-अलग शब्द चुनें।"
- AI फिर 8 समाधान लिखता है, लेकिन वह खुद को उन 4 अलग-अलग शब्दों के साथ शुरू करने के लिए मजबूर करता है (प्रति शब्द 2 समाधान)।
उपमा:
8 छात्रों को सामने के दरवाजे से भेजने के बजाय, आप 2 छात्रों को सामने के दरवाजे से, 2 को साइड डोर से, 2 को बैक डोर से और 2 को गैराज से भेजते हैं।
- छात्र अंदर जाने के बाद अभी भी अपने तर्क का उपयोग करते हैं।
- लेकिन चूंकि वे अलग-अलग जगहों से प्रवेश करते हैं, वे घर के अलग-अलग हिस्सों का पता लगाते हैं।
- यह शिक्षक को ग्रेड करने के लिए बहुत अधिक विविध प्रयास प्रदान करता है, जिससे सीखने की प्रक्रिया अधिक प्रभावी हो जाती है।
यह अन्य तरीकों की तुलना में बेहतर क्यों है?
आमतौर पर, विविधता प्राप्त करने के लिए शोधकर्ता "टेम्परेचर" (Temperature) नामक विधि का उपयोग करते हैं। यह पासा फेंकने से पहले उसे हिलाने जैसा है। यह AI को हर जगह अधिक रैंडम (यादृच्छिक) बना देता है।
- टेम्परेचर के साथ समस्या: यह समाधान के मध्य में भी AI को रैंडम बना देता है। यदि AI बीच में रैंडम हो जाता है, तो वह मूर्खतापूर्ण गलतियाँ कर सकता है या बेतुके निष्कर्ष निकाल सकता है। यह ऐसा है जैसे पासे को इतनी जोर से हिलाना कि छात्र केवल अलग-अलग कमरों का पता लगाने के बजाय दीवारों के माध्यम से चलने लगें।
- REFT का लाभ: REFT केवल पहले कदम के लिए पासे को हिलाता है। शेष समाधान अभी भी तार्किक और सावधान रहता है। यह सुनिश्चित करने जैसा है कि छात्र अलग-अलग दरवाजों से प्रवेश करें, लेकिन एक बार अंदर जाने के बाद, वे सावधानी से और तार्किक रूप से चलें।
परिणाम
शोधकर्ताओं ने कई AI मॉडलों (0.5 बिलियन पैरामीटर के छोटे मॉडल से लेकर 7 बिलियन पैरामीटर के बड़े मॉडल तक) और विभिन्न गणितीय डेटासेट पर इसका परीक्षण किया।
- बेहतर सटीकता: AI समग्र रूप से अधिक सही उत्तर प्राप्त करता है।
- बेहतर कवरेज: जब AI को 8 या 64 बार प्रयास करने की अनुमति दी गई, तो उसके पास कम से कम एक सही समाधान खोजने की संभावना बहुत अधिक थी।
- कम "सब-गलत" समूह: मानक प्रशिक्षण में, कभी-कभी सभी 8 प्रयास गलत होते हैं, जिससे शिक्षक को कोई उपयोगी फीडबैक नहीं मिलता। REFT के साथ, क्योंकि प्रयास अधिक विविध हैं, यह संभावना कम है कि सभी प्रयास विफल हो जाएं। कम से कम एक प्रयास अक्सर एक सही पथ खोज लेता है, जिससे AI के पास सीखने के लिए कुछ अच्छा होता है।
सारांश
यह शोध पत्र एक सामान्य धारणा को उलट देता है। हम आमतौर पर सोचते हैं कि तर्क प्रक्रिया का "बोरिंग" पहला चरण मायने नहीं रखता। लेकिन यह पेपर दिखाता है कि पहला कदम एक शक्तिशाली लीवर (lever) है। केवल AI को अलग-अलग शुरुआती वाक्यांशों को आज़माने के लिए मजबूर करके, हम AI को कम तार्किक बनाए बिना तर्क पथों की एक विस्तृत विविधता को अनलॉक कर सकते हैं। यह एक छोटा, सस्ता बदलाव है जो अधिक स्मार्ट, अधिक मजबूत AI तर्क की ओर ले जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।