← नवीनतम पेपर
💬 NLP

Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling

यह शोध पत्र एक हल्के, सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) आधारित नियंत्रक का प्रस्ताव करता है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के लिए उत्तर की शुद्धता, विलंबता (लेटेंसी) और गणना लागत के बीच गतिशील रूप से संतुलन बनाने हेतु एडेप्टिव सैंपलिंग को एक मार्कोव निर्णय प्रक्रिया के रूप में तैयार करता है, जिससे मौजूदा ह्यूरिस्टिक विधियों की तुलना में बेहतर ट्रेड-ऑफ प्राप्त होता है।

मूल लेखक: Runpeng Dai, Tong Zheng, Rui Liu, Chengsong Huang, Hongtu Zhu

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Runpeng Dai, Tong Zheng, Rui Liu, Chengsong Huang, Hongtu Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन गणित की समस्या हल करने की कोशिश कर रहे हैं। आपके पास एक शानदार लेकिन महंगा AI सहायक (लार्ज लैंग्वेज मॉडल) है जो आपको उत्तर दे सकता है।

समस्या: "बहुत अधिक अनुमान लगाने" की दुविधा
आमतौर पर, सही उत्तर पाने के लिए, आप AI को 32 अलग-अलग अनुमान लगाने के लिए कहते हैं और फिर उस एक को चुनते हैं जो सबसे अधिक बार आता है। यह अच्छी तरह से काम करता है, लेकिन यह ऐसा है जैसे एक स्लाइस खाने के लिए 32 पिज्जा ऑर्डर करना। यह धीमा (उच्च लेटेंसी) है और इसमें बहुत पैसा (उच्च गणना लागत) खर्च होता है।

कुछ मौजूदा तरीके अधिक स्मार्ट होने की कोशिश करते हैं। वे कहते हैं, "ठीक है, एक अनुमान मांगें, देखें कि क्या हम आश्वस्त हैं, और शायद एक और मांगें।" लेकिन ये तरीके एक कठोर नियम पुस्तिका की तरह हैं: "यदि आत्मविश्वास 95% है, तो रुकें।" वे वास्तव में स्थिति को समझते नहीं हैं; वे बस एक चेकलिस्ट का पालन करते हैं। कभी-कभी वे बहुत जल्दी रुक जाते हैं (गलत उत्तर देते हैं), और कभी-कभी वे बहुत लंबे समय तक चलते रहते हैं (पैसा बर्बाद करते हैं)।

समाधान: "स्मार्ट मैनेजर" (RL-निर्देशित सैंपलिंग)
यह पेपर RL-गाइडेड सैंपलिंग नामक एक नई प्रणाली पेश करता है। इसे एक छोटे, सुपर-फास्ट मैनेजर (एक छोटा AI कंट्रोलर) को अनुमान लगाने की प्रक्रिया की देखरेख करने के लिए काम पर रखने के रूप में समझें।

यह मैनेजर कैसे काम करता है:

  1. कार्य योजना (The MDP): लेखक एक खेल सेट करते हैं जहाँ मैनेजर राउंड-दर-राउंड निर्णय लेता है।

    • स्थिति (The State): मैनेजर उन उत्तरों के ढेर को देखता है जो AI ने पहले ही बना लिए हैं। उसे यह जानने की ज़रूरत नहीं है कि गणित की समस्या क्या है, या AI कितना आश्वस्त महसूस कर रहा है। वह केवल सांख्यिकी (stats) को देखता है: "कितने लोगों ने '10' कहा? कितने लोगों ने '20' कहा? क्या उत्तर चारों ओर बिखरे हुए हैं, या वे अब सहमत होने लगे हैं?"
    • कार्रवाई (The Action): उन सांख्यिकी के आधार पर, मैनेजर के पास दो विकल्प हैं:
      • रुकें (Stop): "ठीक है, हमारे पास पर्याप्त सहमति है। आइए विजेता को चुनें और घर चलें।"
      • जारी रखें (Continue): "हम अभी भी भ्रमित हैं। आइए AI से अभी 2, 4, या शायद और अधिक अनुमान मांगें।"
    • पुरस्कार (The Reward): मैनेजर को एक अच्छा बॉस बनने के लिए प्रशिक्षित किया जाता है। उसे तब "हाई फाइव" (पुरस्कार) मिलता है जब अंतिम उत्तर सही होता है। लेकिन उसे हर अतिरिक्त सेकंड के इंतजार (लेटेंसी) और हर अतिरिक्त अनुमान के ऑर्डर के लिए "फ्रंट" (दंड) मिलता है।
  2. करके सीखना (Reinforcement Learning): मैनेजर जन्म से नियम नहीं जानता। वह खेल को हजारों बार खेलता है। शुरू में, वह बहुत सारे अनुमान बर्बाद कर सकता है। लेकिन धीरे-धीरे वह सही संतुलन सीख जाता है: "इस प्रकार के उलझन भरे सवाल के लिए, मुझे 10 अनुमान चाहिए। इस आसान वाले के लिए, 4 काफी हैं।"

यह विशेष क्यों है?

  • यह हल्का है (Lightweight): मैनेजर बहुत छोटा है। यह इतना छोटा है कि यह एक सामान्य कंप्यूटर प्रोसेसर (CPU) पर चल सकता है, न कि केवल एक महंगे ग्राफिक्स कार्ड पर।
  • यह गैर-हस्तक्षेपकारी है (Non-Invasive): इसे AI के दिमाग के अंदर झांकने की ज़रूरत नहीं है (जैसे कि छिपे हुए आत्मविश्वास स्कोर को देखना)। यह केवल अंतिम उत्तरों को देखता है, जैसे कि वोटों की गिनती करने वाला एक जज।
  • यह अनुकूलन करता है (Adapts): कठोर नियम पुस्तिकाओं के विपरीत, यह मैनेजर एक लचीली रणनीति सीखता है। वह जानता है कि कब आक्रामक होना है और कब रूढ़िवादी।

परिणाम
जब शोधकर्ताओं ने इस "स्मार्ट मैनेजर" का पुराने तरीकों के खिलाफ परीक्षण किया:

  • इसने आवश्यक अनुमानों की कुल संख्या में लगभग 30% से 65% की बचत की।
  • इसने सिस्टम को रुकने और जांच करने (राउंड्स) के समय को 3 से 4 गुना कम कर दिया।
  • इसने यह सब बिना अंतिम उत्तरों की सटीकता को कम किए किया; वास्तव में, इसने अक्सर अधिक सही उत्तर प्राप्त किए क्योंकि इसने बहुत जल्दी रुकना नहीं सीखा।

बड़ी तस्वीर
पुराने तरीकों को एक ऐसे ड्राइवर के रूप में सोचें जो या तो एक स्थिर धीमी गति से गाड़ी चलाता है या ट्रैफ़िक की परवाह किए बिना हर रेड लाइट पर रुक जाता है। यह नया तरीका एक स्मार्ट GPS की तरह है जो ट्रैफ़िक, समय, और मंजिल को देखता है, और ड्राइवर को बताता है कि उसे ठीक कब तेज़ होना है और कब रुकना है, जिससे ईंधन और समय दोनों की बचत होती है जबकि वह आपको सही जगह तक पहुँचा देता है।

पेपर का दावा है कि यह तरीका विभिन्न प्रकार की गणितीय समस्याओं के लिए अच्छी तरह काम करता है और यह भी काम करता है यदि आप मैनेजर को एक प्रकार के AI पर प्रशिक्षित करते हैं और उसका उपयोग दूसरे, अधिक शक्तिशाली AI को प्रबंधित करने के लिए करते हैं। यह महंगे AI मॉडल का सर्वोत्तम उपयोग करने के लिए एक सरल, कुशल तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →