← नवीनतम पेपर
💬 NLP

DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search

डीपसर्च (DeepSearch), मोंटे कार्लो ट्री सर्च (Monte Carlo Tree Search) को सीधे प्रशिक्षण लूप में एकीकृत करके वेरिफिएबल रिवार्ड्स (RLVR) के प्रशिक्षण पठारों (training plateaus) पर विजय प्राप्त करता है ताकि व्यवस्थित अन्वेषण और सूक्ष्म-स्तरीय क्रेडिट असाइनमेंट सक्षम किया जा सके, जिससे काफी कम कम्प्यूटेशनल लागत के साथ अत्याधुनिक रीजनिंग प्रदर्शन प्राप्त होता है।

मूल लेखक: Fang Wu, Weihao Xuan, Heli Qi, Ximing Lu, Aaron Tu, Li Erran Li, Yejin Choi

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fang Wu, Weihao Xuan, Heli Qi, Ximing Lu, Aaron Tu, Li Erran Li, Yejin Choi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े भ्रमित रोबोट को जटिल गणितीय पहेलियों को हल करना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका: "ब्रूट फोर्स प्रैक्टिस" (Brute Force Practice)

लंबे समय तक, इन रोबोटों को प्रशिक्षित करने का सबसे अच्छा तरीका वेरिफिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग (RLVR) था। इसे एक छात्र द्वारा अभ्यास परीक्षा देने की तरह समझें।

  1. रोबोट किसी समस्या को हल करने की कोशिश करता है।
  2. यदि वह उत्तर सही पाता है, तो उसे एक गोल्ड स्टार (पुरस्कार) मिलता है। यदि गलत होता है, तो उसे रेड X मिलता है।
  3. रोबोट फिर से प्रयास करता है, इस उम्मीद में कि उसे और अधिक गोल्ड स्टार मिलेंगे।

समस्या: रोबोट एक ही ढर्रे में फंस रहा था। वह समस्याओं को हल करने के लिए उन्हीं कुछ तरीकों को बार-बार अपनाता रहता था, जिससे वह समाधान के चतुर और छिपे हुए रास्तों को मिस कर देता था। भले ही आप रोबोट को वर्षों (हजारों प्रशिक्षण चरणों) तक अभ्यास कराएं, वह एक ऐसी "सीमा" (ceiling) पर पहुँच जाता था जहाँ वह चाहे कितना भी समय बिता ले, बेहतर नहीं हो पाता था। यह एक ऐसे छात्र की तरह था जो केवल पाठ्यपुस्तक के उसी अध्याय को बार-बार पढ़ता रहता है लेकिन पीछे दिए गए प्रश्नों को हल करने की कोशिश कभी नहीं करता।

नया तरीका: "डीपसर्च" (DeepSearch - मानचित्र वाला जासूस)

इस पेपर के लेखकों ने महसूस किया कि रोबोट इसलिए विफल नहीं हो रहा था क्योंकि वह पर्याप्त मेहनत नहीं कर रहा था; बल्कि इसलिए विफल हो रहा था क्योंकि वह पर्याप्त एक्सप्लोरेशन (अन्वेषण) नहीं कर रहा था।

उन्होंने एक नया प्रशिक्षण तरीका पेश किया जो रोबोट के सीखने को एक ट्री सर्च (Tree Search) (विशेष रूप से, मोंटे कार्लो ट्री सर्च) के साथ जोड़ता है। यह कैसे काम करता है, इसे एक सरल उपमा से समझते हैं:

1. "ट्री" (वृक्ष) की उपमा

कल्पना कीजिए कि रोबोट एक विशाल, शाखाओं वाले पेड़ के नीचे खड़ा है।

  • तना (Trunk): गणित की समस्या।
  • शाखाएँ (Branches): हर वह संभावित कदम जो रोबोट समस्या को हल करने के लिए उठा सकता है।
  • पत्तियाँ (Leaves): अंतिम उत्तर।

पुराने तरीके में, रोबोट बस एक शाखा चुनता, ऊपर चढ़ता और उम्मीद करता कि वह सही पत्ती तक पहुँच जाएगा। यदि वह गिर जाता, तो वह फिर से उसी शाखा को आज़माता।

DeepSearch खेल बदल देता है। केवल एक शाखा पर चढ़ने के बजाय, रोबोट एक मानचित्र वाले जासूस की तरह व्यवहार करता है। वह एक ही समय में कई अलग-अलग शाखाओं की खोज करने के लिए छोटे स्काउट्स (जासूसों) को भेजता है।

  • वह जाँच करता है: "यदि मैं इस रास्ते पर जाता हूँ, तो क्या यह आशाजनक लग रहा है?"
  • वह जाँच करता है: "यदि मैं उस रास्ते पर जाता हूँ, तो क्या मैं भ्रमित हो रहा हूँ?"
  • वह सबसे अच्छे रास्ते को चुनने से पहले पूरे जंगल का एक पूरा नक्शा तैयार करता है।

2. गलतियों से सीखना ("कॉन्फिडेंट रोंग" ट्रिक)

DeepSearch का सबसे शानदार हिस्सा यह है कि यह गलतियों को कैसे संभालता है।

  • पुराना तरीका: यदि रोबोट गलत उत्तर प्राप्त करता था, तो वह शायद अध्ययन करने के लिए एक यादृच्छिक (random) गलत उत्तर चुन लेता था।
  • DeepSearch: यह "सबसे आत्मविश्वासी गलत उत्तर" (Most Confident Wrong Answer) की तलाश करता है।
    • उपमा: कल्पना कीजिए कि एक छात्र पूरी तरह आश्वस्त है कि 2+2=52+2=5 है। यह एक खतरनाक, आत्मविश्वासी गलती है। DeepSearch कहता है, "आहा! यह छात्र बहुत सुनिश्चित है कि वह गलत है। आइए अपनी शिक्षण ऊर्जा यहाँ केंद्रित करें, क्योंकि इस विशिष्ट, आत्मविश्वासी त्रुटि को ठीक करने से हमें सबसे अधिक सीखने को मिलेगा।"
    • यह यादृच्छिक, लापरवाह गलतियों को अनदेखा करता है और उन गलतियों को लक्षित करता है जहाँ रोबोट आत्मविश्वास के साथ गलत रास्ते पर जा रहा है।

3. "स्मार्ट लाइब्रेरी" (Replay Buffer)

प्रशिक्षण महंगा और धीमा है। DeepSearch एक "स्मार्ट लाइब्रेरी" (Replay Buffer) का उपयोग करता है।

  • एक बार जब रोबोट अपने जासूसी मानचित्र का उपयोग करके एक कठिन समस्या को हल कर लेता है, तो वह उस समाधान को लाइब्रेरी में रख देता है।
  • अगली बार जब वह उस समस्या को देखता है, तो वह उसे शुरू से हल करने में समय बर्बाद नहीं करता है। वह लाइब्रेरी से समाधान उठाता है और अपनी ऊर्जा उन नए प्रश्नों पर केंद्रित करता है जिन्हें उसने अभी तक हल नहीं किया है।
  • यह एक ऐसे छात्र की तरह है जो, एक बार कठिन अध्याय में महारत हासिल करने के बाद, उसे बार-बार पढ़ने के बजाय अगले कठिन अध्याय पर ध्यान केंद्रित करता है।

परिणाम: तेज़, स्मार्ट, सस्ता

पेपर ने गणितीय बेंचमार्क (जैसे हाई स्कूल और कॉलेज स्तर की प्रतियोगिताएं) पर इसका परीक्षण किया।

  • प्रदर्शन (Performance): DeepSearch ने एक नया रिकॉर्ड (62.95% सटीकता) बनाया, जिसने पिछले सभी मॉडलों को पीछे छोड़ दिया।
  • दक्षता (Efficiency): यह सबसे बड़ी जीत है। इस परिणाम को प्राप्त करने के लिए, DeepSearch ने पुराने "ब्रूट फोर्स" तरीकों की तुलना में 5.7 गुना कम कंप्यूटिंग पावर (GPU घंटे) का उपयोग किया।

मुख्य निष्कर्ष

इस पेपर का मुख्य सबक यह है कि एक्सप्लोरेशन की मात्रा से अधिक उसकी गुणवत्ता मायने रखती है।

रोबोट को अंधेر में घंटों तक अभ्यास कराने के बजाय, DeepSearch उसे सिखाता है कि सीखते समय रणनीतिक रूप से कैसे सोचा जाए। यह एक ऐसे छात्र के बीच का अंतर है जो दशकों तक बिना सोचे-समझे फ्लैशकार्ड रटता रहता है और उस छात्र के बीच का अंतर है जो कैसे पढ़ाई की जाए, यह सीखता है, अपने ज्ञान की कमियों को खोजने के लिए मानचित्र का उपयोग करता है, और आधे समय में विषय में महारत हासिल कर लेता है।

संक्षेप में: DeepSearch केवल रोबोट को कड़ी मेहनत करना नहीं सिखाता; यह उसे समाधान के स्थान (solution space) को खोजने के लिए एक मानचित्र देकर उसे स्मार्ट तरीके से काम करना सिखाता है, न कि केवल अंधेरे में अनुमान लगाना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →