← नवीनतम पेपर
💬 NLP

SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic Plans

यह शोध पत्र SynPlanResearch-R1 को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो सुपरवाइज्ड फाइन-ट्यूनिंग के दौरान गहन अन्वेषण को प्रोत्साहित करने के लिए टूल-यूज़ ट्रेजेक्टरीज (tool-use trajectories) को संश्लेषित करता है, जिससे सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण सीखने (reinforcement learning) की सीमाओं को दूर किया जा सके और कई बेंचमार्क पर रिसर्च एजेंट के प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Hansi Zeng, Zoey Li, Yifan Gao, Chenwei Zhang, Xiaoman Pan, Tao Yang, Fengran Mo, Jiacheng Lin, Xian Li, Jingbo Shang

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hansi Zeng, Zoey Li, Yifan Gao, Chenwei Zhang, Xiaoman Pan, Tao Yang, Fengran Mo, Jiacheng Lin, Xian Li, Jingbo Shang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ SynPlanResearch-R1 पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

समस्या: "अधैर्य रखने वाला जासूस" (The Impatient Detective)

कल्पना कीजिए कि आपने एक जटिल रहस्य सुलझाने के लिए एक प्रतिभाशाली लेकिन अनुभवहीन जासूस (एक AI एजेंट) को काम पर रखा है, जैसे कि "ताजमहल के गहने किसने चुराए?"

आप इस जासूस को एक टूलबॉक्स देते हैं: वे इंटरनेट पर खोज (search) कर सकते हैं (पुलिस से पूछ सकते हैं) या अपराध स्थल पर जा सकते हैं (किसी विशिष्ट वेबपेज को पढ़ सकते हैं)।

हालाँकि, जब आप इस जासूस को काम पर छोड़ते हैं, तो उनमें दो बुरी आदतें होती हैं:

  1. वे बहुत जल्दी हार मान लेते हैं: वे एक सवाल पूछते हैं, एक अस्पष्ट उत्तर मिलता है, और पर्याप्त सबूत जुटाने से पहले ही तुरंत चिल्ला उठते हैं, "मुझे लगता है कि यह बटलर ने किया है!"
  2. वे केवल एक ही टूल का उपयोग करते हैं: उन्हें पुलिस से सवाल पूछना (खोज करना) बहुत पसंद है, लेकिन वे अपराध स्थल पर जाने (वेबपेज पढ़ने) से डरते हैं, भले ही उत्तर किसी विशिष्ट दस्तावेज़ में छिपा हो।

शोधकर्ताओं ने पाया कि यदि आप बस जासूस को कह दें, "सही उत्तर पाने के लिए अधिक प्रयास करो," तो वे बेहतर नहीं होते। वे बस वही गलतियाँ दोहराते रहते हैं क्योंकि वे एक ही ढर्रे में फंस जाते हैं। ऐसा तब होता है जब AI मानक सुदृढीकरण लर्निंग (reinforcement learning) का उपयोग करके जटिल शोध कार्यों को सीखने की कोशिश करता है।

समाधान: "स्क्रिप्टेड रिहर्सल" (The Scripted Rehearsal)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे SynPlanResearch-R1 कहा जाता है। केवल जासूस को "जाओ इसे सुलझाओ" कहने के बजाय, वे वास्तविक प्रदर्शन से पहले एक रिहर्सल स्क्रिप्ट तैयार करते हैं।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. "रैंडमाइज्ड मैप" (सिंथेटिक प्लान्स)

कल्पना कीजिए कि आप एक हाइकर (हाइकर) को छिपा हुआ खजाना खोजने के लिए प्रशिक्षित कर रहे हैं। उन्हें बिना किसी दिशा के भटकने देने के बजाय, आप उन्हें एक नक्शा देते हैं जिस पर एक रैंडम रास्ता बना हुआ है

  • नक्शा कहता है: "पहले, गाँव के बुजुर्ग से पूछें (Search)। फिर, पुरानी लाइब्रेरी में जाएँ (Crawl)। फिर, दोबारा गाँव के बुजुर्ग से पूछें।"
  • AI (हाइकर) को इस नक्शे का पालन करने के लिए मजबूर किया जाता है। वह सीधे अंत तक नहीं कूद सकता। उसे पूरी यात्रा का अभ्यास करना होगा, भले ही नक्शा थोड़ा अजीब क्यों न लगे।

2. "द नज़ (The Nudge)" (इन्जेक्टेड क्यूज़)

कभी-कभी, AI नक्शे को देखता है और सोचता है, "मुझे पता है कि यह कैसे करना है, मैं अपना खुद का काम करूँगा।"
इसे रोकने के लिए, शोधकर्ता हर कदम पर धीमी फुसफुसाहट (संकेत/cues) जोड़ते हैं।

  • केवल यह सोचने के बजाय: "मुझे जानकारी चाहिए।"
  • AI सोचता है: "मुझे जानकारी चाहिए... और नक्शा कहता है कि मुझे अगली बार लाइब्रेरी जाना चाहिए।"
    यह AI को रोबोट बनने के बजाय गहन अन्वेषण (deep exploration) के पथ पर बनाए रखता है।

3. "द एडिटर" (विचारों का पुनर्लेखन)

चूँकि AI एक स्क्रिप्ट का पालन कर रहा है और फुसफुसाहट सुन रहा है, इसलिए उसका आंतरिक संवाद (internal monologue) थोड़ा रोबोटिक और अप्राकृतिक लगता है।

  • पहले: "ठीक है, नक्शा लाइब्रेरी कहता है। मैं लाइब्रेरी जा रहा हूँ। नक्शा सही है।"
  • एडिटिंग के बाद: "खोज के परिणाम अस्पष्ट थे, इसलिए मुझे विशिष्ट दस्तावेज़ों में गहराई से जाने की आवश्यकता है।"
    शोधकर्ता इन विचारों को फिर से लिखने के लिए एक सुपर-स्मार्ट AI एडिटर का उपयोग करते हैं, जिससे वे एक स्वाभाविक, बुद्धिमान मानव जासूस की तरह सुनाई देते हैं, जबकि कार्रवाई (नक्शे के कदम) बिल्कुल वही रहती है।

4. "द रियल एग्जाम" (सुदृढीकरण लर्निंग)

अब जब जासूस ने इन उच्च-गुणवत्ता वाले, गहरे-अन्वेषण वाले स्क्रिप्ट्स के साथ अभ्यास कर लिया है, तो वे वास्तविक परीक्षा के लिए तैयार हैं।

  • उन्हें एक वास्तविक वातावरण में रखा जाता है जहाँ उन्हें अंक तभी मिलते हैं जब वे सही उत्तर खोज लेते हैं।
  • क्योंकि उन्होंने एक मजबूत "गहन अन्वेषण की आदत" (deep-exploration habit) के साथ शुरुआत की है (रिहर्सल की मदद से), वे "जल्दी हार मानने" के ढर्रे में नहीं फंसते। वे स्वाभाविक रूप से सच्चाई खोजने के लिए गहराई तक खुदाई करते रहते हैं।

यह क्यों महत्वपूर्ण है?

इसे एक मैराथन धावक को प्रशिक्षित करने की तरह समझें।

  • पुराना तरीका: आप धावक से कहते हैं, "जीतने के लिए दौड़ो।" वे पहले मील में तेज़ दौड़ सकते हैं, थक सकते हैं और छोड़ सकते हैं।
  • नया तरीका (SynPlanResearch-R1): आप पहले उन्हें एक विशिष्ट, लंबी प्रशिक्षण मार्ग पर दौड़ने के लिए मजबूर करते हैं जिसमें हर मील मार्कर पर एक कोच उनका मार्गदर्शन करता है। वे सीखते हैं कि खुद को कैसे नियंत्रित करना है और कठिन हिस्सों से कैसे पार पाना है।
  • परिणाम: जब वे अंततः वास्तविक दौड़ में भाग लेते हैं, तो उनके पास जीतने के लिए सहनशक्ति और रणनीति होती है, जबकि अन्य लोग जल्दी हार मान लेते हैं।

परिणाम

पेपर ने सात अलग-अलग "रहस्य" चुनौतियों (जैसे जटिल ट्रिविया और ओपन-वेब रिसर्च) पर इसका परीक्षण किया।

  • इस नई विधि ने AI को काफी स्मार्ट बना दिया।
  • इसने AI को बहुत जल्दी हार मानने से रोका।
  • इसने AI को अपने सभी टूल्स (खोजना और पढ़ना) प्रभावी ढंग से उपयोग करने के लिए मजबूर किया।

संक्षेप में: यह पेपर AI को एक बेहतर शोधकर्ता बनना सिखाता है, उसे एक ऐसे "ट्रेनिंग कैंप" देकर जहाँ वह किसी वास्तविक समस्या को स्वयं हल करने से पहले गहन और विस्तृत जांच का अभ्यास करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →