← नवीनतम पेपर
💻 computer science

OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis

OpenResearcher एक पूरी तरह से खुला, पुनरुत्पादक और ऑफलाइन पाइपलाइन पेश करता है जो 15M-दस्तावेजों के संग्रह से 97,000 से अधिक लॉन्ग-होरिज़न डीप रिसर्च ट्रेजेक्टरीज को संश्लेषित करता है, जिससे एक 30B-A3B मॉडल को BrowseComp-Plus पर 34-पॉइंट सटीकता सुधार प्राप्त करने में सक्षम बनाया जा सके और एजेंट डिज़ाइन रणनीतियों के विश्लेषण के लिए एक नियंत्रित वातावरण प्रदान किया जा सके।

मूल लेखक: Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया का बेहतरीन जासूस बनना सिखाना चाहते हैं। ऐसा करने के लिए, आपको उसे जटिल रहस्यों को सुलझाने के हजारों उदाहरण दिखाने होंगे: जैसे कि सही सवाल कैसे पूछे जाते हैं, विभिन्न पुस्तकालयों (libraries) में कैसे जाया जाता है, विशिष्ट पृष्ठों को कैसे पढ़ा जाता है, और उस नन्हे से सुराग को कैसे खोजा जाता है जो केस को सुलझा देता है।

समस्या क्या है? वास्तविक दुनिया में ऐसा करना महंगा, अराजक और दोहराने में असंभव है। यदि आप रोबोट को अभ्यास करने के लिए वास्तविक इंटरनेट पर भेजते हैं, तो आपको हर सर्च के लिए भुगतान करना होगा, वेबसाइटें बदल सकती हैं या गायब हो सकती हैं, और आप इस बात के प्रति आश्वस्त नहीं हो सकते कि रोबोट ने उत्तर इसलिए खोजा क्योंकि वह बुद्धिमान था या केवल उसकी किस्मत अच्छी थी।

मिलिए "OpenResearcher" से।

OpenResearcher को एक विशाल, आत्मनिर्भर "डिटेक्टिव ट्रेनिंग सिम्युलेटर" के रूप में समझें। रोबोट को वास्तविक, महंगी और अस्त-व्यस्त दुनिया में भेजने के बजाय, शोधकर्ताओं ने उनके कंप्यूटर के भीतर इंटरनेट की एक आदर्श, ऑफलाइन प्रतिलिपि बनाई है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल चरणों में विभाजित किया गया है:

1. "सब कुछ वाली लाइब्रेरी" का निर्माण (The Offline Corpus)

कल्पना कीजिए कि आप एक जासूस को प्रशिक्षित करना चाहते हैं, लेकिन आपके पास कोई लाइब्रेरी नहीं है। तो, आप बाहर जाते हैं, 10,000 विशिष्ट किताबें खरीदते हैं जिनमें आपके अभ्यास प्रश्नों के उत्तर मौजूद हैं, और फिर आप एक विशाल गोदाम में जाते हैं और अलमारियों को भरने के लिए 15 मिलियन अन्य रैंडम किताबें उठाते हैं।

  • वास्तविक दुनिया: आपको हर बार लाइब्रेरियन से किताब मांगने के लिए एक शुल्क देना होगा।
  • OpenResearcher: उन्होंने 15 मिलियन दस्तावेजों के साथ एक स्थानीय लाइब्रेरी बनाई। एक बार बनने के बाद, यह हमेशा के लिए उपयोग के लिए मुफ्त है। कोई शुल्क नहीं, इंटरनेट कनेक्शन की आवश्यकता नहीं।

2. "शिक्षक" और "छात्र"

  • शिक्षक (GPT-OSS-120B): यह एक अत्यंत बुद्धिमान AI है जो एक मास्टर डिटेक्टिव की तरह कार्य करता है। यह कठिन सवालों को हल करना जानता है।
  • छात्र (The 30B Model): यह वह छोटा AI है जिसे वे प्रशिक्षित करना चाहते हैं। यह एक नौसिखिया जासूस की तरह है।

शोधकर्ता शिक्षक को अपने ऑफलाइन लाइब्रेरी का उपयोग करके प्रश्नों को हल करने देते हैं। शिक्षक केवल अनुमान नहीं लगाता; उसे नियमों के एक सख्त सेट का पालन करना होता है:

  1. खोज (Search): लाइब्रेरियन से किताबों की एक सूची मांगें।
  2. खोलना (Open): चलकर वहां जाएं और पूरी किताब पढ़ें (केवल सारांश नहीं)।
  3. खोजना (Find): उस सटीक वाक्य को खोजने के लिए 'Ctrl+F' का उपयोग करें जो उत्तर को सिद्ध करता है।

शिक्षक अपनी पूरी विचार प्रक्रिया लिखता है: "मैंने X के लिए खोजा, Y पाया, किताब खोली, पेज 5 पर स्क्रॉल किया, 'Z' शब्द पाया, और अब मैं जानता हूँ कि उत्तर A है।"

3. "ट्रेनिंग मोंटाज" (The Training Montage)

शोधकर्ताओं ने इन 97,000 जासूसी कहानियों को रिकॉर्ड किया। कुछ छोटी और आसान थीं (5 चरण), जबकि अन्य अविश्वसनीय रूप से लंबी और कठिन थीं (100 से अधिक चरण!)।

  • उपमा: यह एक मास्टर शेफ के खाना पकाने के 97,000 घंटों को रिकॉर्ड करने जैसा है, प्याज काटने से लेकर डेज़र्ट परोसने तक।
  • इसके बाद उन्होंने इन रिकॉर्डिंग्स को छात्र (नौसिखिया जासूस) को खिलाया। छात्र ने इन रिकॉर्डिंग्स का अध्ययन किया ताकि वह केवल उत्तर को ही नहीं, बल्कि सोचने के तरीके को भी सीख सके।

4. परिणाम: नौसिखिए से पेशेवर तक

इन रिकॉर्डिंग्स का अध्ययन करने के बाद, छात्र अद्भुत हो गया।

  • प्रशिक्षण से पहले: छात्र एक ऐसे व्यक्ति की तरह था जो उत्तरों का अनुमान लगा रहा था, और लगभग 20% सही हो पा रहा था।
  • प्रशिक्षण के बाद: वह बहुत कठिन परीक्षणों पर 54.8% सही था।
  • जादू: छात्र को केवल ऑफलाइन सिम्युलेटर पर प्रशिक्षित किया गया था, फिर भी इसने कई महंगे, प्रोप्राइटरी सिस्टम से बेहतर प्रदर्शन किया जो वास्तविक इंटरनेट पर निर्भर हैं।

यह एक बड़ी बात क्यों है? (The "Aha!" Moments)

पेपर ने यह भी पता लगाया कि ये AI जासूस कैसे काम करते हैं, इसके बारे में कुछ दिलचस्प रहस्य:

  • "खोज बनाम पढ़ना" का जाल (The "Search vs. Read" Trap): यदि आप AI को केवल "खोजने" (किताबों के शीर्षक और सारांश देखना) की अनुमति देते हैं, तो वह विफल हो जाता है। यह किसी मर्डर मिस्ट्री को केवल किताब के पीछे लिखे संक्षिप्त विवरण को पढ़कर सुलझाने की कोशिश करने जैसा है। आपको AI को किताब "खोलने" और विशिष्ट टेक्स्ट को "खोजने" की अनुमति देनी ही होगी।
  • सुराग मिलना पर्याप्त नहीं है: केवल इसलिए कि AI ने सही किताब (Gold Document) ढूंढ ली है, इसका मतलब यह नहीं है कि उसने सही उत्तर भी पा लिया है। उसे अभी भी पेज को पढ़ना और तर्क को समझना होगा। कभी-कभी, AI उत्तर तो ढूंढ लेता है लेकिन तालिका या वाक्य की गलत व्याख्या कर देता है।
  • अधिक चरण = बेहतर परिणाम (एक सीमा तक): सबसे अच्छे जासूसों को लंबा समय लगा। उन्होंने जल्दबाजी नहीं की। उन्होंने खोजा, खोला, पढ़ा और फिर से खोजा। प्रशिक्षण ने दिखाया कि सबसे कठिन पहेलियों को सुलझाने के लिए 100+ कदम लेना अक्सर आवश्यक होता है।

निचोड़ (The Bottom Line)

OpenResearcher एक गेम-चेंजर है क्योंकि यह गहन शोध (deep research) का लोकतंत्रीकरण करता है।

  • पहले: केवल करोड़ों डॉलर वाले अमीर कंपनियां ही AI को गहरा शोधकर्ता बनाने के लिए प्रशिक्षित कर सकती थीं क्योंकि वे वास्तविक इंटरनेट सर्च फीस वहन कर सकती थीं।
  • अब: कोई भी इस "ऑफलाइन लाइब्रेरी" को डाउनलोड कर सकता है, सिमुलेशन चला सकता है, और अपना खुद का AI जासूस मुफ्त में प्रशिक्षित कर सकता है। यह सबको एक निजी, अनंत लाइब्रेरी और एक मास्टर डिटेक्टिव देने जैसा है, जिससे सीखने के लिए उन्हें कभी अपने घर से बाहर निकलने की आवश्यकता नहीं है।

यह साबित करता है कि AI को गहराई से सोचना सिखाने के लिए आपको लाइव, महंगे इंटरनेट कनेक्शन की आवश्यकता नहीं है; आपको बस एक अच्छा नक्शा, एक बड़ी लाइब्रेरी और एक स्मार्ट शिक्षक की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →