← नवीनतम पेपर
💬 NLP

Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design

यह शोध पत्र मार्को डीपरिसर्च (Marco DeepResearch) को प्रस्तुत करता है, जो एक सत्यापन-केंद्रित (verification-centric) गहन अनुसंधान एजेंट है जो QA डेटा संश्लेषण, प्रक्षेपवक्र निर्माण (trajectory construction) और टेस्ट-टाइम स्केलिंग में स्पष्ट सत्यापन तंत्रों को एकीकृत करके जटिल, दीर्घकालिक कार्यों पर प्रदर्शन को बढ़ाता है, जिससे यह चुनौतीपूर्ण बेंचमार्क पर बड़े पैमाने के मॉडलों से बेहतर प्रदर्शन करने में सक्षम होता है।

मूल लेखक: Bin Zhu, Qianghuai Jia, Tian Lan, Junyang Ren, Feng Gu, Feihu Jiang, Longyue Wang, Zhao Xu, Weihua Luo

प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bin Zhu, Qianghuai Jia, Tian Lan, Junyang Ren, Feng Gu, Feihu Jiang, Longyue Wang, Zhao Xu, Weihua Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने मार्को (Marco) नाम के एक प्रतिभाशाली लेकिन अनुभवहीन रिसर्च असिस्टेंट को काम पर रखा है। आपका लक्ष्य उसे बेहद कठिन, बहु-चरणीय रहस्यों (जैसे "1995 में टोक्यो की एक विशिष्ट दुकान द्वारा बेची गई एक विशिष्ट विंटेज घड़ी की सटीक कीमत पता लगाएं, और मुझे बताएं कि उस दिन मौसम कैसा था") को हल करने के लिए तैयार करना है।

अतीत में, मार्को जैसे AI असिस्टेंट में एक बड़ी खामी थी: वे खुश करने के लिए बहुत उत्सुक रहते थे। यदि उन्हें कोई जानकारी मिलती जो सही दिखती थी, तो वे उसे पकड़ लेते, खोज बंद कर देते और आपको उत्तर दे देते—भले ही वह गलत हो। वे तथ्य भी बना लेते थे (hallucinations) या लूप में फंस जाते थे क्योंकि वे कभी अपने काम की दोबारा जांच नहीं करते थे।

यह पेपर मार्को डीपरिसर्च (Marco DeepResearch) को पेश करता है, जो इस असिस्टेंट का एक नया संस्करण है, जो बहुत अधिक स्मार्ट है, इसलिए नहीं कि वह "बड़ा" है (वह वास्तव में काफी छोटा और कुशल है), बल्कि इसलिए क्योंकि उसे एक नया सुपरपावर सिखाया गया है: सत्यापन (Verification)।

इसे उन्होंने कैसे ठीक किया, सरल शब्दों में यहाँ दिया गया है:

1. समस्या: "गति बनाम सटीकता" का जाल

कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है।

  • पुराना AI: उत्तर कुंजी की पहली पंक्ति पढ़ता है, उसे लिख देता है, और तुरंत जमा कर देता है। यदि पहली पंक्ति एक चाल वाला सवाल थी, तो छात्र फेल हो जाता है।
  • समस्या: वर्तमान AI एजेंट इंटरनेट पर तेजी से दौड़ते हैं, पहला संभावित उत्तर पकड़ते हैं, और रुक जाते हैं। वे यह जांच नहीं करते कि वे सही हैं या नहीं।

2. समाधान: "सत्यापन-केंद्रित" मेकओवर

शोधकर्ताओं ने मार्को की बुरी आदतों को ठीक करने के लिए उसे तीन नए उपकरण दिए। इसे उसके प्रशिक्षण शिविर को अपग्रेड करने के रूप में समझें।

A. बेहतर होमवर्क (सत्यापित डेटा संश्लेषण - Verified Data Synthesis)

इससे पहले कि मार्को सीख सके, उसे अभ्यास समस्याओं की आवश्यकता है।

  • पुराना तरीका: शिक्षक (AI) कहानियों में नाम छिपाकर प्रश्न बनाते थे। कभी-कभी, उत्तर अद्वितीय नहीं होता था (दो अलग-अलग लोग उस विवरण में फिट बैठ सकते थे), या उत्तर गलत होता था। यह एक छात्र को गणित का सवाल देने जैसा है जिसमें दो सही उत्तर हैं; यह उन्हें भ्रमित करता है।
  • नया तरीका: शोधकर्ताओं ने एक "गुणवत्ता नियंत्रण टीम" बनाई। इससे पहले कि मार्को को कोई अभ्यास प्रश्न दिया जाए, एक विशेष AI अटैकर (Attacker) उसे तोड़ने की कोशिश करता है। अटैकर एक अलग उत्तर खोजने की कोशिश करता है जो प्रश्न में फिट बैठता हो। यदि अटैकर सफल होता है, तो प्रश्न को बाहर कर दिया जाता है। केवल वे प्रश्न जिनमें एक एकल, निर्विवाद सही उत्तर होता है, प्रशिक्षण सेट तक पहुँचते हैं।
  • उपमा: यह एक ताला बनाने वाले द्वारा चाबी का परीक्षण करने जैसा है। यदि एक चाबी दो अलग-अलग तालों को खोलती है, तो वह खराब चाबी है। वे केवल उन्हीं चाबियों को रखते हैं जो ठीक एक ही ताला खोलती हैं।

B. "दूसरी राय" का प्रशिक्षण (सत्यापन-संचालित प्रक्षेपवक्र - Verification-Driven Trajectories)

अब जब मार्को के पास अच्छा होमवर्क है, तो उसे सीखना होगा कि कैसे हल किया जाए।

  • पुराना तरीका: मार्को एक बार में एक समस्या को हल करने की कोशिश करता था। यदि वह चरण 2 में फंस जाता या गलती करता, तो उसे अंत तक पता नहीं चलता, और पूरा उत्तर बेकार हो जाता।
  • नया तरीका: उन्होंने मार्को को एक टीम की तरह काम करना सिखाया।
    1. डिटेक्टिव (Detective): बड़े रहस्य को छोटे सुरागों में तोड़ता है।
    2. इन्वेस्टरगेटर (Investigator): बाहर जाता है और सुराग ढूंढता है।
    3. ऑडिटर (Auditor): एक तीसरा AI जो केवल काम की जांच करता है। "क्या आपने वास्तव में वह दस्तावेज़ पाया? क्या वह तारीख सही है?"
    • यदि ऑडिटर "नहीं" कहता है, तो डिटेक्टिव को वापस जाना पड़ता है और फिर से प्रयास करना पड़ता है।
  • उपमा: एक शेफ की कल्पना करें जो एक जटिल व्यंजन बना रहा है। केवल अंत में भोजन चखने के बजाय, शेफ हर सामग्री को डालने के साथ उसे चखता है। यदि नमक बहुत अधिक है, तो वे एक खराब भोजन परोसने के बजाय उसे तुरंत ठीक करते हैं।

C. "दोबारा शुरू करने" का बटन (वेरिफायर-गाइडेड टेस्ट-टाइम स्केलिंग - Verifier-Guided Test-Time Scaling)

यह वास्तविक परीक्षा के दौरान जादू का कमाल है।

  • पुराना तरीका: यदि मार्को फंस जाता है या बड़बड़ाने लगता है, तो वह तब तक चलता रहता है जब तक कि उसका समय या पैसा (कंप्यूटिंग बजट) खत्म न हो जाए, जिससे आमतौर पर एक अव्यवस्थित, गलत उत्तर मिलता है।
  • नया तरीका: मार्को के पास एक "रीसेट बटन" है।
    • यदि वह फंस जाता है या गलतियाँ करने लगता है (डिजेनरेशन), तो वह बटन दबा देता है।
    • सब कुछ हटा दें (Discard All): वह अभी जो भी अव्यवस्थित नोट्स उसने लिखे हैं, उन्हें फेंक देता है।
    • फिर से शुरू करें (Restart): वह एक स्पष्ट दिमाग के साथ नए सिरे से शुरू करता है, उसी बजट का उपयोग करता है लेकिन एक नई रणनीति के साथ।
    • वह एक "जज" (Judge) को बैकग्राउंड में भी चलाता है। यदि उसे कोई उत्तर मिलता है, तो जज उसकी जांच करता है। यदि वह अच्छा दिखता है, तो वह उसे रखता है। यदि नहीं, तो वह और अधिक खोजता रहता है।
  • उपमा: एक वीडियो गेम खेलने की कल्पना करें। यदि आप गड्ढे में गिर जाते हैं, तो किनारे से चलते रहने के बजाय, आप "रीस्टार्ट लेवल" दबाते हैं। आप एक अलग रास्ता आज़माते हैं। मार्को सर्वोत्तम समाधान खोजने के लिए इसे स्वचालित रूप से करता है।

3. परिणाम: छोटा लेकिन शक्तिशाली

सबसे प्रभावशाली बात मार्को का आकार है।

  • अधिकांश शीर्ष-स्तरीय AI शोधकर्ता कठिन समस्याओं को हल करने के लिए "दिग्गज" (30 बिलियन+ पैरामीटर्स) बना रहे हैं।
  • मार्को बहुत छोटा है (8 बिलियन पैरामीटर्स)। वह एक भारी टैंक की तुलना में एक कॉम्पैक्ट स्पोर्ट्स कार की तरह है।
  • परिणाम: छोटा होने के बावजूद, मार्को कई कठिन परीक्षणों पर दिग्गजों को हरा देता है। वह चीनी वेब खोज जैसे विशिष्ट कार्यों पर कुछ 30-बिलियन पैरामीटर वाले मॉडलों को भी मात देता है।

सारांश

मार्को डीपरिसर्च (Marco DeepResearch) साबित करता है कि आपको स्मार्ट होने के लिए बड़े दिमाग की आवश्यकता नहीं है; आपको बस बेहतर आदतों की आवश्यकता है। उसे अपना काम जांचने, अपने स्रोतों को सत्यापित करने और यह जानने के लिए मजबूर करके कि कब फिर से शुरू करना है, एक छोटा, कुशल AI बड़े और लापरवाह मॉडलों से बेहतर प्रदर्शन कर सकता है।

यह एक ऐसे छात्र के बीच का अंतर है जो परीक्षा खत्म करने के लिए जल्दबाजी करता है और एक ऐसे छात्र के बीच जो हर उत्तर की दोबारा जांच करने के लिए समय लेता है। दूसरा छात्र बेहतर ग्रेड प्राप्त करता है, भले ही वे दोनों एक ही उम्र के हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →