Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design
यह शोध पत्र मार्को डीपरिसर्च (Marco DeepResearch) को प्रस्तुत करता है, जो एक सत्यापन-केंद्रित (verification-centric) गहन अनुसंधान एजेंट है जो QA डेटा संश्लेषण, प्रक्षेपवक्र निर्माण (trajectory construction) और टेस्ट-टाइम स्केलिंग में स्पष्ट सत्यापन तंत्रों को एकीकृत करके जटिल, दीर्घकालिक कार्यों पर प्रदर्शन को बढ़ाता है, जिससे यह चुनौतीपूर्ण बेंचमार्क पर बड़े पैमाने के मॉडलों से बेहतर प्रदर्शन करने में सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने मार्को (Marco) नाम के एक प्रतिभाशाली लेकिन अनुभवहीन रिसर्च असिस्टेंट को काम पर रखा है। आपका लक्ष्य उसे बेहद कठिन, बहु-चरणीय रहस्यों (जैसे "1995 में टोक्यो की एक विशिष्ट दुकान द्वारा बेची गई एक विशिष्ट विंटेज घड़ी की सटीक कीमत पता लगाएं, और मुझे बताएं कि उस दिन मौसम कैसा था") को हल करने के लिए तैयार करना है।
अतीत में, मार्को जैसे AI असिस्टेंट में एक बड़ी खामी थी: वे खुश करने के लिए बहुत उत्सुक रहते थे। यदि उन्हें कोई जानकारी मिलती जो सही दिखती थी, तो वे उसे पकड़ लेते, खोज बंद कर देते और आपको उत्तर दे देते—भले ही वह गलत हो। वे तथ्य भी बना लेते थे (hallucinations) या लूप में फंस जाते थे क्योंकि वे कभी अपने काम की दोबारा जांच नहीं करते थे।
यह पेपर मार्को डीपरिसर्च (Marco DeepResearch) को पेश करता है, जो इस असिस्टेंट का एक नया संस्करण है, जो बहुत अधिक स्मार्ट है, इसलिए नहीं कि वह "बड़ा" है (वह वास्तव में काफी छोटा और कुशल है), बल्कि इसलिए क्योंकि उसे एक नया सुपरपावर सिखाया गया है: सत्यापन (Verification)।
इसे उन्होंने कैसे ठीक किया, सरल शब्दों में यहाँ दिया गया है:
1. समस्या: "गति बनाम सटीकता" का जाल
कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है।
- पुराना AI: उत्तर कुंजी की पहली पंक्ति पढ़ता है, उसे लिख देता है, और तुरंत जमा कर देता है। यदि पहली पंक्ति एक चाल वाला सवाल थी, तो छात्र फेल हो जाता है।
- समस्या: वर्तमान AI एजेंट इंटरनेट पर तेजी से दौड़ते हैं, पहला संभावित उत्तर पकड़ते हैं, और रुक जाते हैं। वे यह जांच नहीं करते कि वे सही हैं या नहीं।
2. समाधान: "सत्यापन-केंद्रित" मेकओवर
शोधकर्ताओं ने मार्को की बुरी आदतों को ठीक करने के लिए उसे तीन नए उपकरण दिए। इसे उसके प्रशिक्षण शिविर को अपग्रेड करने के रूप में समझें।
A. बेहतर होमवर्क (सत्यापित डेटा संश्लेषण - Verified Data Synthesis)
इससे पहले कि मार्को सीख सके, उसे अभ्यास समस्याओं की आवश्यकता है।
- पुराना तरीका: शिक्षक (AI) कहानियों में नाम छिपाकर प्रश्न बनाते थे। कभी-कभी, उत्तर अद्वितीय नहीं होता था (दो अलग-अलग लोग उस विवरण में फिट बैठ सकते थे), या उत्तर गलत होता था। यह एक छात्र को गणित का सवाल देने जैसा है जिसमें दो सही उत्तर हैं; यह उन्हें भ्रमित करता है।
- नया तरीका: शोधकर्ताओं ने एक "गुणवत्ता नियंत्रण टीम" बनाई। इससे पहले कि मार्को को कोई अभ्यास प्रश्न दिया जाए, एक विशेष AI अटैकर (Attacker) उसे तोड़ने की कोशिश करता है। अटैकर एक अलग उत्तर खोजने की कोशिश करता है जो प्रश्न में फिट बैठता हो। यदि अटैकर सफल होता है, तो प्रश्न को बाहर कर दिया जाता है। केवल वे प्रश्न जिनमें एक एकल, निर्विवाद सही उत्तर होता है, प्रशिक्षण सेट तक पहुँचते हैं।
- उपमा: यह एक ताला बनाने वाले द्वारा चाबी का परीक्षण करने जैसा है। यदि एक चाबी दो अलग-अलग तालों को खोलती है, तो वह खराब चाबी है। वे केवल उन्हीं चाबियों को रखते हैं जो ठीक एक ही ताला खोलती हैं।
B. "दूसरी राय" का प्रशिक्षण (सत्यापन-संचालित प्रक्षेपवक्र - Verification-Driven Trajectories)
अब जब मार्को के पास अच्छा होमवर्क है, तो उसे सीखना होगा कि कैसे हल किया जाए।
- पुराना तरीका: मार्को एक बार में एक समस्या को हल करने की कोशिश करता था। यदि वह चरण 2 में फंस जाता या गलती करता, तो उसे अंत तक पता नहीं चलता, और पूरा उत्तर बेकार हो जाता।
- नया तरीका: उन्होंने मार्को को एक टीम की तरह काम करना सिखाया।
- डिटेक्टिव (Detective): बड़े रहस्य को छोटे सुरागों में तोड़ता है।
- इन्वेस्टरगेटर (Investigator): बाहर जाता है और सुराग ढूंढता है।
- ऑडिटर (Auditor): एक तीसरा AI जो केवल काम की जांच करता है। "क्या आपने वास्तव में वह दस्तावेज़ पाया? क्या वह तारीख सही है?"
- यदि ऑडिटर "नहीं" कहता है, तो डिटेक्टिव को वापस जाना पड़ता है और फिर से प्रयास करना पड़ता है।
- उपमा: एक शेफ की कल्पना करें जो एक जटिल व्यंजन बना रहा है। केवल अंत में भोजन चखने के बजाय, शेफ हर सामग्री को डालने के साथ उसे चखता है। यदि नमक बहुत अधिक है, तो वे एक खराब भोजन परोसने के बजाय उसे तुरंत ठीक करते हैं।
C. "दोबारा शुरू करने" का बटन (वेरिफायर-गाइडेड टेस्ट-टाइम स्केलिंग - Verifier-Guided Test-Time Scaling)
यह वास्तविक परीक्षा के दौरान जादू का कमाल है।
- पुराना तरीका: यदि मार्को फंस जाता है या बड़बड़ाने लगता है, तो वह तब तक चलता रहता है जब तक कि उसका समय या पैसा (कंप्यूटिंग बजट) खत्म न हो जाए, जिससे आमतौर पर एक अव्यवस्थित, गलत उत्तर मिलता है।
- नया तरीका: मार्को के पास एक "रीसेट बटन" है।
- यदि वह फंस जाता है या गलतियाँ करने लगता है (डिजेनरेशन), तो वह बटन दबा देता है।
- सब कुछ हटा दें (Discard All): वह अभी जो भी अव्यवस्थित नोट्स उसने लिखे हैं, उन्हें फेंक देता है।
- फिर से शुरू करें (Restart): वह एक स्पष्ट दिमाग के साथ नए सिरे से शुरू करता है, उसी बजट का उपयोग करता है लेकिन एक नई रणनीति के साथ।
- वह एक "जज" (Judge) को बैकग्राउंड में भी चलाता है। यदि उसे कोई उत्तर मिलता है, तो जज उसकी जांच करता है। यदि वह अच्छा दिखता है, तो वह उसे रखता है। यदि नहीं, तो वह और अधिक खोजता रहता है।
- उपमा: एक वीडियो गेम खेलने की कल्पना करें। यदि आप गड्ढे में गिर जाते हैं, तो किनारे से चलते रहने के बजाय, आप "रीस्टार्ट लेवल" दबाते हैं। आप एक अलग रास्ता आज़माते हैं। मार्को सर्वोत्तम समाधान खोजने के लिए इसे स्वचालित रूप से करता है।
3. परिणाम: छोटा लेकिन शक्तिशाली
सबसे प्रभावशाली बात मार्को का आकार है।
- अधिकांश शीर्ष-स्तरीय AI शोधकर्ता कठिन समस्याओं को हल करने के लिए "दिग्गज" (30 बिलियन+ पैरामीटर्स) बना रहे हैं।
- मार्को बहुत छोटा है (8 बिलियन पैरामीटर्स)। वह एक भारी टैंक की तुलना में एक कॉम्पैक्ट स्पोर्ट्स कार की तरह है।
- परिणाम: छोटा होने के बावजूद, मार्को कई कठिन परीक्षणों पर दिग्गजों को हरा देता है। वह चीनी वेब खोज जैसे विशिष्ट कार्यों पर कुछ 30-बिलियन पैरामीटर वाले मॉडलों को भी मात देता है।
सारांश
मार्को डीपरिसर्च (Marco DeepResearch) साबित करता है कि आपको स्मार्ट होने के लिए बड़े दिमाग की आवश्यकता नहीं है; आपको बस बेहतर आदतों की आवश्यकता है। उसे अपना काम जांचने, अपने स्रोतों को सत्यापित करने और यह जानने के लिए मजबूर करके कि कब फिर से शुरू करना है, एक छोटा, कुशल AI बड़े और लापरवाह मॉडलों से बेहतर प्रदर्शन कर सकता है।
यह एक ऐसे छात्र के बीच का अंतर है जो परीक्षा खत्म करने के लिए जल्दबाजी करता है और एक ऐसे छात्र के बीच जो हर उत्तर की दोबारा जांच करने के लिए समय लेता है। दूसरा छात्र बेहतर ग्रेड प्राप्त करता है, भले ही वे दोनों एक ही उम्र के हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।