SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research
यह शोध पत्र SearchSwarm को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो "डेलीगेशन इंटेलिजेंस" (प्रत्यायोजन बुद्धिमत्ता) वाले मॉडलों को प्रशिक्षित करने के लिए हार्नेस-गाइडेड प्रक्रिया के माध्यम से सुपरवाइज्ड फाइन-ट्यूनिंग डेटा को संश्लेषित करता है, जिससे वे एजेंट सबटास्क डेलीगेशन के माध्यम से लंबी अवधि के गहन अनुसंधान कार्यों को प्रभावी ढंग से विघटित और प्रबंधित करने में सक्षम होते हैं, जिसके परिणामस्वरूप BrowseComp बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ SearchSwarm पेपर का सरल, रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।
बड़ी समस्या: "शॉर्ट-टर्म मेमोरी" की बाधा
कल्पना कीजिए कि आप एक बेहद बुद्धिमान जासूस (AI) हैं जो एक बहुत बड़े और जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं, जिसमें हज़ारों दस्तावेज़ों को पढ़ना, सैकड़ों वेबसाइटों पर जाना और वर्षों के इतिहास के बीच कड़ियों को जोड़ना शामिल है।
समस्या क्या है? आपके पास एक बहुत सख्त नियम है: आप एक बार में अपने हाथ में केवल कुछ ही पन्ने के नोट्स रख सकते हैं।
AI की भाषा में, यह "कॉन्टेक्स्ट विंडो" (context window) है। यहाँ तक कि सबसे स्मार्ट AI मॉडल्स के पास भी एक बातचीत में कितनी जानकारी याद रखी जा सकती है, इसकी एक सीमा होती है। यदि कोई शोध कार्य बहुत लंबा हो जाता है, तो जांच के अंत तक पहुँचते-पहुँचते AI शुरुआत की जानकारी भूल जाता है।
पारंपरिक रूप से, जब कोई AI इस सीमा तक पहुँच जाता है, तो वह अपने नोट्स का "सारांश" (summarize) बनाने की कोशिश करता है। लेकिन यह एक 10 घंटे की फिल्म को केवल एक नैपकिन पर लिखे प्लॉट सारांश के माध्यम से याद रखने की कोशिश करने जैसा है। इसमें आप विवरण, सबूत और बारीकियों को खो देते हैं।
समाधान: "SearchSwarm" रणनीति
इस पेपर के लेखकों ने महसूस किया कि सब कुछ खुद याद रखने की कोशिश करने के बजाय, आपको भारी काम करने के लिए सहायकों की एक टीम रखनी चाहिए।
वे इसे "डेलीगेशन इंटेलिजेंस" (Delegation Intelligence) कहते हैं।
मुख्य AI को एक प्रोजेक्ट मैनेजर के रूप में और सब-AI (sub-AIs) को विशेषज्ञ शोधकर्ताओं के रूप में सोचें।
- प्रोजेक्ट मैनेजर (मुख्य एजेंट): यह समझदार दिमाग है। यह 500 वेबसाइटों को पढ़ने का कठिन काम नहीं करता है। इसके बजाय, यह बड़े सवाल को देखता है, उसे छोटे टुकड़ों में तोड़ता है, और कहता है, "तुम, जाओ X के बारे में पता लगाओ। तुम, जाओ Y के बारे में पता लगाओ।"
- शोधकर्ता (सब-एजेंट्स): ये उसी AI की प्रतियां हैं, लेकिन वे अपने अलग-अलग "कमरों" (स्वतंत्र कॉन्टेक्स्ट) में काम करते हैं। वे बिना प्रोजेक्ट मैनेजर की मेमोरी लिमिट की चिंता किए, जितनी ज़रूरत हो उतने पन्ने पढ़ सकते हैं।
- हैंडऑफ (Handoff): जब एक शोधकर्ता काम पूरा कर लेता है, तो वह मैनेजर पर 50 पन्नों की रिपोर्ट नहीं थोपता। वह विशिष्ट उद्धरणों (citations - प्रमाण कि उसे जानकारी कहाँ मिली) के साथ एक एक-पेज का सारांश लिखता है। मैनेजर उस सारांश को पढ़ता है, प्रमाण की जाँच करता है, और आगे बढ़ जाता है।
सीक्रेट सॉस: उन्होंने AI को डेलीगेट करना कैसे सिखाया
आप पूछ सकते हैं, "क्या AI इसे खुद नहीं समझ सकता?"
पेपर कहता है नहीं। अधिकांश AI मॉडल किताबों और लेखों पर प्रशिक्षित होते हैं, न कि उन स्क्रिप्ट्स पर जो यह दिखाती हैं कि एक टीम कैसे चलाई जाए। उन्हें स्वाभाविक रूप से यह नहीं पता होता कि मदद कैसे मांगनी है, क्या मांगना है, या काम की जाँच कैसे करनी है।
इसे ठीक करने के लिए, शोधकर्ताओं ने एक "ट्रेनिंग हार्नेस" (Training Harness) (नियमों और निर्देशों का एक सख्त सेट) बनाया ताकि AI को एक अच्छा मैनेजर बनना सिखाया जा सके।
यहाँ वे चार स्वर्णिम नियम दिए गए जो उन्होंने AI को सिखाए:
- नियम 1: कठिन काम खुद न करें। यदि किसी कार्य के लिए बहुत अधिक टेक्स्ट पढ़ने की आवश्यकता है, तो उसे सब-एजेंट को भेज दें। अपनी मानसिक शक्ति को कड़ियों को जोड़ने के लिए बचाकर रखें।
- नियम 2: एक बेहतरीन ब्रीफिंग दें। आप सब-एजेंट को केवल "जानकारी खोजो" नहीं कह सकते। आपको कहना होगा, "हम पहले से ही X और Y जानते हैं, लेकिन हम Z पर अटके हुए हैं। जाओ Z खोजो, और यह महत्वपूर्ण क्यों है, यह भी बताओ।" यह सब-एजेंट को वह चीज़ दोबारा खोजने में समय बर्बाद करने से रोकता है जो मैनेजर पहले से ही जानता है।
- नियम 3: अंतिम निर्णय अपने पास रखें। मैनेजर को कभी भी सब-एजेंट पर आँख मूंदकर भरोसा नहीं करना चाहिए। मैनेजर को सबूतों को सत्यापित करना चाहिए। यदि एक सब-एजेंट कहता है "उत्तर 42 है," तो मैनेजर को यह सुनिश्चित करने के लिए साइटेशन (citation) की जाँच करनी चाहिए कि यह 'हैलुसिनेशन' (झूठ या भ्रम) नहीं है।
- नियम 4: हमेशा अपने स्रोतों का उल्लेख करें। हर निष्कर्ष के साथ एक "रसीद" (स्रोत का लिंक) होनी चाहिए। यह सुनिश्चित करता है कि अंतिम उत्तर भरोसेमंद है।
परिणाम: दिग्गजों को हराता एक छोटा सा दल
शोधकर्ताओं ने SearchSwarm-30B नामक एक मॉडल को प्रशिक्षित किया (एक ऐसा मॉडल जिसमें 30 बिलियन पैरामीटर्स हैं, जिसे AI की दुनिया में "मध्यम आकार" का माना जाता है)।
उन्होंने इसका परीक्षण कठिन शोध बेंचमार्क (जैसे BrowseComp और GAIA) पर किया, जो अनिवार्य रूप से "कठिन सामान्य ज्ञान" परीक्षण हैं जिनमें गहरी खोज की आवश्यकता होती है।
चौंकाने वाला परिणाम:
SearchSwarm, जो कि एक मध्यम आकार का मॉडल है, ने अपने आकार के लगभग हर अन्य मॉडल को पीछे छोड़ दिया। इससे भी अधिक प्रभावशाली बात यह है कि इसने उन विशाल, क्लोज्ड-सोर्स मॉडल्स के बराबर या उनसे बेहतर प्रदर्शन किया जो इससे 10 गुना बड़े हैं और जिन्हें चलाने में लाखों खर्च होते हैं।
- उपमा: यह एक छोटे, अच्छी तरह से व्यवस्थित स्थानीय पुस्तकालय (SearchSwarm) द्वारा विशिष्ट, अज्ञात तथ्यों को खोजने में एक विशाल, अराजक राष्ट्रीय अभिलेखागार (विशाल मॉडल्स) को हराने जैसा है, केवल इसलिए क्योंकि स्थानीय लाइब्रेरियन अपने सहायकों को कार्य सौंपने (delegate करने) को सटीक रूप से जानता है।
यह भविष्य के लिए क्या मायने रखता है
यह पेपर केवल एक शानदार ट्रिक नहीं दिखाता; यह एक रेसिपी (नुस्खा) प्रदान करता है। उन्होंने कोड, ट्रेनिंग डेटा और मॉडल वेट्स (weights) सभी के उपयोग के लिए जारी कर दिए हैं।
उन्होंने साबित कर दिया कि बुद्धिमत्ता केवल एक बड़ा दिमाग होने के बारे में नहीं है; यह बेहतर प्रबंधन कौशल के बारे में है। AI को डेलीगेट करना, कार्यों को तोड़ना और साक्ष्य सत्यापित करना सिखाकर, एक छोटा, सस्ता मॉडल उन जटिल, दीर्घकालिक समस्याओं को हल कर सकता है जिनके लिए पहले विशाल, महंगे सुपर-कंप्यूटरों की आवश्यकता होती थी।
संक्षेप में: SearchSwarm AI को सब कुछ याद रखने के बजाय एक टीम चलाना सीखने की शिक्षा देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।