EvolveRouter: Co-Evolving Routing and Prompt for Multi-Agent Question Answering
EvolveRouter एक प्रशिक्षण योग्य ढांचा है जो एक क्लोज्ड-लूप रिफाइनमेंट प्रक्रिया और एक अनुकूली सहयोग तंत्र के माध्यम से एजेंट प्रॉम्प्ट्स और रूटिंग रणनीतियों को सह-विकसित करके मल्टी-एजेंट प्रश्न उत्तर को बढ़ाता है, जिससे यह सटीकता और दक्षता दोनों में अत्याधुनिक बेसलाइनों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, उच्च-दांव वाले ट्रिविया (trivia) टीम के मैनेजर हैं। आपके पास अपने रोस्टर में 24 अलग-अलग विशेषज्ञ हैं: कुछ गणित के जीनियस हैं, कुछ इतिहास के जानकार हैं, कुछ पैटर्न पहचानने में माहिर हैं, और अन्य बहस करने में उत्कृष्ट हैं।
समस्या क्या है? आपको यह नहीं पता कि कौन किस काम में सबसे अच्छा है।
यदि आप 19वीं सदी की कविता के बारे में एक प्रश्न पूछते हैं, तो आप गणित के जीनियस से पूछकर समय बर्बाद नहीं करना चाहते। यदि आप एक जटिल तर्क पहेली (logic puzzle) पूछते हैं, तो आप केवल इतिहास के जानकार पर निर्भर नहीं रहना चाहते। अतीत में, शोधकर्ताओं ने एक "मैनेजर" (एक राउटर) बनाकर इसे हल करने की कोशिश की जो सही सवाल के लिए सही विशेषज्ञ को चुन सके। लेकिन इसमें दो बड़ी कमियां थीं:
- विशेषज्ञ स्थिर थे: यदि कोई विशेषज्ञ किसी कार्य में इसलिए खराब था क्योंकि उसे दिए गए निर्देश गलत थे, तो मैनेजर को बस उसे टालना पड़ता था। विशेषज्ञों ने खुद को कभी बेहतर नहीं बनाया।
- टीम का आकार निश्चित था: मैनेजर या तो एक व्यक्ति को चुनता था या सभी 24 लोगों को एक साथ जवाब चिल्लाने के लिए कहता था। यह या तो बहुत जोखिम भरा था (गलत व्यक्ति को चुनना!) या बहुत महंगा (जब एक व्यक्ति ही काफी था, तब 24 लोगों पर समय और पैसा बर्बाद करना!)।
EvolveRouter से मिलिए। इसे एक सुपर-मैनेजर के रूप में सोचें जो न केवल खिलाड़ियों को चुनता है, बल्कि खेल के दौरान उन्हें प्रशिक्षित भी करता है।
यह कैसे काम करता है, इसे तीन सरल चरणों में समझा जा गया है:
1. "कोच की नज़र" (क्लोज्ड-लूप को-इवोल्यूशन)
एक कोच की कल्पना करें जो खेल देख रहा है। केवल एक खिलाड़ी को शॉट मिस करने पर बेंच पर बैठाने के बजाय, कोच उसे पास बुलाकर कहता है, "सुनो, तुम शॉट मिस कर रहे हो क्योंकि तुम गलत बास्केट की ओर देख रहे हो। चलो, अपनी मुद्रा (stance) को थोड़ा बदलते हैं।"
EvolveRouter बिल्कुल यही करता है।
- निदान (The Diagnosis): यह सभी 24 विशेषज्ञों से एक प्रश्न पूछता है। जब कोई विशेषज्ञ गलत होता है, तो सिस्टम केवल उत्तर को खारिज नहीं करता। यह विश्लेषण करता है कि वह क्यों विफल हुआ।
- सुधार (The Fix): यह उस विशेषज्ञ को दिए गए "बुरे" निर्देशों (प्रॉम्प्ट्स) को लेता है और उन्हें फिर से लिखता है। शायद यह एक नियम जोड़ दे जैसे, "हमेशा पहले तारीख की जांच करें," या "जब तक आप सुनिश्चित न हों, अनुमान न लगाएं।"
- लूप (The Loop): एक बार जब विशेषज्ञ को बेहतर निर्देशों के साथ "पुनः प्रशिक्षित" कर दिया जाता है, तो वह अधिक स्मार्ट हो जाता है। मैनेजर फिर इस स्मार्ट विशेषज्ञ से सीखता है, जिससे एक चक्र बनता है जहाँ टीम और मैनेजर दोनों एक साथ बेहतर होते जाते हैं।
2. "स्मार्ट हडल" (अनुकूली सहयोग)
पुराने दिनों में, मैनेजर के पास दो विकल्प थे: एक व्यक्ति को चुनना (जो जोखिम भरा था!) या सभी से पूछना (जो धीमा और महंगा था!)।
EvolveRouter एक डायनेमिक हडल रणनीति का उपयोग करता है।
- यह विशेषज्ञों से एक-एक करके पूछता है, उस व्यक्ति से शुरू करता है जिसके सही होने की संभावना सबसे अधिक होती है।
- पहले विशेषज्ञ के उत्तर देने के बाद, यह दूसरे से पूछता है। फिर तीसरे से।
- जादुई ठहराव (The Magic Stop): यह एक चलता हुआ हिसाब रखता है। जैसे ही शीर्ष विशेषज्ञ एक-दूसरे के साथ मजबूती से सहमत होने लगते हैं, मैनेजर कहता है, "ठीक है, हमारे पास हमारा उत्तर है! बाकी लोगों से पूछना बंद करो!"
- परिणाम: आसान सवालों के लिए, यह केवल 2 या 3 लोगों को पूछ सकता है (समय और पैसे की भारी बचत!)। बहुत कठिन सवालों के लिए, यह सुनिश्चित करने के लिए 10 या 15 लोगों को पूछ सकता है। यह सवाल की कठिनाई के अनुसार टीम के आकार को अनुकूलित करता है।
3. "ज्ञान मानचित्र" (दिमाग)
ये निर्णय लेने के लिए, EvolveRouter केवल प्रश्न के टेक्स्ट को नहीं देखता है। यह प्रश्न को तथ्यों, संस्थाओं (entities) और प्रत्येक विशेषज्ञ की विशिष्ट शक्तियों से जोड़ने वाला एक मानसिक मानचित्र (Knowledge Graph) बनाता है।
- इसे एक GPS की तरह समझें। यदि आप पूछते हैं, "मैं लाइब्रेरी कैसे जाऊं?", तो एक मानक GPS केवल सड़क को देखता है। EvolveRouter सड़क, ट्रैफिक, समय और आपकी ड्राइविंग आदतों को देखता है ताकि सबसे अच्छा रास्ता तय किया जा सके। यह सवाल के संदर्भ को समझता है ताकि जान सके कि उस विशिष्ट यात्रा के लिए कौन सा विशेषज्ञ "ड्राइवर" है।
यह एक बड़ी बात क्यों है?
- यह सस्ता है: हडल को जल्दी रोकने से, यह बहुत कम कंप्यूटर संसाधनों का उपयोग करता है (जिससे पैसा और ऊर्जा बचती है)।
- यह स्मार्ट है: क्योंकि यह विशेषज्ञों के निर्देशों को ठीक करता है, इसलिए टीम समय के साथ मजबूत होती है, न कि केवल मैनेजर।
- यह लचीला है: यह आसान सवालों को जल्दी और कठिन सवालों को पूरी गहराई के साथ संभालता है, बजाय इसके कि "एक ही तरीका सबके लिए" (one size fits all) अपनाया जाए।
संक्षेप में: EvolveRouter एक स्व-सुधारने वाली स्पोर्ट्स टीम की तरह है। यह केवल सर्वश्रेष्ठ खिलाड़ी को नहीं चुनता; यह खिलाड़ियों को बेहतर बनने के लिए कोचिंग देता है, और इसे पता होता है कि खेल के लिए कितने खिलाड़ियों को मैदान में उतारना है। परिणाम एक ऐसी टीम है जो पहले से कहीं अधिक तेज़, सस्ती और स्मार्ट है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।