Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning
यह शोधपत्र GRADE को प्रस्तुत करता है, जो एक पदानुक्रमित मल्टी-एजेंट सिस्टम है जो एजेंट चयन, तर्क की गहराई और संचार को गतिशील रूप से अनुकूलित करने के लिए सीखे गए गेटिंग मैकेनिज्म और एक नवीन क्रिटिक-मुक्त प्रशिक्षण एल्गोरिदम का उपयोग करता है, जिससे मौजूदा बेसलाइनों की तुलना में काफी कम सक्रिय कंप्यूट के साथ जटिल बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, उच्च-दांव वाली ट्रिविया नाइट (trivia night) चला रहे हैं। काम करने का पुराना तरीका एक सुपर-जीनियस को काम पर रखना था, लेकिन वे इतने महंगे और धीमे थे कि आप उन्हें हर एक सवाल पूछने के लिए वहन नहीं कर सकते थे। अगला विचार विशेषज्ञों की एक पूरी टीम को काम पर रखना था और हर किसी से हर सवाल का जवाब लेना था, फिर सबसे अच्छे जवाब पर वोट करना था। लेकिन यह एक स्टेडियम भर लोगों को काम पर रखने जैसा है, सिर्फ यह पूछने के लिए कि, "2+2 क्या होता है?" यह पैसे और समय की बर्बादी है।
यहाँ आता है GRADE (Gated Routing and Adaptive Depth for Efficient Reasoning), जो IIT दिल्ली के शोधकर्ताओं द्वारा विकसित एक नया सिस्टम है, जो एक अत्यंत कुशल, हाइपर-ऑर्गनाइज्ड टीम कैप्टन की तरह काम करता है। हर सवाल के लिए पूरी टीम को जगाने के बजाय, GRADE चार छोटे, स्मार्ट "गेट्स" (gates) का उपयोग करता है यह तय करने के लिए कि वास्तव में किसे बात करने की आवश्यकता है, बातचीत कितनी गहरी होनी चाहिए, और समय बर्बाद करना कब बंद करना है।
टीम कैप्टन और चार गेट्स
GRADE को एक तीन-मंजिला ऑफिस बिल्डिंग की तरह समझें।
- लेवल 0 फ्रंट डेस्क है (ऑर्केस्ट्रेटर/Orchestrator)।
- लेवल 1 में दो मैनेजर हैं।
- लेवल 2 विशेषज्ञों (सब-एजेंट्स/Sub-Agents) से भरा बेसमेंट है।
जब कोई सवाल आता है, तो GRADE पूरे बिल्डिंग में चिल्लाकर शोर नहीं मचाता। यह चार सीखे हुए "गेट्स" का उपयोग करके निर्णय लेता है:
- असाइनमेंट गेट (The Assignment Gate): यह गेट पूछता है, "जवाब वास्तव में किसे पता है?" यदि सवाल गणित के बारे में है, तो यह गणित के विशेषज्ञों को जगाता है। यदि यह इतिहास के बारे में है, तो यह इतिहास के लोगों को बुलाता है। यह बायोलॉजी टीम को परेशान नहीं करता।
- डेप्थ गेट (The Depth Gate): यह "यह कितना कठिन है?" मापने वाला मीटर है। आसान सवालों के लिए (जैसे "2+2 क्या है?"), गेट कहता है, "यहीं रुक जाओ, फ्रंट डेस्क पर।" मैनेजरों या बेसमेंट को जगाने की कोई जरूरत नहीं है। बहुत कठिन सवालों के लिए, यह विशेषज्ञों तक जाने वाले दरवाजे पूरी तरह खोल देता है।
- क्रॉस-रीड गेट (The Cross-Read Gate): यह "कॉफी ब्रेक" का नियम है। कभी-कभी, एक कठिन समस्या को हल करने के लिए एक गणित विशेषज्ञ को भौतिकी (physics) विशेषज्ञ के साथ चर्चा करने की आवश्यकता होती है। यह गेट तय करता है कि कौन सी जोड़ियाँ आपस में बात कर सकती हैं। पेपर में पाया गया कि सभी को एक-दूसरे से बात करने देना वास्तव में चीजों को बदतर बना देता है (जैसे एक अराजक कैफेटेरिया), लेकिन लगभग आधी जोड़ियों को आपस में बात करने देना ही सबसे सटीक तरीका है।
- प्रून गेट (The Prune Gate): यह "शोर को काटने" वाला फिल्टर है। यदि कोई विशेषज्ञ बहुत अधिक विस्तार में जाने लगता है या कोई बेकार उत्तर देता है, तो यह गेट उनके उत्तर को अंतिम समाधान में मिलने से पहले ही काट देता है।
गुप्त नुस्खा: मिलकर सीखना
यह टीम इतनी अच्छी तरह से काम करना कैसे सीखती है? शोधकर्ताओं ने CoGRPO नामक प्रशिक्षण पद्धति का उपयोग किया। कल्पना कीजिए कि एक कोच जो न केवल अंतिम उत्तर को ग्रेड देता है, बल्कि पूरी टीम की रणनीति पर भी नज़र रखता है। यदि टीम सही उत्तर देती है, तो उस विशिष्ट रणनीति में शामिल हर कोई (वे गेट्स जो खुले, वे विशेषज्ञ जिन्होंने बात की) प्रशंसा पाता है। यदि वे विफल होते हैं, तो वे सभी एक सौम्य "फिर से प्रयास करें" का संदेश पाते हैं।
महत्वपूर्ण रूप से, पेपर इस बात के खिलाफ तर्क देता है कि एक अलग "क्रिटिक" (एक दूसरा AI जो पहले वाले का न्याय करता है) का उपयोग किया जाए। शोधकर्ताओं ने पाया कि यह अतिरिक्त जज वास्तव में चीजों को धीमा कर देता है और टीम को कम प्रभावी बनाता है। इसके बजाय, उन्होंने टीम को उसी बैच में अन्य प्रयासों की तुलना में अपने प्रदर्शन के आधार पर खुद को ग्रेड करने दिया।
परिणाम: बड़ा नहीं, बल्कि स्मार्ट
इस सिस्टम का परीक्षण कुछ सबसे कठिन दिमागी पहेलियों पर किया गया, जैसे गणित की समस्याएं (GSM8K), सामान्य ज्ञान (MMLUPro), और विज्ञान के प्रश्न (GPQA)।
- बड़ी जीत: GRADE ने MMLUPro (78.2% बनाम 73.4%) और GPQA पर सबसे मजबूत पिछले टीम (जिसे Puppeteer कहा जाता है) को बड़े अंतर से हराया, भले ही GRADE ने केवल 17 बिलियन सक्रिय पैरामीमीटर का उपयोग किया। विजेता टीम (Puppeteer) ने लगभग 28 बिलियन का उपयोग किया था। यह ऐसा है जैसे GRADE ने एक हल्का बैकपैक लेकर दौड़ जीत ली हो।
- गति: क्योंकि GRADE आसान सवालों पर भारी काम को छोड़ देता है, इसलिए यह बहुत तेज़ है। आसान सवालों में लगभग 3.1 सेकंड लगते हैं, जबकि सबसे कठिन सवालों में 11.4 सेकंड तक लग सकते हैं। पुराने तरीके में कठिनाई की परवाह किए बिना हर चीज़ के लिए सीधा 13 सेकंड लगता था।
- एक जगह जहाँ वे हार गए: सुपर-हार्ड मैथ कॉम्पिटिशन (AIME-2025) में, पुराने दिग्गज अभी भी थोड़े अंतर से जीत गए (27.2% बनाम 25.3%)। पेपर का सुझाव है कि ऐसा इसलिए है क्योंकि इन विशिष्ट समस्याओं के लिए एक लंबे तर्क क्रम को बनाए रखने के लिए एक एकल, विशाल मस्तिष्क की आवश्यकता होती है, और GRADE के छोटे, विशिष्ट विशेषज्ञ उस अत्यधिक गहराई का मुकाबला करने में सक्षम नहीं थे।
"हॉट-स्वैप" (Hot-Swap) का आश्चर्य
यहाँ एक बहुत ही दिलचस्प हिस्सा है: शोधकर्ताओं ने दिखाया कि आप खेल के बीच में एक विशेषज्ञ को बदल सकते हैं (जैसे एक स्थानीय कंप्यूटर मॉडल को क्लाउड-आधारित मॉडल से बदलना) बिना सिस्टम को तोड़े।
हालाँकि, उन्होंने साबित किया कि बदलने के दौरान आपको एक "कैलिब्रेशन मैप" (एक छोटा एडजस्टमेंट टूल) का उपयोग करना अनिवार्य है। यदि आप गेट्स को एडजस्ट किए बिना बस विशेषज्ञ को बदल देते हैं, तो सिस्टम क्रैश हो जाता है और सटीकता तुरंत 18 अंक गिर जाती है। कैलिब्रेशन मैप के साथ, सिस्टम कुछ ही सवालों में (कभी-कभी केवल 3 या 4 में) अपनी सटीकता वापस पा लेता है। इसके बिना, इसे ठीक होने में बहुत समय लगता है, यदि यह कभी ठीक हो भी पाए।
उन्होंने क्या खारिज किया
पेपर बहुत स्पष्ट है कि क्या काम नहीं करता है:
- फिक्स्ड टीमें (Fixed Teams): हर सवाल के लिए विशेषज्ञों की एक निश्चित संख्या (चाहे वह 1, 2, या 5 हो) का जवाब देना, सिस्टम को गतिशील रूप से निर्णय लेने देने की तुलना में खराब है।
- बहुत अधिक चर्चा: हर विशेषज्ञ को दूसरे विशेषज्ञ से बात करने देना प्रदर्शन को नुकसान पहुँचाता है। पेपर ने पाया कि 100% की तुलना में 50% जोड़ियों को बात करने देना बेहतर है।
- अलग क्रिटिक्स: टीम के काम को जज करने के लिए एक अलग AI का उपयोग करना, टीम के खुद को ग्रेड करने की तुलना में कम प्रभावी है।
निचोड़
GRADE यह सुझाव देता है कि AI का भविष्य केवल बड़े, भारी मॉडल बनाने के बारे में नहीं है। यह स्मार्ट, अधिक लचीली टीमें बनाने के बारे में है जो जानती हैं कि कब कड़ी मेहनत करनी है और कब ब्रेक लेना है। प्रश्नों को रूट करने, गहराई को नियंत्रित करने और बुरे विचारों को छाँटने के लिए इन चार गेट्स का उपयोग करके, यह सिस्टम कम कंप्यूटिंग पावर का उपयोग करते हुए भी शीर्ष स्तर के परिणाम प्राप्त करता है। यह सबसे बड़े दिमाग के बारे में नहीं है; यह सबसे अच्छे टीम कैप्टन के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।