← नवीनतम पेपर
🤖 AI

M3^3Prune: Hierarchical Communication Graph Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation

यह शोध पत्र M3^3Prune का प्रस्ताव करता है, जो एक नवीन पदानुक्रमित संचार ग्राफ प्रूनिंग फ्रेमवर्क है जो मल्टी-मोडल मल्टी-एजेंट रिट्रीवल-ऑगमेंटेड जनरेशन को व्यवस्थित रूप से इंटर- और इंट्रा-मोडल किनारों (edges) को समाप्त करके अनुकूलित करता है ताकि कार्य प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए टोकन ओवरहेड को महत्वपूर्ण रूप से कम किया जा सके।

मूल लेखक: Weizi Shao, Taolin Zhang, Zijie Zhou, Chen Chen, Chengyu Wang, Xiaofeng He

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Weizi Shao, Taolin Zhang, Zijie Zhou, Chen Chen, Chengyu Wang, Xiaofeng He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल किताबें पढ़ते या तस्वीरें देखते ही नहीं, बल्कि समस्याओं को हल करने के लिए एक-दूसरे से वास्तव में "बात" भी करते हैं। यह विज्ञान का वह रोमांचक कोना है जिसे मल्टी-एजेंट सिस्टम (multi-agent systems) कहा जाता है। इसे एक स्टडी ग्रुप की तरह समझें जहाँ प्रत्येक छात्र के पास एक सुपरपावर है: एक पढ़ने का जादूगर है, दूसरा दृश्य कलाकार (visual artist) है, और तीसरा तर्क का जीनियस है। एक अकेले छात्र द्वारा सब कुछ करने के बजाय, वे आपस में नोट्स साझा करते हैं, अपनी कौशलों को मिलाकर कठिन प्रश्नों के उत्तर देते हैं। इस दृष्टिकोण को रिट्रीवल-ऑगमेंटेड जनरेशन (Retriement-Augmented Generation - RAG) कहा जाता है, जो इन AI "छात्रों" को बेहतर सोचने के लिए बाहरी स्रोतों से जानकारी प्राप्त करने की अनुमति देता है। जब आप इस मिश्रण में टेक्स्ट और छवियों को मिलाते हैं, तो इसे मल्टी-मोडल RAG कहा जाता है। बड़ी बात यह है कि जहाँ यह टीम वाला दृष्टिकोण अविश्वसनीय रूप से स्मार्ट है, वहीं यह बहुत अधिक "बातूनी" भी है। हर बार जब छात्र एक नोट दूसरे को भेजते हैं, तो डिजिटल दुनिया में इसकी एक लागत और समय लगता है। यदि समूह बहुत बड़ा हो जाता है या बहुत अधिक बातें करता है, तो पूरा सिस्टम वास्तविक दुनिया के कार्यों के लिए बहुत महंगा और धीमा हो जाता है।

यहाँ M3^3Prune आता है, एक नया फ्रेमवर्क जिसे इन AI टीमों को बेहतर श्रोता और अधिक कुशल वक्ता बनने के लिए सिखाने के लिए डिज़ाइन किया गया है। इस शोध पत्र के पीछे के शोधकर्ताओं ने देखा कि हालांकि कई एजेंटों का संचार करना शक्तिशाली है, लेकिन वर्तमान प्रणालियाँ एक भीड़भाड़ वाली पार्टी की तरह हैं जहाँ हर कोई एक साथ चिल्ला रहा है। इसमें बहुत अधिक "टोकन ओवरहेड" (token overhead) है—जो एक फैंसी तरीका है यह कहने का कि सिस्टम अनावश्यक बातचीत पर डिजिटल स्थान बर्बाद कर रहा है। इसे ठीक करने के लिए, लेखक संचार नेटवर्क में अनावश्यक कनेक्शनों को "प्रून" (prune) करने या छाँटने का एक तरीका प्रस्तावित करते हैं।

यहाँ बताया गया है कि M3^3Prude कैसे काम करता है, एक अराजक कक्षा परियोजना (classroom project) को व्यवस्थित करने के उदाहरण का उपयोग करते हुए। सबसे पहले, सिस्टम "टेक्स्ट" वाले छात्रों और "इमेज" वाले छात्रों को अलग-अलग देखता है। यह एक सख्त शिक्षक की तरह कार्य करता है जो कहता है, "उन चीजों के बारे में नोट्स भेजना बंद करो जो मायने नहीं रखतीं। केवल उन्हीं नोट्स को रखें जो समस्या को हल करने के लिए बिल्कुल महत्वपूर्ण हैं।" इसे इंट्रा-मोडल ग्राफ स्पारसीफिकेशन (intra-modal graph sparsification) कहा जाता है। यह प्रत्येक समूह के भीतर के शोर को काट देता है।

इसके बाद, सिस्टम यह देखता है कि टेक्स्ट समूह और इमेज समूह एक-दूसरे से कैसे बात करते हैं। हर टेक्स्ट छात्र को हर इमेज छात्र पर चिल्लाने देने के बजाय, सिस्टम एक डायनेमिक कम्युनिकेशन टोपोलॉजी (dynamic communication topology) बनाता है। कल्पना कीजिए कि कक्षा का एक नक्शा बनाना और केवल उन्हीं गलियारों को रखना जो उन छात्रों को जोड़ते हैं जिन्हें वास्तव में सहयोग करने की आवश्यकता है। यह इंटर-मोडल ग्राफ स्पारसीफिकेशन (inter-modal graph sparsification) है। अंत में, सिस्टम एक कदम आगे जाता है, और एक स्पष्ट, कुशल श्रृंखला बनाने के लिए और भी अधिक किनारों (edges) को धीरे-धीरे छाँटता है। इसे एक उलझे हुए कनेक्शन के जाल को एक स्पष्ट, कुशल कमांड चेन में बदलने के रूप में सोचें जहाँ सूचना बिना पाइपों को जाम किए सुचारू रूप से प्रवाहित होती है।

शोध पत्र सुझाव देता है कि यह विधि एक 'स्वीट स्पॉट' बनाती है: AI टीम शोर-शराबे वाले, महंगे संस्करणों जितनी ही स्मार्ट और सक्षम रहती है, लेकिन काम पूरा करने के लिए यह काफी कम टोकन (डिजिटल शब्द और डेटा) का उपयोग करती है। विभिन्न बेंचमार्क पर अपने परीक्षणों में, लेखकों ने पाया कि M3^3Prune ने सिंगल-एजेंट सिस्टम और अन्य मजबूत मल्टी-एजेंट सेटअप दोनों को लगातार पछाड़ दिया। परिणाम एक ऐसा सिस्टम है जो न केवल चलाने में तेज़ और सस्ता है, बल्कि उच्च प्रदर्शन भी बनाए रखता है, जो यह सिद्ध करता है कि कभी-कभी, कम कहना वास्तव में आपको अधिक समझने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →