← नवीनतम पेपर
🤖 machine learning

Towards Robust Federated Multimodal Graph Learning under Modality Heterogeneity

यह शोध पत्र FedMPO का प्रस्ताव करता है, जो एक सुदृढ़ फेडरेटेड मल्टीमॉडल ग्राफ लर्निंग फ्रेमवर्क है जो टोपोलॉजी-अवेयर क्रॉस-मोडल जनरेशन, मिसिंग-अवेयर एक्सपर्ट रूटिंग और रिलायबिलिटी-अवेयर एग्रीगेशन के माध्यम से मोडैलिटी विषमता (modality heterogeneity) और डेटा अलगाव को संबोधित करता है ताकि हाई-मिसिंग और नॉन-IID सेटिंग्स में मौजूदा विधियों से बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Sirui Zhang, Haonan Wang, Xunkai Li, Zekai Chen, Shumeng Li, Hongchao Qin, Rong-Hua Li, Guoren Wang

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sirui Zhang, Haonan Wang, Xunkai Li, Zekai Chen, Shumeng Li, Hongchao Qin, Rong-Hua Li, Guoren Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि दोस्तों का एक समूह मिलकर एक विशाल, जटिल पहेली (puzzle) को सुलझाने की कोशिश कर रहा है। प्रत्येक मित्र के पास पहेली का एक टुकड़ा है, लेकिन दो बड़ी समस्याएँ हैं:

  1. गोपनीयता (Privacy): वे एक-दूसरे को अपने वास्तविक पहेली के टुकड़े नहीं दिखा सकते (क्योंकि गोपनीयता के नियम हैं)।
  2. गायब टुकड़े (Missing Pieces): कुछ मित्रों के पास अपनी पहेली के पूरे हिस्से गायब हैं। शायद उन्होंने आसमान का चित्र खो दिया है, या पेड़ों वाला हिस्सा।

यह बिल्कुल वही समस्या है जिसे FEDMPO पेपर हल करने की कोशिश करता है। यह कंप्यूटरों को (विशेष रूप से "फेडरेटेड मल्टीमॉडल ग्राफ लर्निंग" को) यह सिखाने के बारे में है कि वे बिना अपना कच्चा डेटा साझा किए, और तब भी कैसे मिलकर काम करें जब कुछ डेटा गायब हो।

यहाँ बताया गया है कि उन्होंने इसे रोजमर्रा के उदाहरणों का उपयोग करके कैसे किया है।

समस्या: "टूटी हुई पहेली" की दुविधा

वास्तविक दुनिया में, डेटा अक्सर विभिन्न रूपों (modalities) में आता है, जैसे टेक्स्ट, फोटो और नंबर। कभी-कभी, किसी कंपनी या व्यक्ति के पास फोटो होती है लेकिन टेक्स्ट नहीं होता, या इसके विपरीत।

  • पुरानी विधि 1 (केंद्रीकृत/Centralized): कल्पना कीजिए कि हर कोई अपनी पहेली के टुकड़ों को एक बड़ी मेज पर हल करने के लिए मेल कर रहा है। यह बहुत अच्छा काम करता है, लेकिन वास्तविक दुनिया में, आप अपने निजी फोटो या डेटा को एक केंद्रीय सर्वर को मेल नहीं कर सकते।
  • पुरानी विधि 2 (फेडरेटेड लेकिन सरल): कल्पना कीजिए कि हर कोई अपने टुकड़े घर पर ही रखता है और एक लीडर को अपनी प्रगति का एक "सारांश" (summary) भेजता है। लीडर सारांशों का औसत निकालता है। लेकिन यदि एक मित्र की पहेली का आधा हिस्सा गायब है, तो उसका सारांश केवल एक अनुमान होगा। यदि लीडर इन अनुमानों का अंधाधड़ औसत निकालता है, तो अंतिम चित्र धुंधला और गलत हो जाएगा।

लेखकों ने महसूस किया कि मौजूदा विधियों ने या तो गोपनीयता के नियमों की अनदेखी की या समूह में काम करते समय "गायब टुकड़ों" को प्रभावी ढंग से संभालने का तरीका नहीं जाना।

समाधान: FEDMPO (एक स्मार्ट टीम लीडर)

लेखकों ने FEDMPO नामक एक नई प्रणाली बनाई है। इसे एक स्मार्ट टीम लीडर के रूप में सोचें जो यह जानता है कि अपने पड़ोसियों से सुराग लेकर अपने दोस्तों के गायब पहेली के टुकड़ों को भरने में कैसे मदद की जाए, बिना वास्तव में उन गायब टुकड़ों को देखे।

यहाँ FEDMPO चार चरणों में कैसे काम करता है:

1. "पड़ोस का स्काउट" (टोपोलॉजी-अवेयर जनरेशन)

आमतौर पर, यदि आपकी पहेली का एक टुकड़ा गायब है, तो आप अनुमान लगा सकते हैं कि वह अपने ठीक बगल वाले टुकड़ों के आधार पर कैसा दिखेगा।

  • नवाचार: FEDMPO केवल आपके बगल के टुकड़ों को नहीं देखता है। यह पूरे पड़ोस को देखता है। यदि आपका मित्र एक "पेड़" का चित्र खो चुका है, लेकिन उसके पड़ोसी के पास "जंगल" का चित्र है और उसके बगल वाले मित्र के पास "आसमान" का चित्र है, तो FEDMPO उन आसपास के सुरागों का उपयोग यह अनुमान लगाने के लिए करता है कि गायब पेड़ कैसा दिखना चाहिए।
  • यह क्यों महत्वपूर्ण है: यह नेटवर्क की संरचना (कौन किससे जुड़ा है) का उपयोग करता है ताकि केवल अपने स्वयं के डेटा को देखने की तुलना में बेहतर अनुमान लगाया जा सके।

2. "ट्रस्ट फ़िल्टर" (मिसिंग-अवेयर एक्सपर्ट रूटिंग)

अब, कल्पना कीजिए कि आपका मित्र गायब टुकड़े के बारे में एक अनुमान लगाता है। क्या वह अनुमान अच्छा है? हो सकता है कि उसके पास बहुत सारे सुराग हों, इसलिए वह एक बेहतरीन अनुमान है। हो सकता है कि उसके पास बहुत कम सुराग हों, इसलिए वह एक कमजोर, बुरा अनुमान है।

  • नवाचार: FEDMPO में एक "ट्रस्ट फ़िल्टर" है। यह जाँचता है कि अनुमान कितना विश्वसनीय है।
    • यदि अनुमान अत्यधिक विश्वसनीय (highly confident) है, तो यह इसे वास्तविक टुकड़ों के साथ मिला देता है।
    • यदि अनुमान कम विश्वसनीय (low confidence/noisy) है, तो फ़िल्टर कहता है, "रुको, यह गलत हो सकता है," और इसे कम महत्व देता है।
    • यदि अनुमान बहुत खराब है, तो सिस्टम इसे अनदेखा कर देता है और केवल पहेली की संरचना (कनेक्शन) पर भरोसा करता है न कि उस बुरे अनुमान पर।
  • यह क्यों महत्वपूर्ण है: यह बुरे अनुमानों को अंतिम चित्र को खराब करने से रोकता है।

3. "निष्पक्ष वोट" (रिलायबिलिटी-अवेयर एग्रीगेशन)

अंत में, सभी अपनी प्रगति रिपोर्ट लीडर को भेजते हैं।

  • समस्या: पुराने सिस्टम में, लीडर बस यह गिनता था कि प्रत्येक व्यक्ति के पास कितने टुकड़े हैं। यदि किसी व्यक्ति के पास 1,000 टुकड़े थे लेकिन उनमें से 900 बुरे अनुमान थे, तो उनके बुरे विचार समूह के अंतिम चित्र पर हावी हो जाते।
  • नवाचार: FEDMPO का लीडर केवल रिपोर्ट के आकार को नहीं, बल्कि उसकी गुणवत्ता को देखता है।
    • "आपके पास कई टुकड़े हैं, लेकिन आपके 'ट्रस्ट फ़िल्टर' ने कहा कि वे संदिग्ध अनुमान थे। इसलिए, आपके वोट की गिनती कम होगी।"
    • "आपके पास कम टुकड़े हैं, लेकिन आपके अनुमान बहुत विश्वसनीय थे। आपका वोट अधिक गिना जाएगा।"
  • यह क्यों महत्वपूर्ण है: यह समूह को अविश्वसनीय डेटा द्वारा नीचे खींचने से रोकता है।

परिणाम: एक स्पष्ट तस्वीर

लेखकों ने खरीदारी की वस्तुओं, डांस वीडियो और सोशल मीडिया पोस्ट जैसी चीजों से जुड़े छह अलग-अलग "पहेलियों" (डेटासेट्स) पर इस प्रणाली का परीक्षण किया। उन्होंने ऐसी स्थितियों का अनुकरण किया जहाँ डेटा गायब था और जहाँ सभी का डेटा एक-दूसरे से बहुत अलग था।

  • परिणाम: FEDMमंडल ने किसी भी पिछली विधि की तुलना में पहेलियों को बेहतर ढंग से सुलझाया।
  • लाभ: सबसे कठिन परिदृश्यों में (जहाँ डेटा बहुत अधिक गायब था और बहुत अलग था), FEDMPO ने सटीकता में 5.65% तक सुधार किया। यह सुनने में छोटा लग सकता है, लेकिन AI की दुनिया में, यह एक बहुत बड़ी छलांग है।

सारांश

FEDMPO को एक रहस्य सुलझाने वाली जासूसों की एक स्मार्ट टीम के रूप में समझें।

  1. वे अपनी निजी नोटबुक साझा नहीं कर सकते (गोपनीयता)।
  2. कुछ जासूसों के पास फटे हुए पन्ने हैं (गायब डेटा)।
  3. अंधेरे में अनुमान लगाने के बजाय, वे खाली जगहों को भरने के लिए अपने पड़ोसियों से मिले सुरागों का उपयोग करते हैं (टोपोलॉजी-अवेयर)।
  4. वे किसी भी सुराग का उपयोग करने से पहले यह जाँचते हैं कि वह कितना विश्वसनीय है (ट्रस्ट फ़िल्टर)।
  5. टीम लीडर जासूसों की रिपोर्ट को उनके द्वारा लिखे गए शब्दों की संख्या के आधार पर नहीं, बल्कि उनकी विश्वसनीयता के आधार पर तौलता है (निष्पक्ष वोट)।

परिणामस्वरूप, यह समाधान पिछले तरीकों की तुलना में बहुत अधिक मजबूत, सटीक और भरोसेमंद समाधान प्रदान करता है, भले ही डेटा अव्यवस्थित और अधूरा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →