← नवीनतम पेपर
💻 computer science

PrivFusion: A Privacy-preserving Multi-Agent Framework for Harmonizing Distributed Datasets

PrivFusion एक गोपनीयता-संरक्षित मल्टी-एजेंट फ्रेमवर्क है जो पुनरावृत्ति विशेषता संरेखण (iterative feature alignment) के माध्यम से विषम वितरित नैदानिक डेटासेट के सामंजस्य को स्वचालित करता है, जिससे प्रभावी फेडरेटेड लर्निंग के लिए एक महत्वपूर्ण बाधा दूर होती है।

मूल लेखक: Anisa Halimi, Liubov Nedoshivina, Kieran Fraser, Stefano Braghin

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anisa Halimi, Liubov Nedoshivina, Kieran Fraser, Stefano Braghin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पॉटलक डिनर (potluck dinner) आयोजित करने की कोशिश कर रहे हैं जहाँ हर कोई एक व्यंजन लाता है, लेकिन किसी को भी अपने स्वयं के किचन से बाहर जाने की अनुमति नहीं है। लक्ष्य एक एकल, स्वादिष्ट मेनू बनाना है जिसे हर कोई मिलकर आनंद ले सके। हालाँकि, इसमें एक पेंच है: प्रत्येक रसोइया अलग-अलग मापने वाले कपों का उपयोग करता है, अलग-अलग भाषाएँ बोलता है, और एक ही सामग्री को अलग-अलग नामों से पुकारता है। एक व्यक्ति इसे "फ्लोर" (आटा) कहता है, दूसरा "व्हीट पाउडर" (गेहूं का पाउडर), और तीसरा इसे "व्हाइट डस्ट" (सफेद धूल) कहता है।

यह बिल्कुल वही समस्या है जिसका सामना अस्पताल और अनुसंधान संस्थान तब करते हैं जब वे एआई (AI) मॉडल को प्रशिक्षित करने के लिए अपने चिकित्सा डेटा को संयोजित करना चाहते हैं। वे गोपनीयता कानूनों के कारण अपने रोगी रिकॉर्ड को एक केंद्रीय कंप्यूटर पर नहीं भेज सकते। यहीं पर फेडरेटेड लर्निंग (Federated Learning) काम आती है: यह उन्हें डेटा को स्थानांतरित किए बिना मिलकर AI को प्रशिक्षित करने की अनुमति देती है। लेकिन, जैसा कि पेपर में बताया गया है, यह प्रणाली अक्सर विफल हो जाती है क्योंकि डेटा बहुत अव्यवस्थित और असंगत होता है।

मिलिए प्रिवफ्यूजन (PrivFusion) से, जो एक नया "डिजिटल मैचमेकर" है जिसे खाना पकाने (प्रशिक्षण) शुरू होने से पहले ही इस गड़बड़ी को ठीक करने के लिए डिज़ाइन किया गया है।

समस्या: डेटा का "टॉवर ऑफ बेबेल" (Tower of Babel)

लेखक बताते हैं कि हालांकि फेडरेटेड लर्निंग सैद्धांतिक रूप से बेहतरीन है, लेकिन वास्तविकता में यह एक दीवार से टकरा जाती है। एक अस्पताल रोगी की आयु को संख्या के रूप में दर्ज कर सकता है (जैसे, "45"), जबकि दूसरा इसे टेक्स्ट के रूप में लिख सकता है ("forty-five")। एक स्थान को शहर के नाम के रूप में सूचीबद्ध कर सकता है, दूसरा जीपीएस (GPS) निर्देशांक के रूप में, और तीसरा देश के कोड के रूप में।

पारंपरिक रूप से, इसे ठीक करने के लिए विशेषज्ञों की एक टीम को हजारों पंक्तियों के डेटा को मैन्युअल रूप से फिर से लिखने के लिए बैठना पड़ता है। यह धीमा, महंगा है, और अक्सर गोपनीयता नियमों को तोड़े बिना करना असंभव है।

समाधान: डिजिटल एजेंटों की एक टीम

प्रिवफ्यूजन इसे AI एजेंटों (विशेषज्ञ डिजिटल सहायकों के रूप में सोचें) की एक टीम का उपयोग करके हल करता है जो एक गोपनीयता-सुरक्षित तरीके से मिलकर काम करते हैं। यहाँ प्रक्रिया चरण-दर-चरण दी गई है:

  1. स्थानीय जांच (एनालिस्ट्स):
    अपने वास्तविक रोगी डेटा को केंद्रीय सर्वर पर भेजने के बजाय, प्रत्येक अस्पताल अपने स्वयं के स्थानीय AI द्वारा उत्पन्न एक "सारांश रिपोर्ट" भेजता है। इस रिपोर्ट में शामिल है:
  • उनके पास किस प्रकार का डेटा है (संख्या, तिथि, टेक्स्ट)।
  • डेटा का अर्थ क्या है (जैसे, "यह कॉलम एक तिथि को दर्शाता है")।
  • कुछ सिंथेटिक नमूने (Synthetic Samples)। कल्पना कीजिए कि ये रसोई में बनाए गए "डमी व्यंजन" हैं। वे असली भोजन की तरह दिखते हैं और स्वाद भी देते हैं (समान प्रारूप, समान संरचना), लेकिन उनमें कोई वास्तविक सामग्री (कोई वास्तविक रोगी का नाम या रहस्य नहीं) नहीं होती है। ये सर्वर को वास्तविक डेटा देखे बिना डेटा के आकार को समझने में मदद करते हैं।
  1. केंद्रीय मैचमेकर (सर्वर):
    एक केंद्रीय सर्वर इन सारांश रिपोर्टों और डमी नमूनों को प्राप्त करता है। यह वास्तविक डेटा नहीं देखता; यह केवल "मेनू विवरण" देखता है।
  • क्लस्टरिंग (Clustering): सर्वर समान वस्तुओं को एक साथ समूहित करता है। वह समझ जाता है कि "Total Cases," "TotalPositiveCases," और "cases" सभी एक ही चीज़ का अर्थ रखते हैं।
  • सिफारिशें (Recommendations): सर्वर एक मुख्य शेफ की तरह कार्य करता है, प्रत्येक रसोई को निर्देशों की एक सूची वापस भेजता है: "अपने कॉलम का नाम बदलकर 'cases' करें, अपनी तिथियों को इस विशिष्ट प्रारूप में बदलें, और इस एक कॉलम को अनदेखा करें जो किसी अन्य से मेल नहीं खाता है।"
  1. रूपांतरण (रसोइये):
    प्रत्येक अस्पताल इन निर्देशों को लेता है और उन्हें अपने स्वयं के डेटा पर स्थानीय रूप से लागू करता है। वे नए मानक से मेल खाने के लिए अपने स्वयं के "मेनू" को अपडेट करते हैं।

  2. लूप (Loop):
    वे अपडेट किया गया सारांश सर्वर को वापस भेजते हैं। यदि सर्वर देखता है कि वे अभी भी पूरी तरह से संरेखित नहीं हैं, तो वह नए निर्देश भेजता है। यह एक लूप में होता है (आमतौर पर केवल 2 या 3 बार) जब तक कि सभी एक ही भाषा बोलने न लगें।

परिणाम: गति और गोपनीयता

शोधकर्ताओं ने चार वास्तविक दुनिया के कोविड-19 डेटासेट का उपयोग करके इस प्रणाली का परीक्षण किया जो विभिन्न देशों (अफगानिस्तान, इंडोनेशिया, इटली और अमेरिका) के थे। ये डेटासेट विभिन्न प्रारूपों और नामों का मिश्रण थे।

  • दक्षता (Efficiency): सिस्टम ने संचार के मात्र 2 से 3 राउंड में डेटा को सामंजस्यपूर्ण बनाने में सफलता प्राप्त की।
  • सटीकता (Accuracy): इसने तिथियों और स्थान कोड जैसे फीचर्स को सफलतापूर्वक संरेखित किया, जिससे प्रारूपों के अराजक मिश्रण को एक स्वच्छ, मानकीकृत सेट में बदल दिया गया।
  • गोपनीयता (Privacy): महत्वपूर्ण रूप से, पेपर का दावा है कि किसी भी समय सर्वर ने वास्तविक रोगी डेटा नहीं देखा। इसने केवल "डमी" नमूनों और मेटाडेटा को देखा। सर्वर यह पता नहीं लगा सका कि रोगी कौन थे, न ही वह व्यक्तियों के बारे में विशिष्ट विवरण चुरा सका।

"सीक्रेट सॉस" (लार्ज लैंग्वेज मॉडल्स)

यह प्रणाली शब्दों के पीछे के अर्थ को समझने के लिए उन्नत AI मॉडल (जैसे GPT और Llama) पर निर्भर करती है, न कि केवल स्पेलिंग पर। उदाहरण के लिए, यह जानता है कि "Date" और "yyyy-mm-dd" एक ही अवधारणा हैं, भले ही वे अलग दिखते हों। पेपर ने पाया कि विभिन्न AI मॉडलों के अलग-अलग व्यक्तित्व थे: कुछ बहुत सख्त थे और नियमों का पूरी तरह से पालन करते थे, जबकि अन्य अधिक रचनात्मक थे लेकिन कभी-कभी अनावश्यक बदलाव भी करते थे।

निष्कर्ष

प्रिवफ्यूजन चिकित्सा डेटा को साफ करने के उबाऊ और गोपनीयता भंग करने वाले काम को स्वचालित करने वाला एक उपकरण है। यह विभिन्न संस्थानों को बिना कभी अपनी गुप्त रेसिपी साझा किए "एक ही भाषा बोलने" की अनुमति देता है। पेपर निष्कर्ष निकालता है कि यह रोगी की गोपनीयता से समझौता किए बिना बड़े पैमाने पर सहयोगात्मक चिकित्सा अध्ययन चलाने को बहुत आसान बनाता है, बशर्ते कि AI एजेंटों को सही नियमों के तहत निर्देशित किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →