← नवीनतम पेपर
🤖 machine learning

FERMI: Exploiting Relations for Membership Inference Against Tabular Diffusion Models

यह शोध पत्र FERMI को प्रस्तुत करता है, जो एक नवीन मेंबरशिप इन्फरेंस अटैक है जो मल्टी-टेबल सेटिंग्स में टैबुलर डिफ्यूजन मॉडल्स के लिए प्राइवेसी रिस्क असेसमेंट को महत्वपूर्ण रूप से बढ़ाने के लिए प्रशिक्षण के दौरान उपलब्ध रिलेशनल ऑक्सिलरी इंफॉर्मेशन का लाभ उठाता है, जो मौजूदा सिंगल-टेबल बेसलाइन की तुलना में ट्रू पॉजिटिव रेट्स में 53% तक बेहतर प्रदर्शन करता है।

मूल लेखक: Abtin Mahyar, Masoumeh Shafieinejad, Yuhan Liu, Xi He

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abtin Mahyar, Masoumeh Shafieinejad, Yuhan Liu, Xi He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: "सिंथेटिक डेटा" सुरक्षा जांच

कल्पना कीजिए कि एक अस्पताल बीमारियों के अध्ययन के लिए शोधकर्ताओं के साथ रोगी डेटा साझा करना चाहता है, लेकिन वे गोपनीयता कानूनों के कारण वास्तविक नाम और पते साझा नहीं कर सकते। इसलिए, वे एक बहुत ही स्मार्ट AI (जिसे डिफ्यूजन मॉडल कहा जाता है) का उपयोग नकली लेकिन वास्तविक दिखने वाले रोगी रिकॉर्ड बनाने के लिए करते हैं। ये नकली रिकॉर्ड बिल्कुल असली रिकॉर्ड की तरह दिखते और व्यवहार करते हैं, लेकिन ये वास्तविक लोग नहीं हैं।

बड़ा सवाल यह है: क्या यह नकली डेटा वास्तव में सुरक्षित है? क्या कोई हैकर नकली डेटा को देखकर यह पता लगा सकता है कि क्या कोई विशिष्ट वास्तविक व्यक्ति (जैसे "जॉन डो") मूल ट्रेनिंग सेट में शामिल था?

इसे मेंबरशिप इन्फरेंस अटैक (Membership Inference Attack) कहा जाता है। यह एक जासूस की तरह है जो यह अनुमान लगाने की कोशिश कर रहा है कि किसी सांचे को बनाने के लिए किस विशिष्ट उंगलियों के निशान का उपयोग किया गया था, केवल उस सांचे को देखकर।

समस्या: "सिंगल-टेबल" अंधा मोड़ (Blind Spot)

इन AI मॉडलों के लिए अधिकांश सुरक्षा परीक्षण केवल एक समय में एक ही टेबल देखते हैं।

  • उपमा: कल्पना कीजिए कि एक जासूस किसी व्यक्ति के चेहरे की एक अकेली फोटो देखकर संदिग्ध की पहचान करने की कोशिश कर रहा है।
  • वास्तविकता: वास्तविक जीवन केवल एक फोटो नहीं है। एक व्यक्ति का डेटा कई जुड़ी हुई फाइलों में फैला होता है: उनका मेडिकल इतिहास, उनके नुस्खे (prescriptions), उनके लैब परिणाम, और उनके बीमा दावे। ये सभी एक पारिवारिक वंशावली (family tree) की तरह आपस में जुड़े हुए हैं।

यह पेपर तर्क देता है कि पिछले सुरक्षा परीक्षण बहुत सरल थे। उन्होंने "चेहरे" (एक टेबल) को देखा लेकिन "पारिवारिक वंशावली" (जुड़ी हुई टेबल्स) को अनदेखा कर दिया। कनेक्शनों को अनदेखा करके, उन्होंने सिस्टम को हैक करना कितना आसान है, इसका कम आकलन किया।

खोज: "पारिवारिक वंशावली" सब कुछ बता देती है

शोधकर्ताओं ने पाया कि जब एक AI जुड़ी हुई डेटा से सीखता है (जैसे कि एक मरीज जो उनके नुस्खों से जुड़ा है), तो वह संबंधों को भी याद कर लेता है।

  • उपमा: यदि आप एक बच्चे को कुत्ता पहचानना सिखाते हैं, तो वे शायद केवल यह सीखेंगे कि कुत्ता कैसा दिखता है। लेकिन यदि आप उन्हें यह सिखाते हैं कि "यह कुत्ता हमेशा इस विशिष्ट बिल्ली के बगल में बैठता है," तो वे उस जोड़े को याद कर लेते हैं। यदि आप उन्हें बाद में कुत्ता दिखाते हैं, तो वे बता सकते हैं कि वह किस बिल्ली का है, भले ही आपने उन्हें केवल कुत्ता दिखाया हो।

पेपर दिखाता है कि यदि किसी हमलावर को "पारिवारिक वंशावली" (टेबल्स के बीच के संबंध) का पता है, तो वे एक एकल टेबल को देखने की तुलना में एक वास्तविक व्यक्ति को बहुत आसानी से पहचान सकते हैं। AI द्वारा छोड़ा गया "फिंगरप्रिंट" अधिक मजबूत होता है जब इसमें ये कनेक्शन शामिल होते हैं।

समाधान: FERMI (द "ट्रांसलेटर")

यहाँ पेचीदा हिस्सा है: वास्तविक दुनिया में, एक हैकर आमतौर पर केवल एक ही टेबल (चेहरा) देखता है। उनके पास हमले के समय पूरी पारिवारिक वंशावली (नुस्खे या लैब परिणाम) तक पहुंच नहीं होती है।

तो, यदि आपके पास वंशावली नहीं है, तो आप वंशावली के ज्ञान का उपयोग कैसे करेंगे?

लेखकों ने FERMI नामक एक टूल बनाया है।

  • उपमा: कल्पना कीजिए कि एक जासूस ने संदिग्ध के पूरे जीवन (परिवार, दोस्त, आदतें) का अध्ययन किया है। लेकिन जब वह संदिग्ध को पकड़ने के लिए हवाई अड्डे पर जाता है, तो उसे केवल संदिग्ध का चेहरा दिखाई देता है।
  • FERMI कैसे काम करता है: जासूस एक "मानसिक अनुवादक" (mental translator) का उपयोग करता है। क्योंकि उन्होंने संदिग्ध के पूरे जीवन का अध्ययन किया था, इसलिए वे जानते हैं कि "यदि यह चेहरा X जैसा दिखता है, तो इसका मतलब आमतौर पर यह है कि संदिग्ध का संबंध Y से है।"
  • प्रक्रिया:
    1. ट्रेनिंग (Training): हमलावर एक ऐसे नकली डेटासेट का उपयोग करके एक "अनुवादक" (न्यूरल नेटवर्क) को प्रशिक्षित करता है जहाँ उनके पास पूरी पारिवारिक वंशावली होती है। वे अनुवादक को सिखाते हैं: "जब आप इस एकल चेहरे को देखें, तो कल्पना करें कि पूरी पारिवारिक वंशावली कैसी दिखती है।"
    2. हमला (Attack): जब हमलावर एक वास्तविक लक्ष्य (केवल चेहरा) देखता है, तो वे उसे अनुवादक में फीड करते हैं। अनुवादक जो कुछ उसने सीखा है उसके आधार पर लापता पारिवारिक वंशावली के विवरणों को "हैलुसिनेट" या पुनर्गठित करता है।
    3. परिणाम (Result): हमलावर के पास अब एक "नकली पारिवारिक वंशावली" होती है जो बिना वास्तविक वंशावली देखे भी मेंबरशिप का पता लगाने के लिए पर्याप्त अच्छी है।

परिणाम: एक बड़ा अंतर

शोधकर्ताओं ने तीन अलग-अलग प्रकार के AI मॉडलों और तीन वास्तविक दुनिया के डेटासेट्स (जैसे अस्पताल के रिकॉर्ड और किराने की खरीदारी का डेटा) पर इसका परीक्षण किया।

  1. बेसलाइन (The Baseline): जब हमलावरों ने केवल एक ही टेबल को देखा, तो वे अनुमान लगाने में ठीक थे, लेकिन बहुत अच्छे नहीं थे।
  2. "फुल एक्सेस" हमला (The "Full Access" Attack): जब हमलावरों के पास पूरी पारिवारिक वंशावली थी, तो वे अनुमान लगाने में डरावने रूप से कुशल थे (कुछ मामलों में 99% सटीकता तक)।
  3. FERMI: भले ही हमले के समय FERMI के पास केवल एक ही टेबल थी, इसने पूरी पारिवारिक वंशावली का लाभ उठाने के लिए अपने "अनुवादक" का उपयोग किया और लगभग 50% लाभ को सफलतापूर्वक प्राप्त किया।

मुख्य निष्कर्ष:

  • TabDDPM (एक मॉडल जो सीधे कच्चे डेटा पर काम करता है) बहुत असुरक्षित था।
  • TabSyn (एक मॉडल जो पहले डेटा को एक छिपे हुए "लेटेंट स्पेस" में संकुचित करता है) को हैक करना बहुत कठिन था। "संपीड़न" (compression) एक गोपनीयता कवच की तरह काम करता था, जो संबंध संकेतों को छिपा देता था।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हम सिंथेटिक डेटा की सुरक्षा का निर्णय केवल एक समय में एक टेबल को देखकर नहीं कर सकते। यदि डेटा एक बड़े, जुड़े हुए सिस्टम का हिस्सा है, तो गोपनीयता का जोखिम बहुत अधिक है।

FERM सिद्ध करता है कि भले ही हमलावर के पास हमले के समय सारा डेटा न हो, फिर भी वे प्रशिक्षण के दौरान जो सीखा है उसका उपयोग करके "खाली स्थानों को भरने" के लिए कर सकते हैं और फिर भी गोपनीयता को तोड़ सकते हैं। यह एक चेतावनी है कि अत्यधिक संवेदनशील, जुड़े हुए डेटा के लिए, साधारण गोपनीयता जांच पर्याप्त नहीं है; हमें कनेक्शनों के पूरे जाल को देखने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →