← नवीनतम पेपर
🤖 machine learning

Toward Efficient Membership Inference Attacks against Federated Large Language Models: A Projection Residual Approach

यह शोध पत्र ProjRes को प्रस्तुत करता है, जो एक नवीन और अत्यधिक कुशल पैसिव मेंबरशिप इन्फरेंस अटैक है जो फेडरेटेड लार्ज लैंग्वेज मॉडल्स से प्रभावी ढंग से समझौता करने के लिए हिडन एम्बेडिंग्स के प्रोजेक्शन रेसिडुअल्स का लाभ उठाता है, और मजबूत डिफरेंशियल प्राइवेसी डिफेंस के विरुद्ध भी लगभग पूर्ण सटीकता प्राप्त करता है।

मूल लेखक: Guilin Deng, Silong Chen, Yuchuan Luo, Yi Liu, Songlei Wang, Zhiping Cai, Lin Liu, Xiaohua Jia, Shaojing Fu

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guilin Deng, Silong Chen, Yuchuan Luo, Yi Liu, Songlei Wang, Zhiping Cai, Lin Liu, Xiaohua Jia, Shaojing Fu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पेपर "Toward Efficient Membership Inference Attacks against Federated Large Language Models: A Projection Residual Approach" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: "गुप्त रेसिपी" की समस्या

कल्पना कीजिए कि प्रसिद्ध शेफों (Clients) का एक समूह है जो मिलकर एक विश्व-स्तरीय सूप बनाना चाहता है। उनके पास अपने गुप्त पारिवारिक नुस्खे (उनकी निजी डेटा/private data) हैं जिन्हें वे गोपनीयता कानूनों या व्यापारिक रहस्यों के कारण साझा नहीं कर सकते।

इसे हल करने के लिए, वे एक Federated Learning प्रणाली का उपयोग करते हैं। अपने नुस्खों को केंद्रीय बर्तन में भेजने के बजाय, वे केवल स्वाद को कैसे समायोजित किया जाए, इसके नोट्स (ग्रेडिएंट्स/gradients) एक मुख्य शेफ (Server) को भेजते हैं। मुख्य शेफ इन नोट्स को मिलाकर मास्टर सूप रेसिपी को बेहतर बनाता है, और फिर अपडेट की गई रेसिपी वापस सभी को भेज देता है।

डर: हर कोई यह मान लेता है कि क्योंकि वास्तविक रेसिपी कभी रसोई से बाहर नहीं गई, इसलिए उनके गुप्त सामग्रियां सुरक्षित हैं।

वास्तविकता: यह पेपर खुलासा करता है कि शेफ द्वारा भेजे गए "स्वाद के नोट्स" वास्तव में इतनी जानकारी लीक कर देते हैं कि यह पता लगाया जा सके कि उनकी मूल रेसिपी में कौन सी विशिष्ट सामग्रियां थीं। लेखकों ने एक नया, सुपर-कुशल टूल बनाया है जिसे ProjRes कहा जाता है, ताकि इसे साबित किया जा सके।


समस्या: पुराने हैक्स क्यों काम नहीं आए

इस पेपर से पहले, सुरक्षा शोधकर्ता छोटे और सरल मॉडलों (जैसे बिल्लियों की पहचान करने वाले फोटो मॉडल) के लिए डिज़ाइन किए गए पुराने तरीकों का उपयोग करके इन "स्वाद के नोट्स" को चुराने की कोशिश करते थे। पुराने तरीके LLMs के खिलाफ तीन कारणों से विफल रहे:

  1. बहुत बड़े: LLMs विशाल हैं। मॉडल की एक "शैडो" कॉपी (जैसे अभ्यास करने वाला पुतला) बनाने की कोशिश करना, जिसका उपयोग परीक्षण के लिए किया जा सके, इतनी अधिक कंप्यूटर शक्ति की मांग करता है कि यह असंभव है।
  2. बहुत तेज़: LLMs इतनी तेज़ी से सीखते हैं कि वे उन धीमी, क्रमिक परिवर्तनों को नहीं दिखाते जिन्हें पुराने हैक्स ढूंढते हैं।
  3. बहुत समान: इन मॉडलों में, अलग-अलग सामग्रियों से मिलने वाले "स्वाद के नोट्स" लगभग एक जैसे दिखते हैं, जिससे उन्हें अलग करना कठिन हो जाता है।

समाधान: "प्रोजेक्शन रेसिडुअल" (ProjRes)

लेखक, गुइलिन डेंग और उनकी टीम ने महसूस किया कि उन्हें शैडो मॉडल बनाने की आवश्यकता नहीं है। इसके बजाय, उन्होंने एक चतुर ज्यामितीय (geometric) ट्रिक का उपयोग किया।

उपमा: दीवार पर दिखने वाली "परछाई"

कल्पना कीजिए कि आप एक अंधेरे कमरे में टॉर्च (Gradient) लेकर खड़े हैं। आप एक विशिष्ट वस्तु (आपका गुप्त नुस्खा) ऊपर उठाते हैं। वह वस्तु दीवार पर एक परछाई डालती है।

  • सेटअप: मुख्य शेफ (Server) समूह की वस्तुओं द्वारा डाली गई सभी परछाइयों को इकट्ठा करता है। ये परछाइयां दीवार पर एक विशिष्ट "आकार" या "सबस्पेस" (subspace) बनाती हैं।
  • हमला: हमलावर एक नई वस्तु (एक रहस्यमय नमूना) लेता है और उस पर रोशनी डालता है।
    • यदि वह वस्तु समूह का हिस्सा थी: उसकी परछाई समूह की परछाइयों द्वारा बनाए गए आकार में पूरी तरह फिट हो जाएगी। यह उसके साथ पूरी तरह संरेखित (align) होती है।
    • यदि वह वस्तु समूह में नहीं थी: उसकी परछाई बाहर निकल आएगी। वह आकार में फिट नहीं होगी। जहाँ परछाई होनी चाहिए थी और जहाँ वह वास्तव में है, उसके बीच एक "अंतराल" या रेसिडुअल (residual) होगा।

ProjRes इसी अंतराल (residual) को मापता है।

  • छोटा अंतराल: "आहा! यह नमूना निश्चित रूप से प्रशिक्षण डेटा का हिस्सा था।"
  • बड़ा अंतराल: "नहीं, यह नमूना इस शेफ द्वारा कभी नहीं देखा गया।"

यह खतरनाक क्यों है (वह "आहा!" क्षण)

यह पेपर दिखाता है कि यह तरीका डरावना प्रभावी है:

  1. लगभग पूर्ण सटीकता: कई परीक्षणों में, ProjRes ने 100% समय सही अनुमान लगाया। इसने केवल अनुमान नहीं लगाया; यह जानता था।
  2. किसी अतिरिक्त उपकरण की आवश्यकता नहीं: पुराने तरीकों के विपरीत, इसे दूसरा मॉडल प्रशिक्षित करने या प्रशिक्षण के कई दौरों की प्रतीक्षा करने की आवश्यकता नहीं है। यह केवल एक ही राउंड के नोट्स (gradients) के साथ किया जा सकता है।
  3. बड़े मॉडलों पर काम करता है: यह आज के सबसे बड़े मॉडलों, जैसे Llama3 और Qwen पर काम करता है।
  4. रोकना कठिन है: लेखks ने इसे सामान्य बचावों के खिलाफ भी टेस्ट किया, जैसे नोट्स में "शोर" (noise/static) जोड़ना या छोटे विवरणों को हटाना। इन बचावों के साथ भी, हमला अभी भी काम करता रहा, अक्सर केवल तभी विफल हुआ जब शोर इतना तेज़ था कि उसने सूप (मॉडल) को ही खराब कर दिया।

जादू के पीछे का "क्यों"

यह क्यों काम करता है? पेपर बताता है कि इन बड़े मॉडलों में, गणित बहुत सख्त है। "स्वाद के नोट्स" (gradients) गणितीय रूप से "सामग्रियों" (embeddings) से जुड़े होते हैं।

इसे एक ताले और चाबी की तरह सोचें।

  • Gradients ताला हैं।
  • Training Data वह चाबी है जिसने ताला बनाया।
  • यदि आप एक यादृच्छिक चाबी (non-member) को ताले में फिट करने की कोशिश करते हैं, तो वह नहीं घूमेगी।
  • यदि आप मूल चाबी (member) का उपयोग करते हैं, तो वह पूरी तरह से घूमती है।

लेखकों ने पाया कि क्योंकि ये मॉडल इतने विशाल हैं, इसलिए "ताला" अविश्वसनीय रूप से विशिष्ट है। चाबी में एक छोटा सा अंतर भी एक बड़ा, मापने योग्य अंतराल (residual) पैदा करता है जिसे हमलावर तुरंत पहचान सकता है।

निष्कर्ष

यह पेपर एक चेतावनी है। यह बताता है कि Large Language Models के लिए Federated Learning उतना निजी नहीं है जितना कि हम सोचते थे।

सिर्फ इसलिए कि आप अपना कच्चा डेटा साझा नहीं कर रहे हैं, इसका मतलब यह नहीं है कि आपका डेटा सुरक्षित है। जब आप एक मॉडल को प्रशिक्षित करने में मदद करते हैं, तो पीछे छोड़े गए गणितीय "पदचिह्न" (footprints) इतने विशिष्ट होते हैं कि एक चतुर हमलावर ठीक से पुनर्निर्माण कर सकता है कि आपने सिस्टम में क्या डाला था।

लेखक निष्कर्ष निकालते हैं: हमें यह मानना बंद कर देना चाहिए कि LLMs के लिए "Federated = Private"। हमें नए, अधिक मजबूत बचावों की आवश्यकता है जो केवल शोर (noise) जोड़ने के बजाय, मौलिक रूप से यह बदल दें कि ये मॉडल हमारे रहस्यों की रक्षा के लिए कैसे सीखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →