← नवीनतम पेपर
💬 NLP

The Art of Mixology: Mixup-based Obfuscation for Privacy-Preserving Split Learning in Large Language Models

यह शोध पत्र MIXGUARD का प्रस्ताव करता है, जो लार्ज लैंग्वेज मॉडल्स में प्राइवेसी-प्रिजर्विंग स्प्लिट लर्निंग के लिए एक नवीन मिक्सअप-आधारित फ्रेमवर्क है, जो डेटा रिकंस्ट्रक्शन हमलों को रोकने के लिए टोकन-लेवल और रिप्रेजेंटेशन-लेवल ऑब्फस्केशन को एडेप्टिव ग्रेडिएंट पर्टर्बेशन के साथ जोड़कर उपयोगिता, गोपनीयता और दक्षता के बीच प्रभावी ढंग से संतुलन बनाता है।

मूल लेखक: Chen Chen, Xiang Gao, Xianshun Wang, Chengran Li, Shengyu Xia, Xueluan Gong, Linru Zhang, Qian Wang, Kwok-Yan Lam

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chen Chen, Xiang Gao, Xianshun Wang, Chengran Li, Shengyu Xia, Xueluan Gong, Linru Zhang, Qian Wang, Kwok-Yan Lam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन बहुत महंगे रोबोट (एक लार्ज लैंग्वेज मॉडल) को आपकी निजी डायरी प्रविष्टियों का उपयोग करके एक विशिष्ट कार्य करना सिखाना चाहते हैं। आपके पास खुद रोबोट को प्रशिक्षित करने के लिए सुपरकंप्यूटर नहीं है, इसलिए आप अपना काम भारी उठाने के लिए अपनी डायरी एक शक्तिशाली सर्वर पर भेज देते हैं।

समस्या:
एक मानक सेटअप में, आप अपनी डायरी सर्वर को भेजते हैं, और सर्वर सुधार के लिए "ग्रेडिएंट्स" (गणितीय संकेत) वापस भेजता है। समस्या यह है कि एक जिज्ञासु सर्वर (या सर्वर होने का ढोंग करने वाला हैकर) इन संकेतों और आपके डेटा के अंशों को देखकर आपकी निजी डायरी को पुनर्गठित (reconstruct) कर सकता है। यह आपकी गुप्त रेसिपी भेजने वाले पोस्टकार्ड जैसा है; भले ही आप इसे कोड में लिखें, लेकिन एक चतुर पर्यवेक्षक कागज पर लगे धब्बों को देखकर ही सामग्री का पता लगा सकता है।

मौजूदा तरीके इसे रोकने की कोशिश करते हैं:

  1. शोर जोड़ना (Adding Noise): पोस्टकार्ड को इतना धुंधला कर देने जैसा कि सर्वर उसे पढ़ न सके, लेकिन दुर्भाग्य से, रोबोट इससे सीख भी नहीं पाता है।
  2. भारी एन्क्रिप्शन (Heavy Encryption): पोस्टकार्ड को स्टील की तिजोरी में रखने जैसा। यह सुरक्षित तो है, लेकिन इसे खोलने और बंद करने में बहुत समय लगता है, जिससे यह प्रक्रिया अविश्वसनीय रूप से धीमी और महंगी हो जाती है।

समाधान: MIXGUARD
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे MIXGUARD कहा जाता है। वे "मिक्सोलॉजी" (कॉकटेल बनाने की कला) से प्रेरणा लेते हैं। जिस तरह एक बारटेंडर एक एकल सामग्री के कड़े स्वाद को छिपाने के लिए विभिन्न पेय पदार्थों को मिलाता है, उसी तरह MIXGUARD आपके रहस्यों को छिपाने के लिए आपके निजी डेटा को अन्य "डिकॉय" (छद्म) डेटा के साथ मिलाता है, जबकि रेसिपी को सीखने योग्य बनाए रखता है।

यह इस प्रकार काम करता है, चरण-दर-चरण:

1. "सीक्रेट टोकन" ट्रिक (टोकन-लेवल ऑब्फस्केशन)

अपने टेक्स्ट को भेजने से पहले, सिस्टम आपके वाक्यों में गुप्त रूप से यादृच्छिक, अर्थहीन शब्द (जैसे "केला" या "बादल") डाल देता है।

  • उपमा: कल्पना कीजिए कि आप एक पत्र भेज रहे हैं, लेकिन आप हर वाक्य में यादृच्छिक रूप से "अनानास" शब्द डाल देते हैं। एक जासूस के लिए जो पत्र पढ़ रहा है, संदेश अजीब और बिखरा हुआ दिखता है। लेकिन क्योंकि सिस्टम जानता है कि "अनानास" कहाँ हैं, वह बाद में उन्हें आसानी से हटा सकता है।

2. "कॉकटेल" मिश्रण (रिप्रेजेंटेशन-लेवल ऑब्फस्केशन)

केवल अपना टेक्स्ट भेजने के बजाय, सिस्टम आपके टेक्स्ट को कई अन्य यादृच्छिक टेक्स्टों (डिकॉय) के साथ गणितीय रूप से मिला देता है जिनके बारे में सर्वर नहीं जानता।

  • उपमा: कल्पना कीजिए कि आपके पास आपके निजी जूस का एक गिलास है। आप इसे पांच अन्य लोगों के जूस के साथ ब्लेंडर में डाल देते हैं। आप सर्वर को मिश्रित स्मूदी भेजते हैं। सर्वर स्मूदी देखता है, लेकिन उसे यह पता नहीं होता कि आपका जूस कौन सा है और दूसरों का कौन सा।
  • जादू: सर्वर इस स्मूदी को प्रोसेस करता है और एक संकेत वापस भेजता है। आपका सिस्टम फिर एक विशेष "डिकोडर" (जिसे उसने पहले ही बनाया था) का उपयोग करके स्मूथी से अपने जूस को अलग करता है। क्योंकि सिस्टम को मिश्रण की रेसिपी पता है, वह आपके मूल डेटा के "स्वाद" को पूरी तरह से पुनः प्राप्त कर सकता है, भले ही सर्वर ने केवल मिश्रण देखा हो।

3. "कैलिब्रेशन" कोच

चूंकि चीजों को मिलाने से कभी-कभी स्वाद थोड़ा बिगड़ सकता है, इसलिए सिस्टम एक छोटा, हल्का "कोच" मॉडल उपयोग करता है।

  • उपमा: इसे एक स्वाद-परीक्षक के रूप में सोचें। रोबोट के स्मूदी से सीखने से पहले, स्वाद-परीक्षक स्वाद की जांच करता है और छोटे-छोटे समायोजन करता है ताकि यह सुनिश्चित हो सके कि इसका स्वाद आपके मूल जूस जैसा ही है। यह सुनिश्चित करता है कि रोबोट बिना किसी सटीकता को खोए सही ढंग से सीखता है।

4. "एडेप्टिव शील्ड" (ग्रेडिएंट परटर्बेशन)

जब रोबोट सीखता है, तो वह संकेत (ग्रेडिएंट्स) वापस भेजता है। कभी-कभी, ये संकेत अभी भी रहस्य लीक कर सकते हैं। MIXGUARD इन संकेतों में थोड़ा सा "स्टैटिक" (शोर) जोड़ता है, लेकिन केवल आवश्यकता होने पर।

  • उपमा: यदि स्वाद-परीक्षक को पता चलता है कि स्मूदी आपके मूल जूस से बहुत अलग है (इसका मतलब है कि डेटा बहुत अनूठा है), तो सिस्टम सर्वर को भेजे जाने वाले संकेतों में थोड़ा अधिक "स्टैटिक" जोड़ देता है। यह सुनिश्चित करता है कि यदि सर्वर संकेतों को रिवर्स-इंजीनियर करने की कोशिश भी करता है, तो उसे केवल शोर मिले, आपके रहस्य नहीं।

उन्होंने क्या पाया?
लेखकों ने विभिन्न आकार के AI मॉडलों का उपयोग करके चार अलग-अलग प्रकार के कार्यों (जैसे भावनाओं को वर्गीकृत करना, गणित के सवालों के जवाब देना, कोड लिखना और बातचीत का सारांश निकालना) पर इसका परीक्षण किया।

  • गोपनीयता (Privacy): अन्य तरीकों की तुलना में सर्वर के लिए आपके निजी डेटा को पुनर्गठित करना बहुत कठिन है। "स्मूदी" इतनी अच्छी तरह से मिश्रित है कि सर्वर यह नहीं बता सकता कि मूल सामग्रियां क्या थीं।
  • उपयोगिता (Utility/Performance): अन्य तरीकों के विपरीत जो डेटा को इतना धुंधला कर देते हैं कि रोबोट भ्रमित हो जाता है, MIXGUARD यह सुनिश्चित करता है कि रोबोट का प्रदर्शन लगभग वैसा ही रहे जैसा कि उसने सीधे आपके डेटा पर प्रशिक्षण लिया होता।
  • दक्षता (Efficiency): इसके लिए स्टील की तिजोरियों जैसे भारी, धीमे एन्क्रिप्शन की आवश्यकता नहीं होती है। यह तेज़ चलता है और प्रशिक्षण प्रक्रिया को बहुत अधिक धीमा नहीं करता है।

संक्षेप में: MIXGUARD एक सुरक्षित, उच्च-गति वाली डिलीवरी सेवा की तरह है जो आपके निजी पैकेज को डिकॉय पैकेजों के साथ मिला देती है। प्राप्तकर्ता (सर्वर) को मिश्रित पैकेज को प्रोसेस करने में मदद मिलती है, लेकिन वे कभी भी यह पता नहीं लगा सकते कि आपका हिस्सा कौन सा था। इस बीच, आप काम पूरा करने के लिए परिणाम को पूरी तरह से अनपैक कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →