← नवीनतम पेपर
💬 NLP

Privacy-Preserving Text Sanitization for Distributed Agents Collaboration via Disentangled Representations

यह शोध पत्र DiSan को प्रस्तुत करता है, जो वितरित एजेंट सहयोग के लिए एक गोपनीयता-संरक्षण ढांचा है, जो कार्य अर्थों (task semantics) को संरक्षित करते हुए स्रोत-पहचान वाले शैलीगत हस्ताक्षरों को प्रभावी ढंग से हटाने के लिए विलगित निरूपणों (disentangled representations) का उपयोग करता है, जो स्टाइलोमेट्रिक एट्रिब्यूशन और PII एक्सपोज़र को कम करने में पारंपरिक टोकन-मास्किंग विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Xuan Liu, Hefeng Zhou, Sicheng Chen, Chao Yang, Xingcheng Xu, Jingjing Qu, Jiong Lou, Jie LI, Xia Hu

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuan Liu, Hefeng Zhou, Sicheng Chen, Chao Yang, Xingcheng Xu, Jingjing Qu, Jiong Lou, Jie LI, Xia Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र की व्याख्या दी गई है।

समस्या: टेक्स्ट में "गुप्त हाथ मिलाना" (The "Secret Handshake" in Text)

कल्पना कीजिए कि आप बैंक A में एक अकाउंटेंट हैं और आपको अपने क्लाइंट की मदद करने के लिए बैंक B के एक सहकर्मी से कुछ वित्तीय डेटा माँगना है। आप एक संदेश भेजते हैं: "हमारे क्लाइंट, मिस्टर स्मिथ, का चेस बैंक के साथ $5M का लोन है।"

यदि आप केवल "मिस्टर स्मिथ" और "चेस बैंक" को हटा देते हैं, तो आपको लग सकता है कि आप सुरक्षित हैं। लेकिन यह शोध पत्र तर्क देता है कि आप नहीं हैं। क्यों? क्योंकि आपकी लेखन शैली एक गुप्त हाथ मिलाने (secret handshake) की तरह है।

नामों के बिना भी, आपका संदेश अभी भी यह प्रकट कर सकता है कि आप कौन हैं, क्योंकि:

  • आप चीज़ों को कैसे फॉर्मेट करते हैं: क्या आप बुलेट पॉइंट्स का उपयोग करते हैं या लंबे पैराग्राफ का?
  • आपकी शब्दावली (Vocabulary): क्या आप "लिक्विडिटी" (liquidity) या "कैश फ्लो" (cash flow) जैसे शब्दों का उपयोग करते हैं?
  • आपका वाक्य विन्यास (Sentence Structure): क्या आप हमेशा वाक्य की शुरुआत "हमारे रिकॉर्ड के अनुसार..." (Per our records...) से करते हैं?

इन्हें वितरणात्मक हस्ताक्षर (distributional signatures) कहा जाता है। यह एक ऐसे शेफ की तरह है जो खाना पकाने के बिल्कुल अंत में हमेशा एक चुटकी नमक डालता है। भले ही आप शेफ का नाम छिपा दें, लेकिन व्यंजन का स्वाद उन्हें उजागर कर देता है।

समाधान: DiSan (एक "प्राइवेसी ट्रांसलेटर")

शंघाई आर्टिफिशियल इंटेलिजेंस लेबोरेटरी के शोधकर्ताओं ने DiSan (डिसेंटैंगल्ड सैनिटाइजेशन) नामक एक टूल बनाया है। DiSan को एक अति-बुद्धिमान अनुवादक के रूप में समझें जो केवल नाम ही नहीं छुपाता; बल्कि यह संदेश को इस तरह से फिर से लिखता है कि यह एक सामान्य, गुमनाम स्रोत से आया हुआ लगे, जबकि महत्वपूर्ण तथ्य बरकरार रहें।

यह कैसे काम करता है, इसे एक स्मूदी उपमा (Smoothie Analogy) के माध्यम से समझते हैं:

1. फल को रस से अलग करना (Disentanglement)

कल्पना कीजिए कि हर टेक्स्ट मैसेज एक स्मूदी है जो दो चीजों से बनी है:

  • फल (भूमिका/Role): वास्तविक तथ्य, संख्याएँ और अर्थ (जैसे, "लोन राशि $5M है")।
  • रस (शैली/Style): स्वाद, बनावट और वह गुप्त रेसिपी जो बनाने वाले की पहचान कराती है (जैसे, "बैंक A के लिखने का विशिष्ट तरीका")।

पुराने तरीके (जैसे साधारण मास्किंग) केवल गिलास से फल निकालने की कोशिश करते हैं, लेकिन वे पीछे रस छोड़ देते हैं, जिसका स्वाद अभी भी बैंक A जैसा ही रहता है।

DiSan एक विशेष मशीन (Two-Stream Encoder) का उपयोग करता है जो स्मूदी को दो अलग-अलग धाराओं में अलग करता है:

  • स्ट्रीम A (भूमिका): इसमें केवल शुद्ध तथ्य होते हैं। यही वह हिस्सा है जिसे दूसरे व्यक्ति को भेजा जाता है।
  • स्ट्रीम B (शैली): इसमें "स्वाद" और गुप्त रेसिपी होती है। यह स्थानीय कंप्यूटर में लॉक रहती है और कभी भेजी नहीं जाती

2. ग्रुप प्रोजेक्ट (Federated Training)

आमतौर पर, कंप्यूटर को यह सिखाने के लिए, आपको सभी निजी बैंक दस्तावेजों को एक केंद्रीय सर्वर पर भेजना होगा। यह खतरनाक है।

इसके बजाय, DiSan फेडरेटेड लर्निंग (Federated Learning) का उपयोग करता है। कल्पना कीजिए कि 7 अलग-अलग बैंक यह सीखने की कोशिश कर रहे हैं कि "सामान्य" रिपोर्ट कैसे लिखी जाए।

  • वे अपने गुप्त नुस्खे (recipes) किसी केंद्रीय शिक्षक को नहीं भेजते हैं।
  • इसके बजाय, वे एक "सामान्य तथ्य" कैसा दिखता है, उसके छोटे, अमूर्त मिट्टी के मॉडल (जिन्हें प्रोटोटाइप्स/Prototypes कहा जाता है) भेजते हैं।
  • केंद्रीय सर्वर इन मिट्टी के मॉडलों को मिलाकर एक "मास्टर मोल्ड" (मुख्य सांचा) बनाता है और उसे वापस भेज देता है।
  • प्रत्येक बैंक उस मोल्ड का उपयोग करके अपनी मशीन को अपडेट करता है।

इस तरह, बैंक एक-दूसरे के कच्चे, निजी दस्तावेजों को देखे बिना एक ही "सामान्य भाषा" बोलना सीख जाते हैं।

3. "एंटी-आइडेंटिटी" ट्रेनिंग (Adversarial Regularization)

यह सुनिश्चित करने के लिए कि मिट्टी के मॉडल गलती से यह खुलासा न कर दें कि किस बैंक ने उन्हें बनाया है, सिस्टम "लुका-छिपी" (Hide and Seek) का खेल खेलता है।

  • एक डिस्क्रिमिनेटर (Discriminator) (एक जासूस AI) यह अनुमान लगाने की कोशिश करता है कि मिट्टी का मॉडल किस बैंक से आया है।
  • सैनिटाइज़र (Sanitizer) (अनुवादक) उस जासूस को धोखा देने की कोशिश करता है ताकि मॉडल यथासंभव सामान्य दिखें।
  • समय के साथ, सैनिटाइज़र स्रोत को छिपाने में इतना कुशल हो जाता है कि जासूस केवल रैंडम अनुमान ही लगा पाता है।

परिणाम: क्या यह काम आया?

शोध पत्र ने "ब्लैंकिंग आउट" (मास्किंग) या एक बड़े AI से टेक्स्ट को फिर से लिखवाने जैसे अन्य तरीकों के मुकाबले इसका परीक्षण किया।

  • पुराना तरीका (मास्किंग): यदि आप 19% शब्द (नाम, तारीखें) छिपा देते हैं, तो "जासूस" अभी भी 67% बार यह अनुमान लगा सकता है कि इसे किसने लिखा है। "स्वाद" अभी भी मौजूद है।
  • DiSan का तरीका:
    • गोपनीयता (Privacy): इसने स्रोत का अनुमान लगाने की क्षमता को 73% कम कर दिया। अब यह बताना लगभग असंभव है कि संदेश किसने लिखा है।
    • उपयोगिता (Usefulness): इसने मूल अर्थ का 83% बरकरार रखा। तथ्य अभी भी सवालों के जवाब देने के लिए पर्याप्त सटीक थे।
    • PII एक्सपोजर: इसने मानक तरीकों की तुलना में व्यक्तिगत जानकारी लीक होने के जोखिम को 20 गुना कम कर दिया।

मुख्य निष्कर्ष (The Bottom Line)

DiSan विभिन्न संगठनों के लिए जानकारी सुरक्षित रूप से साझा करने का एक नया तरीका है। केवल नाम काटने (जिससे संगठन की "आवाज़" पीछे रह जाती है) के बजाय, यह टेक्स्ट को पूरी तरह से फिर से लिखता है ताकि संगठन की अनूठी "आवाज़" को हटाकर "कहानी" को समान रखा जा सके। यह एजेंटों को अपनी गुप्त रेसिपी प्रकट किए बिना सहयोग करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →