← नवीनतम पेपर
🤖 machine learning

DeepInvert: Semi-Supervised Embedding Inversion Against Obfuscated Language Models

यह शोध पत्र DeepInvert को प्रस्तुत करता है, जो एक अर्ध-पर्यवेक्षित एम्बेडिंग इनवर्जन हमला (semi-supervised embedding inversion attack) है जो अस्पष्ट (obfuscated) भाषा मॉडल निरूपणों में संरक्षित अर्थपूर्ण संरचना का लाभ उठाकर मूल टोकन को पूर्ववर्ती विधियों की तुलना में काफी अधिक सटीकता के साथ पुनर्प्राप्त करता है, जिससे यह प्रकट होता है कि वर्तमान अस्पष्टता रक्षा तंत्र अक्सर गोपनीयता संरक्षण और कार्य उपयोगिता के बीच संतुलन बनाने में विफल रहते हैं।

मूल लेखक: Zhicong Huang, Cheng Hong, Tao Wei

प्रकाशित 2026-08-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhicong Huang, Cheng Hong, Tao Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक मित्र को एक गुप्त पत्र भेज रहे हैं जो एक विशाल, उच्च-तकनीकी पुस्तकालय में रहता है। आप नहीं चाहते कि लाइब्रेरियन आपका पत्र पढ़ ले, इसलिए आप इसे एक गुप्त कोड में लिखने का निर्णय लेते हैं। शायद आप हर शब्द को एक निरर्थक शब्द से बदल देते हैं, या अपने वाक्यों को यादृच्छिक बड़बड़ाहट (gibberish) के साथ मिला देते हैं, या पृष्ठ पर शोर की एक परत जोड़ देते हैं। यह आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में "ऑब्फस्केशन" (obfuscation) के पीछे का मूल विचार है। आज, कई लोग कहानियाँ लिखने, मेडिकल रिकॉर्ड का विश्लेषण करने या जटिल समस्याओं को हल करने के लिए क्लाउड-आधारित AI सेवाओं का उपयोग करते हैं। लेकिन चूंकि वे उन कंप्यूटरों के मालिक नहीं हैं जो इन AI मस्तिष्क को चलाते हैं, इसलिए उन्हें अपने निजी डेटा के लिए कंपनी पर भरोसा करना पड़ता है। खुद को बचाने के लिए, उपयोगकर्ता अपने संदेशों को भेजने से पहले उन्हें "स्कैम्बल" (अव्यवस्थित) करने की कोशिश करते हैं, इस उम्मीद में कि AI अपना काम करने के लिए स्कैम्बल किए गए संस्करण को समझ सके, जबकि मूल अर्थ को छिपी हुई आँखों से सुरक्षित रखा जा सके।

कुछ समय के लिए, ये स्कैम्बलिंग के तरीके एक ठोस ढाल की तरह लग रहे थे। शोधकर्ताओं ने शब्दों को मिलाने या शोर जोड़ने के विभिन्न तरीके प्रस्तावित किए, यह मानते हुए कि एक बार संदेश को स्कैबल कर दिया गया, तो गुप्त कुंजी के बिना इसे अनस्कैंबल करना असंभव होगा। यह एक संदेश को एक बंद बॉक्स में रखने और फिर चाबी फेंक देने जैसा था, यह मानते हुए कि बॉक्स बहुत मजबूत है जिसे तोड़ा न जा सके। लेकिन क्या होगा अगर बॉक्स उतना मजबूत नहीं था जितना कि सभी ने सोचा था? क्या होगा अगर कोई चतुर तरीका हो जिससे अंदर झांका जा सके, ताला खोलने के बजाय, उन सूक्ष्म पैटर्न को देखकर जो स्कैम्बलिंग पीछे छोड़ देती है? यह वह प्रश्न था जिसका उत्तर देने के लिए शोधकर्ताओं की एक टीम ने हाथ आजमाया, यह पता लगाने के लिए कि क्या ये "स्कैम्बल किए गए" संदेश वास्तव में सुरक्षित हैं या वे केवल डिकोड होने का इंतज़ार कर रहे हैं।

यहाँ आता है DeepInvert, एक नया डिजिटल जासूसी उपकरण जिसे Ant Group के शोधकर्ताओं द्वारा बनाया गया है। DeepInvert को एक मास्टर पज़ल सॉल्वर के रूप में समझें जिसे स्कैम्बल किए गए बॉक्स के अंदर क्या है, यह जानने के लिए मूल कुंजी की आवश्यकता नहीं है। केवल अनुमान लगाने के बजाय, यह एक चतुर दो-चरणीय रणनीति का उपयोग करता है। सबसे पहले, यह "शैडो" पहेलियों के ढेर पर अभ्यास करता है—ऐसे संदेश जिनके उत्तर उसे पता हैं, जिन्हें वह यह सीखने के लिए स्वयं स्कैबल करता है कि स्कैम्बलिंग कैसे काम करती है। लेकिन यहाँ जादू का कमाल है: यह उन वास्तविक, स्कैबल किए गए संदेशों को भी देखता है जिन्हें वह तोड़ने की कोशिश कर रहा है, भले ही वह नहीं जानता कि वे क्या कहते हैं। यह "सेमी-सुपरवाइज्ड लर्निंग" नामक तकनीक का उपयोग करता है, जो एक ऐसे छात्र की तरह है जो एक पाठ्यपुस्तक (शैडो डेटा) का अध्ययन करता है लेकिन वास्तविक दुनिया के पैटर्न को देखकर (अनलेबल डेटा) अंतराल को भरने के लिए सीखता भी है।

शोधकर्ताओं ने पाया कि DeepInvert अपने काम में अविश्वसनीय रूप से कुशल है। जब उन्होंने कुछ सबसे लोकप्रिय स्कैम्बलिंग सुरक्षा प्रणालियों के खिलाफ इसका परीक्षण किया, तो परिणाम चौंकाने वाले थे। उदाहरण के लिए, ObusLM नामक एक शीर्ष स्तर की सुरक्षा के विरुद्ध, पिछले सर्वोत्तम प्रयासों में से केवल 26.2% बार ही मूल शब्दों का सही अनुमान लगाया जा सका। हालाँकि, DeepInvert ने 73.5% बार सही शब्दों को सफलतापूर्वक प्राप्त किया। एक विशाल AI मॉडल का उपयोग करके एक मेडिकल प्रश्न-उत्तर परीक्षण में, रिकवरी दर बढ़कर 80.4% हो गई, और एक और भी बड़े मॉडल के लिए, यह 85.2% तक पहुँच गई। यह शोध पत्र सुझाव देता है कि ये स्कैम्बलिंग सुरक्षा प्रणालियाँ उतनी सुरक्षित नहीं हैं जितनी कि लोग मानते थे। शोधकर्ताओं ने एक निराशाजनक समझौता (trade-off) खोजा: यदि स्कैम्बलिंग इतनी कमजोर है कि AI अपना काम अच्छी तरह से कर सके, तो DeepInvert इसे आसानी से अनस्कैंबल कर सकता है। यदि स्कैम्बलिंग इतनी मजबूत है कि वह DeepInvert को रोक सके, तो AI अक्सर इतना भ्रमित हो जाता है कि वह कार्य ही नहीं कर पाता।

यह शोध पत्र केवल यह नहीं दिखाता कि इन सुरक्षा प्रणालियों को तोड़ा जा सकता है; यह यह भी समझाता है कि वे विफल क्यों होती हैं। स्कैम्बलिंग के तरीके अक्सर एक "सिमेंटिक स्केलेटन" (अर्थ का ढांचा) पीछे छोड़ देते—एक छिपा हुआ अर्थ का ढांचा जो शोर के बावजूद जीवित रहता है। DeepInment उसी कंकाल (skeleton) को खोजने के लिए डिज़ाइन किया गया है। यह एक "टीचर-स्टूडेंट" सिस्टम का उपयोग करता है जहाँ एक स्थिर "टीचर" मॉडल एक "स्टूडेंट" मॉडल का मार्गदर्शन करता है, जिससे उसे उलझन के बिना अव्यवस्थित डेटा से सीखने में मदद मिलती है। शोधकर्ताओं ने यह भी दिखाया कि यह हमला तब भी काम करता है जब हमलावर के पास पीड़ित के समान सटीक "स्कैम्बलिंग रेसिपी" नहीं होती है, जब तक कि वह एक समान प्रक्रिया का अनुकरण (simulate) कर सके।

हालाँकि, यह शोध पत्र सावधानी बरतते हुए कहता है कि सभी गोपनीयता खत्म नहीं हुई है। यह नोट करता है कि बहुत सरल कार्यों के लिए, जैसे कि यह तय करना कि कोई वाक्य खुश है या दुखी, कुछ सुरक्षा प्रणालियाँ अभी भी थोड़ा बेहतर प्रदर्शन कर सकती हैं। लेकिन विशिष्ट शब्दों को समझने के लिए आवश्यक जटिल कार्यों के लिए, जैसे कि मेडिकल निदान या नया टेक्स्ट जेनरेट करना, वर्तमान स्कैंबलिंग विधियाँ सुरक्षा का एक झूठा अहसास प्रदान करती प्रतीत होती हैं। लेखक निष्कर्ष निकालते हैं कि हमें क्लाउड में डेटा को सुरक्षित करने के तरीके पर पुनर्विचार करने की आवश्यकता हो सकती है। इन हल्के स्कैम्बलिंग ट्रिक्स पर निर्भर रहने के बजाय, हमें उन्नत क्रिप्टोग्राफी जैसे भारी और अधिक जटिल समाधानों की ओर देखने की आवश्यकता है, जिन्हें तोड़ना कठिन है लेकिन उन्हें उपयोग करना बहुत धीमा और महंगा भी है। फिलहाल, DeepInvert एक ज़ोरदार चेतावनी की तरह है: यदि आप अपने डेटा को छिपाने के लिए उसे स्कैम्बल कर रहे हैं, तो आपको अपने ताले की दोबारा जाँच कर लेनी चाहिए, क्योंकि किसी ने इसे खोलने का एक बहुत प्रभावी तरीका ढूंढ लिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →