← नवीनतम पेपर
💻 computer science

Defense Against Prompt Inversion Attacks: An Information-Theoretic Approach for LLM Collaborative Inference

यह शोधपत्र सहयोगात्मक LLM इन्फरेंस (inference) के लिए एक सूचना-सैद्धांतिक रक्षा ढांचे का प्रस्ताव करता है जो प्रॉम्ट इनवर्जन हमलों के विरुद्ध बेहतर गोपनीयता-उपयोगिता-विलंबता (privacy-utility-latency) ट्रेड-ऑफ प्राप्त करने के लिए गोपनीयता एडेप्टर और निम्न-आयामी सूचना बाधाओं (low-dimensional information bottlenecks) का उपयोग करके मध्यवर्ती सक्रियणों (intermediate activations) और इनपुट प्रॉम्ट के बीच पारस्परिक सूचना को न्यूनतम करता है।

मूल लेखक: Sayedeh Leila Noorbakhsh, Hossein Khalili, Nader Sehatbakhsh

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sayedeh Leila Noorbakhsh, Hossein Khalili, Nader Sehatbakhsh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: "क्लाउड किचन" की समस्या

कल्पना कीजिए कि आपके पास एक बहुत ही छोटा, कम शक्ति वाला किचन है (आपका फोन या लैपटॉप) जो एक विश्व स्तरीय रेसिपी बुक (एक लार्ज लैंग्वेज मॉडल, या LLM) का उपयोग करके एक जटिल भोजन पकाना चाहता है। आपके किचन में पूरा भोजन पकाने के लिए पर्याप्त जगह या उपकरण नहीं हैं, इसलिए आप खाना पकाने की प्रक्रिया के बीच में ही सामग्री को एक विशाल, पेशेवर "क्लाउड किचन" में भेजने का निर्णय लेते हैं।

समस्या:
जब आप उन आधे पके हुए मसालों/सामग्रियों (मध्यवर्ती सक्रियण या "intermediate activations") को क्लाउड किचन में भेजते हैं, तो वहां मौजूद एक ताक-झांक करने वाला शेफ खाने की स्थिति को देखकर यह अनुमान लगा सकता है कि आपकी मूल गुप्त रेसिपी क्या थी। इसे प्रॉम्प्ट इन्वर्जन अटैक (Prompt Inversion Attack) कहा जाता है। भले ही आप केवल कुछ सुराग भेजें, एक स्मार्ट हमलावर आपके निजी इनपुट (जैसे कि कोई मेडिकल डायग्नोसिस या कानूनी रहस्य) को केवल खाना पकाने की प्रक्रिया के उस मध्य बिंदु को देखकर पुनर्गठित कर सकता है।

पुराने समाधान:
इसे रोकने के पिछले प्रयास आपके द्वारा सामग्री भेजने से पहले उसमें थोड़ा नमक या काली मिर्च डालने (शोर या "noise" जोड़ना) या उन्हें एक छोटे बॉक्स में छिपाने (आकार कम करना) जैसे थे। समस्या यह है कि ये तरीके अक्सर काम नहीं करते। वे भोजन का स्वाद बिगाड़ सकते हैं (AI के उत्तर को खराब कर सकते हैं) बिना वास्तव में गुप्त सामग्रियों को अच्छी तरह से छिपाए।

नया समाधान: "स्मार्ट फिल्टर" (प्राइवेसी एडेप्टर)

लेखक आपकी गोपनीयता की रक्षा करने के लिए एक नया, स्मार्ट तरीका प्रस्तावित करते हैं। वे इसे एक इन्फॉर्मेशन-थ्योरेटिक डिफेंस (Information-Theoretic Defense) कहते हैं।

इसे एक स्मार्ट फिल्टर (जिसे "प्राइवेसी एडेप्टर" कहा जाता है) के रूप में सोचें जिसे आप क्लाउड किचन में अपनी सामग्री भेजने से ठीक पहले स्थापित करते हैं।

  1. द स्क्वीज़ (सूचना का अवरोध या Information Bottleneck):
    कल्पना कीजिए कि आपकी सामग्रियां सब्जियों, मसालों और मांस का एक बड़ा, रंगीन ढेर हैं। स्मार्ट फिल्टर इस बड़े ढेर को एक बहुत ही पतली, संकरी स्ट्रॉ (नली) के माध्यम से गुजरने के लिए मजबूर करता है।
  • क्या पार होता है? भोजन की आवश्यक संरचना (सिंटैक्स या व्याकरण)। क्लाउड किचन के पास वाक्य को सही ढंग से पूरा करने के लिए पर्याप्त जानकारी रहती है।
  • क्या पीछे छूट जाता है? विशिष्ट, संवेदनशील विवरण (सिमेंटिक्स या गुप्त शब्द)। क्योंकि स्ट्रॉ बहुत संकरी है, इसलिए अनूठी, दुर्लभ सामग्रियां (जैसे किसी विशेष दवा का नाम या व्यक्ति की आईडी) इस दबाव में कुचल जाती हैं या खो जाती हैं।
  1. "नो-रेसिडुअल" नियम:
    पेपर एक महत्वपूर्ण बात बताता है: आप केवल अपनी सामग्री में थोड़ा शोर (noise) जोड़कर बेहतर होने की उम्मीद नहीं कर सकते। यदि आप मूल सामग्री के ऊपर केवल शोर जोड़ते हैं, तो एक स्मार्ट शेफ गणितीय रूप से शोर को "घटा" सकता है और मूल सामग्री को फिर से देख सकता है।
  • समाधान: लेखकों का फिल्टर पूरी तरह से मूल सामग्री को एक संकुचित (compressed) संस्करण के साथ बदल देता है। यह ढेर में कुछ जोड़ता नहीं है; यह मूल ढेर को फेंक देता है और केवल दबा हुआ, संकुचित संस्करण भेजता है। यह मूल रहस्य को रिवर्स-इंजीनियर करना गणितीय रूप से असंभव बना देता है।

वे फिल्टर को कैसे प्रशिक्षित करते हैं

लेखकों ने केवल इस फिल्टर को बनाने का अनुमान नहीं लगाया। उन्होंने एक "ट्रेनिंग कैंप" दृष्टिकोण का उपयोग किया:

  • डिफेंडर (आप): यह कोशिश करता है कि फिल्टर आपकी गुप्त बातों को छिपाने के लिए सामग्री को जितना हो सके उतना ज्यादा दबाए।
  • अटैकर (क्लाउड शेफ): यह दबाई गई सामग्री को देखकर मूल रेसिपी का अनुमान लगाने की कोशिश करता है।
  • खेल (The Game): वे आपस में एक खेल खेलते हैं। डिफेंडर यह सुनिश्चित करने की कोशिश करता है कि अटैकर विफल हो जाए, जबकि अटैकर अनुमान लगाने में बेहतर होने की कोशिश करता है। लक्ष्य वह सही संतुलन ढूंढना है जहां क्लाउड शेफ भोजन को पूरा कर सके (उच्च उपयोगिता/utility) लेकिन आपकी गुप्त सामग्री का अनुमान न लगा सके (उच्च गोपनीयता/privacy)।

"चयनात्मक सुरक्षा" का आश्चर्य

उनकी एक सबसे शानदार खोज यह है कि यह फिल्टर स्वाभाविक रूप से चयनात्मक (selective) है।

  • सामान्य शब्द (जैसे "the," "is," "and," या विराम चिह्न) आटे या पानी की तरह हैं। वे सामान्य हैं और एक छोटी स्ट्रॉ के माध्यम से भी आसानी से वर्णित किए जा सकते हैं। फिल्टर इन्हें आसानी से गुजरने देता है ताकि वाक्य व्याकरणिक रूप से सही रहे।
  • संवेदनशील शब्द (जैसे "कैंसर," "SSRI," या "फ्लाइट नंबर 621") दुर्लभ, विदेशी मसालों की तरह हैं। सीमित स्थान के साथ इन्हें वर्णित करना कठिन है। जब फिल्टर डेटा को दबाता है, तो ये दुर्लभ, संवेदनशील शब्द सबसे पहले गायब हो जाते हैं।

परिणाम: क्लाउड किचन अभी भी कह सकता है, "फ्लाइट अच्छी थी, स्टाफ मिलनसार था," लेकिन यह विशिष्ट फ्लाइट नंबर, रूट या मेडिकल स्थिति को पूरी तरह से खो देता है। हमलावर को पता हो सकता है कि आपने एक समीक्षा (review) लिखी थी, लेकिन वह यह नहीं बता पाएगा कि वह समीक्षा किस बारे में थी।

सरल भाषा में परिणाम

लेखकों ने शक्तिशाली AI मॉडल का उपयोग करके वास्तविक दुनिया के परिदृश्यों (मेडिकल नोट्स, कानूनी दस्तावेज, एयरलाइन समीक्षाएं) पर इसका परीक्षण किया।

  • गोपनीयता (Privacy): उन्होंने अन्य तरीकों की तुलना में हमलावर की आपकी गुप्त बातों को पहचानने की क्षमता को 15% से 35% तक कम कर दिया। कुछ मामलों में, हमलावर की सफलता दर लगभग 90% से गिरकर लगभग 50% (मूल रूप से एक कॉइन फ्लिप/सिक्का उछालने जैसा) रह गई।
  • गुणवत्ता (Quality): AI के उत्तर अभी भी बहुत अच्छे थे। भोजन का "स्वाद" नहीं बिगड़ा।
  • गति (Speed): फिल्टर इतना हल्का है कि इसने प्रक्रिया को केवल 6% से 8% तक धीमा किया। यह फोन पर उपयोग करने के लिए इतना तेज़ है कि आपको प्रतीक्षा नहीं करनी पड़ेगी।

सारांश

यह पेपर AI के लिए एक "स्मार्ट फिल्टर" पेश करता है जो क्लाउड को भेजने से पहले आपके डेटा को दबाता है। यह गणितीय रूप से गारंटी देता है कि संवेदनशील रहस्य कुचल दिए जाएंगे जबकि उपयोगी संरचना बरकरार रहेगी। यह एक पत्र भेजने जैसा है जहाँ लिफाफा इतना छोटा है कि केवल सामान्य विषय ही उसमें से निकल पाता है, लेकिन विशिष्ट नाम और नंबर पीछे ही छूट जाते हैं, और यह सब मेल की डिलीवरी को धीमा किए बिना होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →