Privacy-Preserving RAG by Concealing Sensitive Information from External LLMs
यह शोध पत्र SEAG को प्रस्तुत करता है, जो एक गोपनीयता-संरक्षण फ्रेमवर्क है जो संवेदनशील संस्थाओं (entities) की पहचान करने और उन्हें उपयोगकर्ता के प्रश्नों और प्राप्त दस्तावेजों दोनों में उपनामों (aliases) से बदलने के लिए एक हल्के मॉडल का उपयोग करता है, जिससे गोपनीय जानकारी को उजागर किए बिना रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) में बाहरी लार्ज लैंग्वेज मॉडल्स के सुरक्षित उपयोग को सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, जादुई पुस्तकालय में हैं जहाँ की किताबें 'लार्ज लैंग्वेज मॉडल्स' (LLMs) नामक सुपर-स्मार्ट रोबोटों द्वारा लिखी गई हैं। ये रोबोट सवाल पूछने में अद्भुत हैं, लेकिन वे अपने आप में दुनिया के बारे में सब कुछ नहीं जानते। इसलिए, उनकी मदद करने के लिए, हम RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) नामक एक प्रणाली का उपयोग करते हैं। RAG को एक रिसर्च असिस्टेंट की तरह समझें: जब आप कोई प्रश्न पूछते हैं, तो असिस्टेंट जल्दी से पुस्तकालय की अलमारियों से सबसे प्रासंगिक पन्ने निकालता है और उन्हें रोबोट को थमा देता है। फिर रोबोट उन पन्नों को पढ़ता है और आपके लिए एक सटीक उत्तर लिखता है।
लेकिन यहाँ एक पेचीदा हिस्सा है: कभी-कभी, उन पुस्तकालय के पन्नों में बेहद गुप्त जानकारी हो सकती है, जैसे आपके मेडिकल रिकॉर्ड, आपके बैंक खाते के नंबर, या किसी कंपनी की गुप्त रेसिपी। आमतौर पर, हमें इस बात की चिंता होती है कि कहीं आप गलती से वे गुप्त बातें न देख लें जिन्हें देखने का आपको अधिकार नहीं है। लेकिन क्या होगा अगर समस्या खुद उस रोबोट के साथ हो? यदि आप वे गुप्त पन्ने किसी दूसरी कंपनी के क्लाउड (जैसे कि एक थर्ड-पार्टी AI सर्विस) में रहने वाले रोबोट को भेजते हैं, तो वह रोबोट सब कुछ देख लेता है। वह अनजाने में आपके रहस्यों को लीक कर सकता है या उनका उपयोग उन तरीकों से कर सकता है जो आपकी मंशा के विरुद्ध हों। बड़ा सवाल जिसका यह पेपर समाधान करता है, वह यह है: हम इन शक्तिशाली, बाहरी रोबोटों का उपयोग बेहतरीन उत्तर पाने के लिए कैसे कर सकते हैं, बिना उन्हें हमारे निजी रहस्यों को दिखाए?
द सीक्रेट एजेंट फ्रेमवर्क: SEAG
इस पेपर के लेखकों ने, जो सऊदी अरब की एक टीम है, एक चतुर समाधान निकाला है जिसे SEAG (सेंसिटिव एंटिटी एलियास जनरेटर) कहा जाता है। कल्पना कीजिए कि आपके पास एक टॉप-सीक्रेट जासूसी मिशन है। आपको मदद पाने के लिए एक मित्रवत लेकिन दूर स्थित मुख्यालय (एक्सटर्नल AI) को एक रिपोर्ट भेजनी है, लेकिन आप उन्हें जासूसों के नाम, बेस के स्थान, या हथियारों के कोड नेम नहीं देखने दे सकते।
एक सामान्य RAG सिस्टम में, आप बस कच्ची रिपोर्ट मुख्यालय को भेज देंगे, और वे हर शब्द को पढ़ लेंगे। लेकिन SEAG के साथ, आप रिपोर्ट भेजने से ठीक पहले एक स्थानीय, छोटा, और सुपर-फास्ट ट्रांसलेटर लगा देते हैं। यह ट्रांसलेटर एक छोटा AI मॉडल है जो आपके अपने कंप्यूटर पर सुरक्षित रूप से रहता है।
यहाँ यह जादू कैसे होता है:
- स्कैन (The Scan): आपका स्थानीय ट्रांसलेटर आपके प्रश्न और आपके गुप्त दस्तावेज़ों को पढ़ता है। यह उन "संवेदनशील संस्थाओं" (sensitive entities) को पहचानता है—जैसे नाम, तारीखें, स्थान और संख्याएँ जिन्हें सुरक्षा की आवश्यकता है।
- बदलना (The Swap): यह एक गुप्त कोडबुक (एक "एंटिटी रिप्लेसमेंट टेबल") बनाता है। यह "डॉ. स्मिथ" को "डॉ. जोन्स" से, "न्यूयॉर्क" को "शिकागो" से, और "10 मिलियन" से बदल देता है। महत्वपूर्ण बात यह है कि यह सुनिश्चित करता है कि यह बदलाव तर्कसंगत हो। यदि यह किसी देश का नाम बदलता है, तो यह नए देश के अनुरूप उसकी राजधानी को भी बदल देता है, ताकि कहानी व्याकरणिक और तार्किक रूप से सही बनी रहे।
- भेजना (The Send): यह इस "साफ किए गए" संस्करण को शक्तिशाली बाहरी रोबोट को भेजता है। बाहरी रोबोट अपना काम करता है, नकली नामों और संख्याओं के आधार पर प्रश्न का उत्तर देता है। उसे पता ही नहीं चलता कि वह एक भेष बदलकर काम कर रहा है।
- प्रकट करना (The Reveal): जब बाहरी रोबोट अपना उत्तर वापस भेजता है, तो आपका स्थानीय ट्रांसलेटर फिर से कोडबुक का उपयोग करता है। यह "डॉ. जोन्स" को वापस "डॉ. स्मिथ" में और "5 मिलियन" में बदल देता है।
- परिणाम (The Result): आपको अपने असली रहस्यों को सुरक्षित रखते हुए सटीक उत्तर मिलता है, जबकि बाहरी रोबोट ने कुछ भी नहीं देखा।
उन्होंने क्या पाया
टीम ने इस विचार का परीक्षण करने के लिए अभ्यास प्रश्नों और दस्तावेज़ों के दो विशेष सेट बनाए। एक सेट का उपयोग उनके स्थानीय ट्रांसलेटर को नामों को सही ढंग से बदलने के लिए सिखाने के लिए किया गया था, और दूसरे सेट का उपयोग यह देखने के लिए किया गया कि क्या पूरा सिस्टम वास्तव में काम करता है। उन्होंने इसे तीन अलग-अलग छोटे ट्रांसलेटर मॉडल्स के साथ आज़माया: Qwen-3, LLaMA-3.2, और Phi-4। इसके बाद उन्होंने इन छद्म प्रश्नों को दुनिया के दो सबसे शक्तिशाली बाहरी रोबोटों: GPT-5 और Claude-4 sonnet को भेजा।
परिणाम काफी उत्साहजनक थे। सिस्टम ने अधिकांश मामलों में संवेदनशील जानकारी को सफलतापूर्वक छिपा दिया। जब हमने यह मापा कि सिस्टम ने रहस्यों को कितनी अच्छी तरह छुपाया (इसका "प्राइवेसी" स्कोर), तो LLaMA-3.2 मॉडल सबसे बेहतर प्रदर्शन करने वाला रहा, जिसने Claude-4 जनरेटर के साथ मिलकर लगभग 89.67% रहस्यों को छिपाया।
लेकिन रहस्यों को छिपाना ही आधी लड़ाई है; उत्तर अभी भी आपके लिए सही होना चाहिए। टीम ने इसे एक "यूजर" स्कोर के साथ मापा। उन्होंने पाया कि LLaMA-3.2 को ट्रांसलेटर के रूप में और Claude-4 sonnet को आंसर-बॉट के रूप में इस्तेमाल करने से सबसे अच्छे परिणाम मिले, जिसका स्कोर 83.67% था। इसका मतलब है कि 10 में से 8 से अधिक बार, यूजर को सही उत्तर मिला और उनके रहस्य सुरक्षित रहे, भले ही बाहरी रोबोट नकली डेटा पर काम कर रहा था।
दिलचस्प बात यह है कि जब उन्होंने यह देखा कि मॉडल्स ने दस्तावेज़ों में हर एक संवेदनशील शब्द को कितनी अच्छी तरह छिपाया (न कि केवल उन शब्दों को जो उत्तर के लिए आवश्यक थे), तो Qwen-3 और LLaMA-3.2 का प्रदर्शन बहुत करीब रहा, जिनकी कुल सटीकता क्रमशः 77.83% और 76.73% थी। Phi-4 मॉडल इस विशिष्ट व्यापक परीक्षण में थोड़ा कम प्रभावी रहा, जिसका स्कोर लगभग 74.91% था।
चुनौती और भविष्य
लेखक सावधानीपूर्वक यह नोट करते हैं कि यह अभी तक कोई पूर्ण, हल की गई समस्या नहीं है। उनके परीक्षण लगभग 300 शब्दों लंबे दस्तावेज़ों पर किए गए थे जिनमें लगभग 15 संवेदनशील आइटम थे। वे स्वीकार करते हैं कि यदि दस्तावेज़ बहुत लंबे हो जाते हैं या उनमें सैकड़ों रहस्य होते हैं, तो सिस्टम को कहानी को सुसंगत रखने और रहस्यों को छिपाने में संघर्ष करना पड़ सकता है।
हालाँकि, यह पेपर एक बहुत ही रोमांचक मार्ग सुझाता है। यह दिखाता है कि हमें अपने डेटा को सुरक्षित रखने के लिए महंगे, विशाल कंप्यूटर बनाने की आवश्यकता नहीं है। इसके बजाय, हम एक छोटे, सस्ते स्थानीय मॉडल का उपयोग एक "प्राइवेसी फ़िल्टर" के रूप में कर सकते हैं, जिससे हमें विशाल, बाहरी AI रोबोटों की शक्तियों का आनंद लेने की अनुमति मिलती है, बिना अपने साम्राज्य की चाबियाँ उन्हें सौंपे। लेखक सुझाव देते हैं कि भविष्य के कार्यों में लंबे, अधिक जटिल दस्तावेज़ों पर परीक्षण करने की आवश्यकता होगी ताकि यह देखा जा सके कि क्या सिस्टम दबाव में भी टिक पाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।