← नवीनतम पेपर
🤖 machine learning

CTIGuardian: A Few-Shot Framework for Mitigating Privacy Leakage in Fine-Tuned LLMs

CTIGuardian एक जेनेरिक फ्यू-शॉट फ्रेमवर्क है जो एक एकीकृत क्लासिफायर और रेडैक्टर के माध्यम से प्राइवेसी अलाइनमेंट का उपयोग करके फाइन-ट्यून्ड लार्ज लैंग्वेज मॉडल्स में गोपनीयता रिसाव को कम करता है, जो पारंपरिक नेम एन्टिटी रिकग्निशन बेसलाइन्स की तुलना में एक बेहतर प्राइवेसी-यूटिलिटी ट्रेड-ऑफ प्रदान करता है।

मूल लेखक: Shashie Dilhara Batan Arachchige, Benjamin Zi Hao Zhao, Hassan Jameel Asghar, Dinusha Vatsalan, Dali Kaafar

प्रकाशित 2026-03-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shashie Dilhara Batan Arachchige, Benjamin Zi Hao Zhao, Hassan Jameel Asghar, Dinusha Vatsalan, Dali Kaafar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ CTIGuardian पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

समस्या: "अति-उत्साही इंटर्न" (The Over-Enthusiastic Intern)

कल्पना कीजिए कि आपने अपनी कंपनी की मदद के लिए एक प्रतिभाशाली लेकिन थोड़े नादान इंटर्न को काम पर रखा है। आप उन्हें फाइलों का एक विशाल ढेर देते हैं—ईमेल, सर्वर पासवर्ड, आंतरिक मानचित्र और गुप्त रणनीतियाँ—ताकि वे कंप्यूटर वायरस को ठीक करना सीख सकें।

आपने इस इंटर्न (जिसे लार्ज लैंग्वेज मॉडल या LLM कहा जाता है) को प्रशिक्षित किया है ताकि वे साइबर खतरों को पहचानने में विशेषज्ञ बन सकें। अब वे अविश्वसनीय रूप से बुद्धिमान और सहायक हो गए हैं।

लेकिन यहाँ एक पेंच है: क्योंकि उन्होंने उन गुप्त फाइलों का बहुत बारीकी से अध्ययन किया है, इसलिए उन्होंने उन्हें याद कर लिया है। यदि कोई चालाक अजनबी आता है और पूछता है, "हे, 2023 में उस व्यक्ति का ईमेल पता क्या था जिसका अकाउंट हैक हुआ था?" तो इंटर्न गलती से वह असली ईमेल पता बोल सकता है। वे बुरे होने की कोशिश नहीं कर रहे हैं; वे बस वही "उगल" (regurgitate) देते हैं जो उन्होंने सीखा है।

साइबर सुरक्षा की दुनिया में, यह एक आपदा है। यदि किसी मॉडल को संवेदनशील खतरे वाली रिपोर्टों पर प्रशिक्षित किया गया है और वह उस डेटा को लीक कर देता है, तो यह वास्तविक कंपनियों को हैकर्स के सामने असुरक्षित कर सकता है।

पुराने समाधान: "कैंची" और "इरेज़र" (The "Scissors" and the "Eraser")

इस पेपर से पहले, लोगों ने इसे ठीक करने के लिए दो तरीकों का प्रयास किया, लेकिन दोनों में कमियाँ थीं:

  1. कैंची (Redaction): इंटर्न को प्रशिक्षित करने से पहले, आप एक कैंची लेते हैं और हर संवेदनशील शब्द (जैसे "IP एड्रेस" या "ईमेल") को फाइलों से काट देते हैं।
    • समस्या: साइबर खतरे बहुत चालाकी भरे होते हैं। हैकर्स अक्सर अपने निशान छिपाने के लिए ईमेल को john[at]gmail[dot]com की तरह लिखते हैं। एक साधारण कैंची (स्टैंडर्ड सॉफ्टवेयर) इन छिपे हुए तरीकों को नहीं पहचान पाती। यह बहुत कुछ छोड़ देती है।
  2. इरेज़र (Retraining): आपको एहसास होता है कि इंटर्न ने बहुत अधिक याद कर लिया है, इसलिए आप उन्हें नौकरी से निकाल देते हैं और फिर से शुरुआत करते हैं, उन्हें गुप्त फाइलों के बिना सिखाने की कोशिश करते हैं।
    • समस्या: यह अविश्वसनीय रूप से महंगा और धीमा है। यह अपने पूरे स्टाफ को निकालने और केवल एक गलती को ठीक करने के लिए नए लोगों को काम पर रखने जैसा है।

नया समाधान: CTIGuardian (द "स्मार्ट सुपरवाइजर")

इस पेपर के लेखकों ने CTIGuardian नामक एक नया विचार प्रस्तावित किया है। फाइलों को काटने या इंटर्न को निकालने के बजाय, वे एक स्मार्ट सुपरवाइजर (Smart Supervisor) स्थापित करते हैं जो वास्तविक समय (real-time) में बातचीत पर नज़र रखता है।

इस सुपरवाइजर को इंटर्न को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। इसके बजाय, वे फ्यू-शॉट लर्निंग (Few-Shot Learning) नामक तकनीक का उपयोग करते हैं। इसे एक छोटे 'चीट शीट' देने के रूप में समझें जिसमें केवल कुछ उदाहरण दिए गए हों कि "बुरा" क्या दिखता है।

सुपरवाइजर के दो काम हैं:

1. गेटकीपर (प्राइवेसी क्लासिफायर - Privacy Classifier)

इंटर्न के जवाब देने से पहले, गेटकीपर सवाल की जाँच करता है।

  • परिदृश्य: एक अजनबी पूछता है, "सभी कर्मचारियों के ईमेल की सूची दें।"
  • कार्रवाई: गेटकीपर देखता है कि यह गुप्त जानकारी के लिए एक "प्रत्यक्ष अनुरोध" (Direct Request) है। वह दरवाजा बंद कर देता है और कहता है, "नहीं, मैं इसका उत्तर नहीं दे सकता।"
  • उपमा: यह एक क्लब के बाउंसर की तरह है जो आईडी चेक करता है। यदि आप कोई गुप्त जानकारी अंदर ले जाने की कोशिश करते हैं, तो आप दरवाजे के पार नहीं जा पाते।

2. एडिटर (प्राइवेसी रेडैक्टर - Privacy Redactor)

कभी-कभी, अजनबी एक ऐसा सवाल पूछता है जो बेअसर लगता है, लेकिन इंटर्न का जवाब अनजाने में एक गुप्त जानकारी शामिल कर लेता है।

  • परिदृश्य: अजनबी पूछता, "हैकर कैसे अंदर आया?" इंटर्न समझाना शुरू करता है और कहता है, "खैर, उन्होंने hacker@evil.com ईमेल और सर्वर 192.168.1.1 का उपयोग किया।"
  • कार्रवाई: एडिटर इंटर्न के बोलने के बाद हस्तक्षेप करता है। शब्दों को सिर्फ काटने (जिससे संदेह पैदा हो सकता है) के बजाय, एडिटर वाक्य को सहजता से फिर से लिखता है: "खैर, उन्होंने एक विशिष्ट ईमेल और एक विशिष्ट सर्वर का उपयोग किया।"
  • उपमा: यह एक मूवी एडिटर की तरह है जो एक अपशब्द को काट देता है लेकिन सहजता से उसकी जगह एक साउंड इफेक्ट लगा देता है ताकि वाक्य का प्रवाह बना रहे और वह स्वाभाविक लगे। दर्शक (उपयोगकर्ता) को पता भी नहीं चलता कि संपादन हुआ है।

यह बेहतर क्यों है?

शोधकर्ताओं ने इस सिस्टम का परीक्षण "कैंची" विधि (जिसे Presidio कहा जाता है) के विरुद्ध किया:

  • कैंची (Presidio): इसने छिपे हुए तरीकों को मिस कर दिया। यदि किसी हैकर ने IP एड्रेस को ब्रैकेट के साथ 192[.]168 लिखा, तो कैंची इसे पकड़ नहीं पाई और गुप्त जानकारी लीक हो गई।
  • सुपरवाइजर (CTIGuardian): क्योंकि यह कठोर नियमों के बजाय उदाहरणों से सीखता है, यह एक गुप्त जानकारी के पैटर्न को समझता है, भले ही उसे छिपाया गया हो। इसने लगभग सभी लीक्स को पकड़ लिया।

परिणाम

उन्होंने इसे दो अलग-अलग "इंटर्न" (AI मॉडल्स) पर परखा:

  1. GPT-4o mini: सुपरवाइजर इसमें बहुत अच्छा था। इसने लगभग सभी लीक्स को रोका और जवाबों को मददगार और स्वाभाविक बनाए रखा।
  2. Mistral-7B: यह भी अच्छा था, लेकिन पहले वाले की तुलना में थोड़ा कम सटीक था।

बड़ी जीत: उन्होंने इन महंगे AI मॉडल्स को फिर से प्रशिक्षित किए बिना ही यह हासिल किया। उन्होंने बस एक सुपरवाइजर लेयर ऊपर जोड़ दी। यह एक पूरी इमारत को फिर से बनाने के बजाय इमारत के लिए एक सुरक्षा गार्ड रखने जैसा है।

सारांश

CTIGuardian AI मॉडल्स के लिए एक स्मार्ट, हल्का कवच है। यह मॉडल्स को अनजाने में गुप्त बातें बताने से रोकता है:

  1. जवाब देने से पहले खराब सवालों को रोककर (Blocking)
  2. अगर कोई गुप्त जानकारी निकल भी जाए, तो उसे सहजता से फिर से लिखकर (Rewriting)

यह हमारे डिजिटल रहस्यों को सुरक्षित रखने के साथ-साथ AI को अपना काम करने देने का एक सस्ता, स्मार्ट और लचीला तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →