← नवीनतम पेपर
🤖 AI

Addressing Labelled Data Scarcity: Taxonomy-Agnostic Annotation of PII Values in HTTP Traffic using LLMs

यह शोध पत्र एक बहु-चरणीय लार्ज लैंग्वेज मॉडल पाइपलाइन का प्रस्ताव और मूल्यांकन करता है जो सिंथेटिक ट्रैफिक जनरेशन के माध्यम से डेटा की कमी को संबोधित करते हुए, विविध गोपनीयता परिभाषाओं के बीच सटीक पहचान प्रदर्शित करता है और HTTP ट्रैफ़िक में व्यक्तिगत रूप से पहचान योग्य जानकारी (PII) के लचीले, वर्गीकरण-अज्ञेय (taxonomy-agnostic) एनोटेशन को सक्षम बनाता है।

मूल लेखक: Thomas Cory, Axel Küpper

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thomas Cory, Axel Küpper

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त शहर के गोपनीयता निरीक्षक (privacy inspector) हैं। आपका काम हर उस पत्र, पैकेज और डिजिटल संदेश की जाँच करना है जो शहर से बाहर जा रहा है, ताकि यह सुनिश्चित किया जा सके कि कोई अनजाने में कोई गुप्त व्यक्तिगत जानकारी (जैसे घर का पता, फ़ोन नंबर, या मेडिकल रिकॉर्ड) बाहर न भेज दे। इस गुप्त जानकारी को PII (व्यक्तिगत पहचान योग्य जानकारी) कहा जाता है।

वर्षों से, निरीक्षकों ने दो मुख्य उपकरणों का उपयोग किया है:

  1. नियम पुस्तिका (The Rulebook): कीवर्ड्स की एक कठोर सूची (जैसे "ईमेल" या "SSN")। यह सरल पत्रों के लिए तो अच्छा काम करता है, लेकिन जब लोग अजीब तरीके से या कोड में लिखते हैं, तो यह विफल हो जाता है।
  2. प्रशिक्षित कुत्ता (The Trained Dog): एक मशीन लर्निंग मॉडल जिसे हजारों उदाहरणों पर प्रशिक्षित किया गया है। यह स्मार्ट है, लेकिन यह केवल उन्हीं विशिष्ट नियमों को जानता है जो इसे सिखाए गए हैं। यदि नियम बदलते हैं (जैसे, एक नया कानून "स्वास्थ्य डेटा" को अलग तरह से परिभाषित करता है), तो कुत्ते को फिर से प्रशिक्षित करने की आवश्यकता होती है, जिसमें बहुत समय लगता है और अध्ययन के लिए वास्तविक, गुप्त पत्रों की एक विशाल आपूर्ति की आवश्यकता होती है।

समस्या: वास्तविक गुप्त पत्र प्राप्त करना कठिन है (क्योंकि गोपनीयता कानूनों के कारण) और नियम कि क्या "गुप्त" है, हमेशा बदलते रहते हैं। यह निरीक्षकों के पास अच्छे प्रशिक्षण डेटा और ऐसे उपकरणों की कमी छोड़ देता है जो अनुकूलित हो सकें।

नया समाधान: "सुपर-ट्रांसलेटर" (The Super-Translator)

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग करके एक नया दृष्टिकोण पेश करता है। एक LLM को केवल एक प्रशिक्षित कुत्ते के रूप में नहीं, बल्कि एक सुपर-स्मार्ट, लचीले अनुवादक के रूप में सोचें जिसने पुस्तकालय में लगभग सब कुछ पढ़ा है। आपको इस अनुवादक को विशिष्ट नियमों पर प्रशिक्षित करने की आवश्यकता नहीं है; आपको बस उसे अभी (रनटाइम पर) नियम पुस्तिका थमा देनी है, और वह तुरंत उसे समझ सकता है।

लेखकों ने कैसे अपना सिस्टम बनाया, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. असेंबली लाइन (The Pipeline)

अनुवादक को एक साथ सब कुछ करने के लिए कहने के बजाय, लेखकों ने तीन चरणों वाली एक असेंबली लाइन बनाई:

  • चरण 1: क्लीनर (Pre-processing): अनुवादक के संदेश देखने से पहले, एक मशीन उसे साफ करती है। यह कोड को अनस्क्रैम्बल करती है (जैसे %20 को वापस स्पेस में बदलना) ताकि अनुवादक एक स्पष्ट, पठनीय वाक्य देख सके।
  • चरण 2: डिटेक्टिव और स्क्राइब (दो-चरणीय एनोटेशन):
    • डिटेक्टिव (Detective): पहले, LLM संदेश को देखता है और कहता है, "मुझे यहाँ एक फ़ोन नंबर और एक नाम दिख रहा है, लेकिन कोई मेडिकल रिकॉर्ड नहीं है।" यह क्या ढूँढना है, इसकी एक छोटी सूची बनाता है।
    • स्क्राइब (Scribe): फिर, दूसरा दौर केवल उन विशिष्ट वस्तुओं के लिए सटीक टेक्स्ट खोजने पर ध्यान केंद्रित करता है। ध्यान केंद्रित करके, स्क्राइब अन्य नंबरों या शब्दों से भ्रमित नहीं होता है।
  • चरण 3: एडिटर (Review): एक अंतिम जाँच काम की समीक्षा करती है। यदि स्क्राइब ने कोई नंबर छोड़ दिया या गलत शब्द पकड़ लिया, तो एडिटर उसे ठीक करता है।

2. "नकली पत्र" फैक्ट्री (The "Fake Letter" Factory - Synthetic Data)

चूंकि निरीक्षक लोगों के वास्तविक गुप्त पत्रों का उपयोग अपने उपकरणों को प्रशिक्षित करने के लिए नहीं कर सकते, इसलिए लेखकों ने एक नकली पत्र बनाने वाली फैक्ट्री बनाई।

  • यह फैक्ट्री एक नियम पुस्तिका (टैक्सोनॉमी) लेती है और LLM से ऐसे यथार्थवादी दिखने वाले पत्र लिखने के लिए कहती है जिनमें विशिष्ट रहस्य (जैसे "जॉन डो का फ़ोन नंबर") शामिल हों।
  • महत्वपूर्ण बात यह है कि फैक्ट्री द्वारा बनाए गए हर पत्र के लिए वह उत्तर (ग्राउंड ट्रुथ) भी लिख देती है।
  • यह क्यों मायने रखता है: यह "कमी" की समस्या को हल करता है। आप बिना किसी वास्तविक व्यक्ति के निजी डेटा को छुए, तुरंत हजारों अभ्यास पत्र और उनके सटीक उत्तर उत्पन्न कर सकते हैं।

3. टेस्ट ड्राइव (The Test Drive - Evaluation)

लेखकों ने तीन अलग-अलग "नियम पुस्तिकाओं" (Taxonomies) के साथ अपने सिस्टम का परीक्षण किया:

  1. AI4Privacy: सामान्य रहस्यों (नाम, ईमेल, आईडी) की एक विस्तृत सूची।
  2. mHealth: स्वास्थ्य ऐप्स के लिए एक विशिष्ट सूची (महत्वपूर्ण संकेत, फिटनेस डेटा)।
  3. PlayStore: ऐप स्टोर द्वारा उपयोग की जाने वाली उच्च-स्तरीय सूची (जैसे, "वित्तीय डेटा" या "लोकेशन")।

परिणाम:

  • सफलता: सिस्टम पहले दो नियम पुस्तिकाओं पर अविश्वसनीय रूप से अच्छा काम कर रहा था। यह एक संदेश को पढ़ सकता था, उस दिन प्रदान की गई विशिष्ट नियम पुस्तिका को देख सकता था, और रहस्यों को सटीक रूप से खोज सकता था।
  • चुनौती: यह "PlayStore" नियम पुस्तिका के साथ थोड़ा अधिक संघर्ष करता है। लेखक बताते हैं कि ऐसा इसलिए है क्योंकि यह नियम पुस्तिका बहुत व्यापक श्रेणियों (जैसे "वित्तीय डेटा") का उपयोग करती है, जिन्हें "फ़ोन नंबर" जैसी ठोस चीज़ों की तुलना में किसी संदेश में एक विशिष्ट शब्द तक सीमित करना कठिन है।
  • "एडिटर" चरण: दिलचस्प बात यह है कि अंतिम "एडिटर" चरण ने हमेशा चीजों को बेहतर नहीं बनाया। कभी-कभी इसने गलतियों को ठीक किया, लेकिन अन्य बार इसने नई गलतियाँ भी पैदा कर दीं। लेखक सुझाव देते हैं कि ऐसा इसलिए हो सकता है क्योंकि एडिटर उसी "मस्तिष्क" का उपयोग कर रहा था जिसका उपयोग स्क्राइब कर रहा था, इसलिए वह उसी प्रकार की गलतियाँ करता था।

निचोड़ (The Bottom Line)

यह शोध पत्र सिद्ध करता है कि आपको हर बार गोपनीयता नियम बदलने पर मशीन को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। इसके बजाय, आप एक लचीले AI का उपयोग कर सकते हैं जो चलते समय नियमों को पढ़ता है।

  • निरीक्षकों के लिए: आप अपने उपकरणों को फिर से बनाए बिना तुरंत नियम पुस्तिकाओं को बदल सकते हैं।
  • डेटा की कमी के लिए: आप अपने उपकरणों का परीक्षण करने के लिए अपना स्वयं का अभ्यास डेटा (नकली पत्र) बना सकते हैं, ताकि आपको वास्तविक लोगों का डेटा चुराने की आवश्यकता न पड़े।

लेखक निष्कर्ष निकालते हैं कि हालांकि यह अभी भी हल्के और तेज़ डिटेक्टरों का पूर्ण विकल्प नहीं है, लेकिन यह उच्च गुणवत्ता वाला प्रशिक्षण डेटा बनाने और प्रणालियों के ऑडिट करने के लिए एक शक्तिशाली उपकरण है। वे सुझाव देते हैं कि सबसे अच्छा भविष्य का मार्ग यह है कि इस लचीले AI का उपयोग डेटा बनाने के लिए किया जाए, और फिर छोटे, तेज़ मशीनों को यह काम करने के लिए सिखाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →