← नवीनतम पेपर
💻 computer science

HybridPII: A Tunable High-Recall Ensemble for Automated PII Detection and Privacy Risk Assessment in Compliance-Critical Applications

यह शोध पत्र HybridPII को प्रस्तुत करता है, जो एक ट्यूनेबल हाइब्रिड एनसेम्बल मॉडल है जो स्वचालित PII डिटेक्शन के लिए बेहतर रिकॉल प्राप्त करने हेतु वेटेड रेगएक्स (regex) और मल्टी-मॉडल NER को संयोजित करता है, जो विशेष रूप से अनुपालन-महत्वपूर्ण गोपनीयता अनुप्रयोगों में फॉल्स नेगेटिव्स को कम करने की महत्वपूर्ण आवश्यकता को संबोधित करता है।

मूल लेखक: Soni Sweta, Arunabh Kshitij Kshitij

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Soni Sweta, Arunabh Kshitij Kshitij

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डिजिटल जासूस हैं जो अक्षरों के एक विशाल ढेर में छिपे गुप्त कोड (जैसे नाम, फोन नंबर, या आईडी कार्ड) खोजने की कोशिश कर रहे हैं। यदि आप एक भी गुप्त कोड चूक जाते हैं, तो यह एक आपदा है क्योंकि किसी की गोपनीयता लीक हो सकती है। लेकिन यदि आप बहुत सारे हानिरहित शब्दों को गुप्त कोड के रूप में चिह्नित करते हैं, तो यह बस थोड़ा कष्टप्रद है।

यह शोध पत्र एक नई जासूसी टीम पेश करता है जिसे HybridPII कहा जाता है। इसका मुख्य लक्ष्य क्या है? एक "हाई-रिकॉल" (high-recall) शिकारी बनना। जासूसी के शब्दों में कहें तो, इसका मतलब है कि यह एक निर्दोष व्यक्ति को पकड़ने और गलती से उस पर गुप्त कोड होने का आरोप लगाने के बजाय, एक भी असली अपराधी को न छोड़ने को प्राथमिकता देता है। लेखकों ने इसे इसलिए बनाया क्योंकि वास्तविक दुनिया में, एक गुप्त कोड को चूक जाना (एक "फॉल्स नेगेटिव"), गलती से किसी चीज़ को चिह्नित करने से कहीं अधिक खतरनाक है।

दो जासूस जो आपस में सहमत नहीं होते

इस टीम को बनाने के लिए, शोधकर्ताओं ने दो बहुत अलग प्रकार के जासूसों को मिलाया:

  1. नियमों का पालन करने वाला (Regex): यह जासूस एक सख्त चेकलिस्ट वाले रोबोट की तरह है। यह सटीक पैटर्न की तलाश करता है, जैसे कि एक ईमेल पता जिसमें अनिवार्य रूप से "@" चिह्न होना चाहिए या एक फोन नंबर जिसमें ठीक 10 अंक होने चाहिए। यह बहुत तेज़ है और इन विशिष्ट पैटर्नों पर कभी गलती नहीं करता, लेकिन यह अनुमान लगाने में बहुत खराब है। यदि कोई नाम अजीब तरीके से लिखा गया है या फोन नंबर में एक अंक कम है, तो नियम का पालन करने वाला उसे पूरी तरह से छोड़ देता है।

  2. संदर्भ पढ़ने वाला (NER): यह जासूस एक इंसान की तरह है जो यह समझने के लिए पूरे वाक्य को पढ़ता है कि क्या हो रहा है। यह किसी व्यक्ति के नाम को तब भी पहचान सकता है जब वह किसी सूची में न हो, या यह अनुमान लगा सकता है कि "जॉन" एक नाम है क्योंकि वह "डॉक्टर" के बगल में लिखा है। लेकिन यह जासूस धीमा है, सख्त पैटर्न (जैसे कि क्रेडिट कार्ड नंबर जो नाम जैसा नहीं दिखता) से भ्रमित हो जाता है, और कभी-कभी गलत अनुमान भी लगाता है।

जादुई मिश्रण

शोध पत्र का तर्क है कि केवल एक ही जासूस का उपयोग करना पर्याप्त नहीं है। नियम का पालन करने वाला बहुत सी चीजें छोड़ देता है, और संदर्भ पढ़ने वाला सख्त नंबरों से भ्रमित हो जाता है।

इसलिए, उन्होंने HybridPII बनाया, एक टीम जहाँ दोनों जासूस मिलकर काम करते हैं। वे नियम का पालन करने वाले को सख्त पैटर्न (जैसे ईमेल और आईडी) संभालने देते हैं और संदर्भ पढ़ने वाले को बिखरी हुई चीजों (जैसे नाम और स्थान) को संभालने देते हैं। उन्होंने नियम का पालन करने वाले को उनके स्कोरिंग सिस्टम में थोड़ा "बॉस" का दर्जा भी दिया ताकि यह सुनिश्चित किया जा सके कि सख्त पैटर्न हमेशा पकड़े जाएं।

आंकड़े क्या कहते हैं (प्रमाण)

शोधकर्ताओं ने 30 नकली दस्तावेजों के ढेर का उपयोग करके इस नई टीम का परीक्षण चार अन्य प्रसिद्ध जासूसी उपकरणों (एक बड़े उद्योग मानक "Presidio" सहित) के विरुद्ध किया। यहाँ उन्होंने जो पाया:

  • हाई-रिकॉल की जीत: HybridPII टीम ने सभी गुप्त कोडों में से 0.8324 को पकड़ा। यह सबसे अधिक "कैच रेट" है। तुलना के लिए, उद्योग मानक "Presidio" ने केवल 0.6768 को पकड़ा।
  • समझौता (Trade-Off): क्योंकि टीम सब कुछ पकड़ने के लिए बहुत उत्सुक थी, इसलिए उन्होंने बहुत सी ऐसी चीजों को भी चिह्नित किया जो गुप्त कोड नहीं थे। उनकी "प्रिसिजन" (वे कितनी बार सही थे जब उन्होंने चिल्लाकर कहा "मिल गया!") कम थी, जो 0.4626 थी।
  • ट्यूनेबल रहस्य: शोध पत्र दिखाता है कि यह टीम एक वॉल्यूम नॉब वाले रेडियो की तरह है। सेटिंग्स को समायोजित करके (विशेष रूप से, कॉन्फिडेंस थ्रेशोल्ड को 0.30 पर सेट करके और टीम के फोकस को 70/30 या 50/50 में विभाजित करके), वे इस टीम को स्मार्ट बना सकते हैं। जब उन्होंने ऐसा किया, तो टीम का समग्र स्कोर (F1-score) उछलकर 0.6519 हो गया। यह वास्तव में उद्योग मानक "Presidio" को पीछे छोड़ देता है, जिसका स्कोर 0.6211 था।

उन्होंने किसे खारिज किया

शोध पत्र बहुत स्पष्ट है कि अकेले क्या काम नहीं करता है:

  • केवल नियम का पालन करने वाले का उपयोग करना: यह बहुत से रहस्यों को छोड़ देता है (केवल 0.4618 को पकड़ पाता है)।
  • केवल संदर्भ पढ़ने वाले का उपयोग करना: यह सख्त नंबरों से भ्रमित हो जाता है और खराब स्कोर (0.3750) करता है।
  • बिना विशेष प्रशिक्षण के एक जेनेरिक "ट्रांसफॉर्मर" मॉडल (जैसे BERT) का उपयोग करना: शोध पत्र ने एक मानक प्री-ट्रेंड मॉडल का परीक्षण किया और पाया कि यह बहुत खराब प्रदर्शन करता है, जिसका F1-स्कोर केवल 0.1868 था। लेखक सुझाव देते हैं कि ये बड़े, जेनेरिक मॉडल इस विशिष्ट कार्य के लिए "सिल्वर बुलेट" नहीं हैं जब तक कि उन्हें सही डेटा पर भारी प्रशिक्षण न दिया जाए।

"रिस्क स्कोर" बोनस

टीम केवल कोड खोजने तक ही नहीं रुकी। उन्होंने एक "प्राइवेसी रिस्क एनालाइजर" बनाया है जो एक सुरक्षा गार्ड की तरह काम करता है। यह गिनता है कि कितने खतरनाक कोड (जैसे सोशल सिक्योरिटी नंबर) मिले हैं और दस्तावेज़ को 0 से 100 तक का रिस्क स्कोर देता है।

  • उनके परीक्षणों में, वित्तीय (Financial) दस्तावेजों को 37.00 का रिस्क स्कोर मिला (मध्यम)।
  • स्वास्थ्य सेवा (Healthcare) दस्तावेजों को 21.00 मिला (मध्यम)।
  • कानूनी (Legal) और ई-कॉमर्स (E-commerce) दस्तावेजों को 11.00 मिला (निम्न)।
    यह कंपनियों को यह जानने में मदद करता है कि किन दस्तावेजों को सबसे अधिक सुरक्षा की आवश्यकता है।

कमी (सीमाएं)

लेखक अपने प्रयोग की सीमाओं के बारे में ईमानदार हैं। उन्होंने अपने परीक्षणों के लिए सिंथेटिक डेटा (कंप्यूटर द्वारा बनाए गए नकली दस्तावेज़) का उपयोग किया, वास्तविक दुनिया की अव्यवस्थित फाइलें नहीं। उन्होंने यह भी नोट किया कि उनके एक टीम सदस्य (एक विशिष्ट भाषा मॉडल en_core_web_lg) को इंस्टॉलेशन के दौरान एक तकनीकी खराबी का सामना करना पड़ा, इसलिए यदि इस खराबी को ठीक कर दिया जाए तो परिणाम और भी बेहतर हो सकते हैं। साथ ही, यह सिस्टम वर्तमान में केवल अंग्रेजी बोलता है।

निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि HybridPII उन कंपनियों के लिए एक शक्तिशाली उपकरण है जिन्हें अत्यधिक सुरक्षित रहने की आवश्यकता है। यह साबित करता है कि सख्त नियमों को स्मार्ट अनुमान के साथ मिलाकर, आप एक ऐसा सिस्टम बना सकते हैं जो लगभग हर गुप्त कोड को पकड़ सकता है (0.8324 रिकॉल) और इसे और भी सटीक बनाया जा सकता है (0.6519 F1-स्कोर), जो वर्तमान उद्योग लीडरों से बेहतर है। यह अभी तक कोई पूर्ण, हल की गई समस्या नहीं है, लेकिन यह डेटा को सुरक्षित रखने की दिशा में एक बहुत मजबूत कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →