← नवीनतम पेपर
🤖 AI

GLiNER2-PII: A Multilingual Model for Personally Identifiable Information Extraction

यह शोध पत्र GLiNER2-PII को प्रस्तुत करता है, जो एक संक्षिप्त बहुभाषी मॉडल है जिसे विविध भाषाओं और प्रारूपों में व्यक्तिगत रूप से पहचान योग्य सूचना (PII) के 42 प्रकारों को प्रभावी ढंग से पहचानने के लिए एक सिंथेटिक कॉर्पस पर प्रशिक्षित किया गया है, और इसने SPY बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया है।

मूल लेखक: Urchade Zaratiana, Ash Lewis, George Hurn-Maloney

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Urchade Zaratiana, Ash Lewis, George Hurn-Maloney

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जो अपने पाठकों की गोपनीयता की रक्षा करने की कोशिश कर रहे हैं। हर दिन, हजारों किताबें, पत्र और नोट्स आते हैं। कुछ में संवेदनशील रहस्य जैसे घर के पते, फोन नंबर या पासवर्ड होते हैं। आपका काम इन रहस्यों को ढूंढना और किसी और के देखने से पहले उन्हें काले मार्कर से छिपा देना है।

यह PII (पर्सनली आइडेंटिफ़िएबल इन्फॉर्मेशन - व्यक्तिगत रूप से पहचान योग्य जानकारी) डिटेक्शन की चुनौती है। यह कठिन है क्योंकि रहस्य अलग-अलग आकार और प्रकार के होते हैं, जो बिखरे हुए, शोर-शराबे वाले टेक्स्ट के भीतर छिपे होते हैं, और वे इस बात पर निर्भर करते हैं कि वे किस देश की किताब से आए हैं।

यहाँ यह पेपर GLiNER2-PII का परिचय देता है, जो इस समस्या को हल करने के लिए डिज़ाइन किया गया एक नया टूल है।

1. समस्या: घास के ढेर में सुई ढूंढना

लेखक बताते हैं कि निजी जानकारी ढूंढना पेचीदा है। एक देश में फोन नंबर दूसरे देश से अलग दिखता है। एक नाम किसी ऐसे वाक्य के अंदर छिपा हो सकता है जिसमें प्रसिद्ध अभिनेता "जॉन स्मिथ" के बारे में भी बात की गई हो। यदि आप कोई रहस्य चूक जाते हैं, तो आप कानून (जैसे GDPR) का उल्लंघन करते हैं। यदि आप बहुत अधिक चीज़ों को छिपा देते हैं, तो आप टेक्स्ट की उपयोगिता को खराब कर देते हैं (जैसे केवल एक नाम छिपाने के लिए पूरे वाक्य को ही छिपा देना)।

2. समाधान: एक सुपर-स्मार्ट "स्पॉटर"

टीम ने एक नया AI मॉडल बनाया है जिसे GLiNER2-PII कहा जाता है। इस मॉडल को एक अत्यधिक प्रशिक्षित जासूस के रूप में समझें जो केवल सामान्य रूप से "नामों" या "नंबरों" को नहीं देखता है। इसके बजाय, इस जासूस के पास खोजने के लिए 42 अलग-अलग प्रकार के रहस्यों की एक बहुत विशिष्ट सूची है।

  • टूलकिट: यह मॉडल व्यक्ति का पूरा नाम, ईमेल और पासपोर्ट नंबर से लेकर, क्रेडिट कार्ड के CVV कोड, पासवर्ड या यहां तक कि एक विशिष्ट प्रकार की तारीख (जैसे समाप्ति तिथि) जैसी विशिष्ट चीजों को भी पहचान सकता है।
  • लचीलापन: पुराने टूल्स के विपरीत जो कठोर होते हैं (जैसे एक चाबी जो केवल एक ताले में फिट होती है), यह मॉडल लचीला है। आप इसे बता सकते हैं, "आज, मुझे केवल ईमेल और फोन नंबर की परवाह है," या "आज, मुझे सब कुछ ढूंढना है," और यह बिना दोबारा बनाए तुरंत अनुकूलित हो जाता है।

3. प्रशिक्षण की दुविधा: गोपनीयता भंग किए बिना कैसे सिखाएं

सबसे बड़ी बाधा यहाँ है: आप एक जासूस को असली लोगों के निजी डेटा को दिखाकर रहस्य ढूंढना नहीं सिखा सकते। वह गोपनीयता का एक बड़ा संकट होगा। लेकिन यदि आप उन्हें पर्याप्त उदाहरण नहीं दिखाते हैं, तो वे सीखेंगे नहीं।

पेपर का रचनात्मक समाधान:
असली रहस्यों के बजाय, टीम ने एक सिंथेटिक (नकली) ट्रेनिंग फैक्ट्री बनाई।

  • उन्होंने हजारों नकली कहानियाँ, सपोर्ट टिकट और मेडिकल नोट्स लिखने के लिए एक परिष्कृत "रेसिपी जनरेटर" (Pioneer Agent नामक सिस्टम पर आधारित) का उपयोग किया।
  • ये नकली कहानियाँ सात अलग-अलग भाषाओं (अंग्रेजी, फ्रेंच, स्पेनिश आदि) में लिखी गई थीं और उनमें वास्तविक दिखने वाले लेकिन पूरी तरह से काल्पनिक रहस्य शामिल थे।
  • AI ने इन नकली कहानियों में पैटर्न को पहचानना सीखा, जिससे प्रभावी रूप से वास्तविक दुनिया के "सिमुलेशन" पर उसका प्रशिक्षण हुआ।

4. परीक्षण: "SPY" बेंचमार्क

यह देखने के लिए कि उनका जासूस कितना अच्छा था, उन्होंने इसे SPY (सिंथेटिक PII यस्टरडे) नामक एक कठिन परीक्षा के विरुद्ध परखा। इस परीक्षा में कानूनी मंचों और मेडिकल ट्रांसक्रिप्ट से वास्तविक टेक्स्ट का उपयोग किया गया था जिसे मॉडल ने पहले कभी नहीं देखा था।

उन्होंने GLiNER2-PII की तुलना चार अन्य प्रसिद्ध "जासूसों" (OpenAI और NVIDIA सहित अन्य) के साथ की।

परिणाम:

  • विजेता: GLiNER2-PII ने परीक्षा जीती, और सही रहस्यों को खोजने के लिए उच्चतम स्कोर प्राप्त किया।
  • रणनीति: पेपर नोट करता है कि गोपनीयता के काम में, एक "सुरक्षा-प्रथम" जासूस होना बेहतर है। किसी रहस्य को चूक जाने (उसे खुला छोड़ने) से बेहतर है कि गलती से किसी हानिरहित शब्द को छिपा दिया जाए। GLiNER2-PII रिकॉल (Recall) में उत्कृष्ट था—जिसका अर्थ है कि इसने लगभग सभी रहस्यों को खोजा, भले ही यह कुछ अन्य मॉडलों की तुलना में थोड़ा अधिक सतर्क रहा हो।

5. कमी (सीमाएं)

लेखक इस टूल की वर्तमान सीमाओं के बारे में ईमानदार हैं:

  • यह थोड़ा अधिक उत्सुक है: कभी-कभी, मॉडल नामों को खोजने में इतना अच्छा हो जाता है कि वह एक सामान्य संज्ञा (जैसे फल वाला "Apple") को किसी व्यक्ति के नाम के रूप में समझ लेता है। इसे पूरी तरह से सटीक होने के लिए थोड़े और फाइन-ट्यूनिंग की आवश्यकता है।
  • यह एक सिमुलेशन है: मॉडल को पूरी तरह से कंप्यूटर द्वारा उत्पन्न नकली डेटा पर प्रशिक्षित किया गया था। हालांकि इसने वास्तविक टेक्स्ट पर अद्भुत प्रदर्शन किया, लेकिन अभी तक इसकी मानव एनोटेटरों द्वारा जांच नहीं की गई है।

सारांश

यह पेपर GLiNER2-PII को एक नए, ओपन-सोर्स टूल के रूप में प्रस्तुत करता है जो 42 विशिष्ट प्रकार के रहस्यों की एक विशाल लाइब्रेरी का उपयोग करता है और टेक्स्ट में निजी जानकारी को खोजने और छिपाने में सर्वश्रेष्ठ बनने के लिए कंप्यूटर-जनरेटेड नकली डेटा से सीखता है। इसने साबित किया है कि आप किसी भी वास्तविक व्यक्ति के निजी डेटा को छुए बिना एक शक्तिशाली गोपनीयता टूल को प्रशिक्षित कर सकते हैं, और यह वर्तमान में उन छिपे हुए रहस्यों को खोजने में अन्य प्रमुख प्रणालियों से बेहतर प्रदर्शन कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →