← नवीनतम पेपर
💬 NLP

Detecting Sensitive Personal Information in Japanese Pre-Training Corpora for Large Language Models

यह अध्ययन एलएलएम-आधारित एनोटेशन के माध्यम से एक डेटासेट का निर्माण करके और गोपनीयता अनुपालन सुनिश्चित करने के लिए एक मशीन लर्निंग क्लासिफायर को प्रशिक्षित करके, जापानी प्री-ट्रेनिंग कॉर्पोरा में संवेदनशील व्यक्तिगत जानकारी, विशेष रूप से जापान की "विशेष देखभाल-आवश्यक व्यक्तिगत जानकारी" (SCPI) का पता लगाने के लिए पहला दृष्टिकोण प्रस्तुत करता है।

मूल लेखक: Rei Minamoto, Yusuke Oda, Daisuke Kawahara

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rei Minamoto, Yusuke Oda, Daisuke Kawahara

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) बना रहे हैं, जिसे इंटरनेट की हर किताब, लेख और वेबपेज खिलाकर तैयार किया जा रहा है। यह एक स्विमिंग पूल को गहरा करने के लिए उसमें पानी की एक विशाल बाल्टी डालने जैसा है। लेकिन यहाँ एक समस्या है—उस पानी की बाल्टी में गलती से कुछ बहुत ही निजी और संवेदनशील चीजें भी आ सकती हैं, जैसे किसी का मेडिकल रिकॉर्ड, आपराधिक इतिहास, या उनकी विकलांगता का विवरण। यदि रोबोट मस्तिष्क इन चीजों को याद कर लेता है, तो वह बाद में अनजाने में इन्हें बाहर निकाल सकता है, जो गोपनीयता का एक बड़ा उल्लंघन होगा।

जापान में, एक विशिष्ट कानून है जिसे APPI कहा जाता है, जो कहता है कि कुछ प्रकार की जानकारी के लिए "विशेष देखभाल" की आवश्यकता होती है। शोधकर्ता इसे SCPI (स्पेशल केयर-रिक्वायर्ड पर्सनल इंफॉर्मेशन) कहते हैं। SCPI को उस "नाजुक, टूटने वाले कांच" की तरह समझें जो आपकी पानी की बाल्टी में हो सकता है और जिसे आपको रोबोट के पानी पीने से पहले अनिवार्य रूप से छानकर बाहर निकालना होगा।

यहाँ इस शोध पत्र में क्या किया गया है, इसका सरल विवरण दिया गया है:

1. समस्या: जापानी "कांच" के लिए कोई मानचित्र नहीं था

जबकि अंग्रेजी बोलने वाले देशों के शोधकर्ताओं ने अपने डेटा से इस "कांच" (संवेदनशील जानकारी) को खोजने और हटाने के उपकरण बनाए हैं, जापानी टेक्स्ट के लिए अभी तक कोई वास्तविक मानचित्र नहीं बनाया गया था। इसके अलावा, क्योंकि यह डेटा इतना निजी है, आप कंप्यूटर को प्रशिक्षित करने के लिए उदाहरणों की कोई बनी-बनाई सूची सीधे नहीं खरीद सकते। आपको अपनी सूची शून्य से बनानी होगी, जो काफी कठिन है क्योंकि आपको इसे बनाते समय कानून का उल्लंघन न करने के लिए बहुत सावधान रहना पड़ता है।

2. समाधान: एक दो-चरणीय "छलनी" प्रणाली

टीम ने जापानी टेक्स्ट में इस संवेदनशील जानकारी को खोजने के लिए एक नई प्रणाली बनाई। उन्होंने दो अलग-अलग आकार की जाली वाले मछली पकड़ने के जाल की तरह एक चतुर दो-चरणीय प्रक्रिया का उपयोग किया:

  • चरण 1: बड़ी जाली (नाम खोजना): सबसे पहले, उन्होंने एक कंप्यूटर प्रोग्राम का उपयोग करके किसी भी ऐसे टेक्स्ट को खोजा जिसमें किसी व्यक्ति का नाम उल्लेखित था। क्यों? क्योंकि जापानी वेब डेटा में, अधिकांश निजी जानकारी एक नाम से जुड़ी होती है। यदि कोई नाम नहीं है, तो उसे फिलहाल के लिए सुरक्षित मानकर अनदेखा किया जा सकता है। इसने टेक्स्ट के विशाल ढेर को एक प्रबंधनीय आकार में सीमित कर दिया।
  • चरण 2: महीन जाली (स्मार्ट फिल्टर): इसके बाद, उन्होंने एक बहुत ही स्मार्ट, उच्च-शक्ति वाले AI (एक "हाई-परफॉर्मेंस LLM") का उपयोग किया जो उन विशिष्ट टेक्स्ट को पढ़ सके और तय कर सके: "क्या यह संवेदनशील है?"
    • पेंच: सुपर-स्मार्ट AI लाखों टेक्स्ट पर काम करने के लिए बहुत धीमा और महंगा है। इसलिए, उन्होंने इसका उपयोग केवल एक "गोल्ड स्टैंडर्ड" प्रशिक्षण सेट बनाने के लिए किया।
    • परिणाम: उन्होंने इस छोटे, सटीक उदाहरणों के सेट का उपयोग एक हल्के, तेज़ मशीन लर्निंग मॉडल को प्रशिक्षित करने के लिए किया। इसे एक तेज़, सस्ते रोबोट कुत्ते को "कांच" को सूंघने के लिए प्रशिक्षित करने जैसा समझें, ताकि आपको पूरे काम के लिए उस महंगे, धीमे रोबोट मस्तिष्क का उपयोग न करना पड़े।

3. प्रशिक्षण डेटा: उन्हें क्या मिला?

उन्होंने लगभग 1,000 उदाहरणों का एक डेटासेट बनाया जो "संवेदनशील" जापानी टेक्स्ट के थे। उन्होंने तीन मुख्य श्रेणियों पर ध्यान केंद्रित किया जो खोजने में आसान थीं:

  • मेडिकल हिस्ट्री: (जैसे, "उसे कैंसर है।")
  • अपराध: (जैसे, "उसे चोरी के लिए गिरफ्तार किया गया था।")
  • विकलांगता: (जैसे, "वह व्हीलचेयर का उपयोग करती है।")

उन्होंने यौन अभिविन्यास (sexual orientation) या लैंगिक पहचान (gender identity) जैसे पेचीदा मामलों को भी पाया, जिन्हें उन्होंने अपने अध्ययन के लिए "LGBT" के रूप में लेबल किया, भले ही कानून ने उन्हें स्पष्ट रूप से इस तरह से सूचीबद्ध नहीं किया था।

4. परिणाम: गति बनाम सटीकता

उन्होंने अपने नए "रोबोट कुत्ते" (तेज़ मॉडल) का परीक्षण "सुपर-स्मार्ट AI" और अन्य तरीकों के मुकाबले किया।

  • सटीकता: तेज़ मॉडल संवेदनशील जानकारी के विषय (जैसे, यह जानना कि टेक्स्ट "मेडिकल हिस्ट्री" के बारे में है) को पहचानने में आश्चर्यजनक रूप से अच्छे थे। हालांकि, उन्हें "किसी बीमारी के बारे में बात करने" (सामान्य जानकारी) और "किसी विशिष्ट रोगी की बीमारी प्रकट करने" (SCPI) के बीच अंतर करने में कभी-कभी कठिनाई हुई।
  • गति: यहीं पर तेज़ मॉडलों ने बाजी मारी। सुपर-स्मार्ट AI को एक विशाल लाइब्रेरी को स्कैन करने में एक महीने से अधिक का समय लग सकता था। तेज़ मॉडल इसे एक दिन से भी कम समय में कर सकते थे। यह एक घोंघे और एक रेस कार के बीच के अंतर जैसा है।

5. "भ्रम" और भविष्य की योजनाएं

शोधकर्ताओं ने देखा कि उनके तेज़ मॉडल कभी-कभी "मेडिकल हिस्ट्री" और "विकलांगता" के बीच भ्रमित हो जाते थे क्योंकि ये विषय अक्सर एक साथ आते हैं (जैसे, एक विकलांग व्यक्ति के चिकित्सा उपचार के बारे में कहानी)।

उन्होंने निष्कर्ष निकाला:

  • आप पूरे इंटरनेट को स्कैन करने के लिए सुपर-स्मार्ट AI का उपयोग नहीं कर सकते; यह बहुत धीमा है।
  • आप तेज़, सस्ते मॉडलों का उपयोग "रफ पास" (एक प्रारंभिक छंटनी) के लिए कर सकते हैं और अधिकांश संवेदनशील विषयों को पकड़ सकते हैं।
  • यदि आपको 100% पूर्णता की आवश्यकता है, तो आप पहले तेज़ मॉडल का उपयोग सुरक्षित चीजों को बाहर निकालने के लिए कर सकते हैं, और फिर केवल उस छोटे ढेर पर सुपर-स्मार्ट AI का उपयोग कर सकते हैं जो "शायद संवेदनशील" हो सकता है।

नैतिकता पर महत्वपूर्ण नोट:
शोधकर्ता बहुत सावधान रहे। उन्होंने जो संवेदनशील डेटा उन्हें मिला, उसे प्रकाशित नहीं किया। उन्होंने केवल टूल (क्लासिफायर) और विधि को प्रकाशित किया। उन्होंने यह भी नोट किया कि हालांकि उनका टूल गोपनीयता की रक्षा करने में मदद करता है, लेकिन सैद्धांतिक रूप से इसका दुरुपयोग बुरे तत्वों द्वारा निजी जानकारी खोजने के लिए किया जा सकता है, इसलिए वे अपने काम को जारी करने के संबंध में बहुत सतर्क हैं।

संक्षेप में: उन्होंने जापानी टेक्स्ट के लिए पहला विशेष "मेटल डिटेक्टर" बनाया जो निजी, संवेदनशील जानकारी को ढूंढता है। यह तेज़, सस्ता और पर्याप्त रूप से अच्छा है ताकि भविष्य के AI रोबोट्स को प्रशिक्षित करने के लिए आवश्यक विशाल डेटा लेक को साफ किया जा सके, जिससे यह सुनिश्चित हो सके कि वे रोबोट अनजाने में लोगों के रहस्य उजागर न करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →