← नवीनतम पेपर
💬 NLP

MultiGraSCCo: A Multilingual Anonymization Benchmark with Annotations of Personal Identifiers

यह शोध पत्र MultiGraSCCo को प्रस्तुत करता है, जो दस भाषाओं में 2,500 से अधिक एनोटेटेड व्यक्तिगत पहचानकर्ताओं वाला एक बहुभाषी बेंचमार्क है, जिसे सिंथेटिक डेटा के सांस्कृतिक रूप से अनुकूलित मशीन अनुवाद का उपयोग करके बनाया गया था ताकि वास्तविक रोगी डेटा से जुड़े गोपनीयता नियमों को दरकिनार करते हुए अनामीकरण प्रणालियों के विकास और मूल्यांकन को सुगम बनाया जा सके।

मूल लेखक: Ibrahim Baroud, Christoph Otto, Vera Czehmann, Christine Hovhannisyan, Lisa Raithel, Sebastian Möller, Roland Roller

प्रकाशित 2026-03-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ibrahim Baroud, Christoph Otto, Vera Czehmann, Christine Hovhannisyan, Lisa Raithel, Sebastian Möller, Roland Roller

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डॉक्टर हैं जो एक कंप्यूटर को यह सिखाने की कोशिश कर रहे हैं कि मेडिकल रिपोर्ट में मरीज का नाम, पता या जन्मदिन कैसे पहचाना जाए, ताकि वह फाइल को शोधकर्ताओं के साथ साझा करने से पहले उसे छिपा सके। यह गोपनीयता के लिए अत्यंत महत्वपूर्ण है, लेकिन एक बहुत बड़ी समस्या है: अस्पताल वास्तविक रोगी डेटा साझा करने से डरते हैं क्योंकि गोपनीयता के सख्त कानून हैं। यह बिल्कुल वैसा ही है जैसे आप किसी को असली फेरारी का उपयोग करके गाड़ी चलाना सिखाने की कोशिश कर रहे हों, लेकिन मालिक आपको उसे छूने तक नहीं देने देता।

यह पेपर MultiGraSCCo पेश करता है, जो इस "डेटा की कमी" की समस्या का एक चतुर समाधान है। उन्होंने इसे सरल भाषा में इस प्रकार किया है:

1. समस्या: "खाली क्लासरूम"

एक अच्छा गोपनीयता गार्ड (एक AI जो नाम छुपाता है) बनाने के लिए, आपको उदाहरणों से भरे एक क्लासरूम की आवश्यकता होती है। लेकिन वास्तविक दुनिया में, वे क्लासरूम खाली हैं क्योंकि वास्तविक रोगी डेटा सुरक्षित रखा गया है।

  • पुराना तरीका: शोधकर्ताओं के पास आमतौर पर केवल अंग्रेजी में डेटा होता था। यदि आप जर्मन, रूसी या अरबी के लिए गोपनीयता गार्ड बनाना चाहते थे, तो आपके पास सीखने के लिए कुछ भी नहीं था।
  • जोखिम: यदि आप केवल अंग्रेजी डेटा का दूसरी भाषाओं में अनुवाद करते हैं, तो नाम और स्थान अजीब लग सकते हैं (जैसे "John Smith" का सीधे ऐसे जर्मन नाम में अनुवाद करना जो अस्तित्व में ही न हो)। यह AI को भ्रमित कर देता है।

2. समाधान: "जादुई अनुवादक"

लेखकों ने 10 अलग-अलग भाषाओं (जर्मन, अंग्रेजी, अरबी, रूसी, तुर्की और अन्य सहित) में नकली (सिंथेटिक) रोगी डेटा के साथ एक बहुभाषी खेल का मैदान (multilingual playground) बनाया।

यहाँ उनकी चरण-दर-चरण विधि दी गई है:

  • चरण 1: स्रोत सामग्री। उन्होंने GraSCCo नामक एक जर्मन डेटासेट से शुरुआत की। यह पहले से ही नकली डेटा है (जैसे किसी मेडिकल ड्रामा की स्क्रिप्ट), इसलिए इसमें किसी वास्तविक व्यक्ति को कोई नुकसान नहीं पहुँचा है।
  • चरण 2: "छिपे हुए खजाने" की खोज। उन्होंने केवल स्पष्ट पहचानकर्ताओं (Direct Identifiers) की तलाश नहीं की। उन्होंने परोक्ष पहचानकर्ताओं (Indirect Identifiers) की भी खोज की।
    • उपमा: कल्पना कीजिए कि एक जासूस संदिग्ध की तलाश कर रहा है। नाम तो स्पष्ट है। लेकिन क्या होगा यदि वह संदिग्ध एकमात्र 80 वर्षीय पुरुष है जो वॉयलिन बजाता है और एक विशिष्ट छोटे शहर में रहता है? नाम के बिना भी, यह संयोजन उसकी पहचान उजागर कर सकता है। लेखकों ने AI को इन सूक्ष्म संकेतों (जैसे शौक, पारिवारिक इतिहास, या विशिष्ट तिथियां) को पहचानने के लिए प्रशिक्षित किया जो अनजाने में मरीज की पहचान प्रकट कर सकते हैं।
  • चरण 3: सांस्कृतिक छलावरण (Cultural Chameleon)। उन्होंने एक शक्तिशाली AI (GPT-4.1) का उपयोग जर्मन टेक्स्ट को 9 अन्य भाषाओं में अनुवाद करने के लिए किया। लेकिन उन्होंने इसे एक विशेष नियम दिया: "केवल अनुवाद न करें; अनुकूलित करें!"
    • जादू: यदि जर्मन टेक्स्ट में कहता है कि एक मरीज "Musterstadt" (एक नकली जर्मन शहर) में रहता है, तो AI केवल शब्द का अनुवाद नहीं करता है। यह उसे लक्षित देश के वास्तविक लगने वाले शहर (जैसे फ्रांसीसी के लिए "Toulouse" या तुर्की के लिए "Istanbul") से बदल देता है। यह नामों, तारीखों और सड़क के नामों को स्थानीय संस्कृति के अनुरूप बदलने के लिए नाम, तारीख और सड़क के नामों को बदल देता है।
    • क्यों? यह सुनिश्चित करने के लिए कि AI केवल विशिष्ट जर्मंड शब्दों को नहीं, बल्कि गोपनीयता के पैटर्न को पहचानना सीखे।

3. गुणवत्ता जांच: "मानवीय स्वाद परीक्षण" (Human Taste Test)

आप केवल एक रोबोट पर चिकित्सा डेटा को पूरी तरह से अनुवाद करने के लिए भरोसा नहीं कर सकते। लेखकों ने उन वास्तविक डॉक्टरों और मेडिकल छात्रों को काम पर रखा जो जर्मन और लक्षित भाषा दोनों बोल सकते थे ताकि अनुवाद को ग्रेड दिया जा सके।

  • उन्होंने पूछा: "क्या यह आपके देश में एक वास्तविक मेडिकल रिपोर्ट जैसा लगता है?"
  • "क्या AI ने नामों को स्थानीय लगने के लिए बदल दिया?"
  • परिणाम: अनुवादों ने बहुत उच्च स्कोर प्राप्त किया (7 में से लगभग 6.3)। डॉक्टरों ने पुष्टि की कि AI ने सफलतापूर्वक नकली डेटा को प्रत्येक संस्कृति के लिए "नेटिव" महसूस कराया।

4. प्रयोग: AI गार्ड्स को प्रशिक्षित करना

उन्होंने इस नए 10-भाषा वाले डेटासेट का उपयोग गोपनीयता संबंधी जानकारी को खोजने और छिपाने के लिए AI मॉडल को प्रशिक्षित करने के लिए किया। उन्होंने तीन परिदृश्यों का परीक्षण किया:

  1. मोनोलिंगुअल (Monolingual): फ्रांसीसी डेटा पर केवल एक AI को प्रशिक्षित करना ताकि वह फ्रांसीसी रहस्यों को खोज सके। (यह अच्छी तरह काम करता है)।
  2. जीरो-शॉट (Zero-Shot): केवल जर्मन डेटा पर एक AI को प्रशिक्षित करना और फिर उसे बिना किसी रूसी प्रशिक्षण के रूसी में रहस्य खोजने के लिए कहना। (इसे थोड़ा संघर्ष करना पड़ा, जैसे एक जर्मन भाषी रूसी व्याकरण का अनुमान लगाने की कोशिश कर रहा हो)।
  3. मल्टीलिंगुअल (Multilingual): जर्मन के साथ-साथ थोड़े से रूसी डेटा पर AI को प्रशिक्षित करना।
    • बड़ी जीत: यहाँ तक कि स्थानीय डेटा की एक बहुत छोटी मात्रा (उपलब्ध टेक्स्ट का केवल 25%) जोड़ने से भी AI उस भाषा में रहस्यों को पकड़ने में काफी बेहतर हो गया। यह एक छात्र को विदेशी भाषा की पाठ्यपुस्तक पढ़ने के बाद अपनी मातृभाषा में कुछ अभ्यास समस्याओं को हल करने के बाद मिलने जैसा है; अचानक, सब कुछ समझ में आने लगता है।

यह क्यों मायने रखता है?

MultiGraSCCo को एक सार्वभौमिक प्रशिक्षण नियमावली (universal training manual) के रूप में सोचें।

  • शोधकर्ताओं के लिए: यह उन्हें वास्तविक रोगी डेटा की आवश्यकता के बिना गोपनीयता उपकरण बनाने का अभ्यास करने का एक सुरक्षित, कानूनी तरीका देता है।
  • कम संसाधन वाली भाषाओं के लिए: यह उन देशों को डिजिटल संसाधनों में पीछे रहने वाली भाषाओं (जैसे यूक्रेनी या फारसी) को गोपनीयता तकनीक में आगे बढ़ने में मदद करता है, क्योंकि अब वे इस उच्च-गुणता वाले, सांस्कृतिक रूप से अनुकूलित डेटा का उपयोग कर सकते हैं।
  • सभी के लिए: यह अनुसंधान के लिए चिकित्सा डेटा साझा करना सुरक्षित बनाता है, जिससे बेहतर उपचार और इलाज की खोज की ओर प्रगति हो सकती है, बिना किसी की गोपनीयता का उल्लंघन किए।

संक्षेप में: लेखकों ने एक "नकली लेकिन वास्तविक" बहुभाषी चिकित्सा पुस्तकालय बनाया, एक AI को इसे सांस्कृतिक रूप से पूर्ण बनाने के लिए प्रशिक्षित किया, और सिद्ध किया कि यह पुस्तकालय पूरी दुनिया के लिए बेहतर गोपनीयता गार्ड बनाने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →