← नवीनतम पेपर
🤖 AI

Vision Language Model Helps Private Information De-Identification in Vision Data

यह शोध पत्र VisShield को प्रस्तुत करता है, जो OPTIC डेटासेट और एक अनुकूलित प्रशिक्षण पद्धति से युक्त एक एंड-टू-एंड फ्रेमवर्क है, जो विजुअल डेटा में संवेदनशील टेक्स्ट को सटीक रूप से स्थानीयकृत और मास्क करने की विजन लैंग्वेज मॉडल्स की क्षमता को बढ़ाता है ताकि संरक्षित स्वास्थ्य जानकारी (PHI) जैसे अनदेखे गोपनीयता जोखिमों को संबोधित किया जा सके।

मूल लेखक: Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक ऐसा रोबोट है जो तस्वीरों को देखने और उनका वर्णन करने में अविश्वसनीय रूप से स्मार्ट है। यह एक सुपर-पावर्ड लाइब्रेरियन की तरह है जो फोटो के अंदर मौजूद टेक्स्ट को पढ़ सकता है और आपको उसकी कहानी बता सकता है। इस रोबोट को विज़न लैंग्वेज मॉडल (VLM) कहा जाता है।

हालाँकि, एक समस्या है। कभी-कभी, इन तस्वीरों में गुप्त व्यक्तिगत विवरण होते हैं—जैसे किसी मरीज़ का नाम, उनकी जन्मतिथि, या उनका सोशल सिक्योरिटी नंबर—जो फोटो के अंदर ही लिखे होते हैं (जैसे कि एक मेडिकल एक्स-रे जिस पर नाम का टैग लगा हो)। यदि हमारा सुपर-स्मार्ट रोबोट पूरी तस्वीर को पढ़ता है और सब कुछ ज़ोर से बोल देता है, तो वह अनजाने में इन रहस्यों को लीक कर देता है।

यह पेपर एक समाधान पेश करता है जिसे VisShield (विज़न प्राइवेसी शील्ड) कहा जाता है। VisShield को एक विशेष प्रशिक्षण कार्यक्रम के रूप में समझें जो रोबोट को केवल एक "कहानी सुनाने वाले" के बजाय एक "प्राइवेसी गार्ड" (गोपनीयता रक्षक) बनने के लिए सिखाता है।

यह कैसे काम करता है, इसे सरल चरणों में यहाँ समझाया गया है:

1. समस्या: रोबोट बहुत अधिक मददगार है

आमतौर पर, यदि आप रोबोट को नाम वाली एक तस्वीर दिखाते हैं, तो वह खुशी-खुशी कहेगा, "मुझे यहाँ एक नाम दिख रहा है: जॉन डो।" लेकिन वास्तविक दुनिया में, हम नहीं चाहते कि रोबोट उस नाम को साझा करे। मौजूदा उपकरण कठोर सुरक्षा गार्डों की तरह हैं; वे या तो पूरी तस्वीर को धुंधला करने की कोशिश करते हैं (जैसे चेहरे पर एक बड़ा धब्बा लगाना) या वे विशिष्ट शब्दों को खोजने में पूरी तरह विफल रहते हैं क्योंकि उन्हें विशेष रूप से उन शब्दों को देखने के लिए प्रशिक्षित नहीं किया गया था।

2. समाधान: रोबोट को एक नया खेल सिखाना

लेखकों ने दो मुख्य भागों वाला एक नया प्रशिक्षण सिस्टम बनाया है:

  • "प्राइवेसी रूलबुक" (The OPTIC Dataset):
    कल्पना कीजिए कि आप एक बच्चे को खेल खेलना सिखा रहे हैं। आप केवल यह नहीं कहते कि "सावधान रहो"; आप उसे एक नियम पुस्तिका देते हैं जिसमें हज़ारों उदाहरण होते हैं। लेखकों ने एक विशाल डिजिटल लाइब्रेरी बनाई है (5,0 करोड़ उदाहरणों वाली!) जिसे OPTIC कहा जाता है।

    • इस लाइब्रेरी में, उन्होंने हज़ारों रैंडम तस्वीरें लीं (जैसे सड़क के दृश्य या मेडिकल स्कैन) और उन पर डिजिटल रूप से नकली निजी जानकारी चिपका दी (जैसे नकली नाम, पते, या बीमारी के नाम)।
    • उन्होंने रोबोट के लिए विशिष्ट निर्देश लिखे, जैसे: "इस तस्वीर में, 'निजी जानकारी' का अर्थ केवल फोन नंबर है। उन्हें खोजें और मुझे ठीक से बताएं कि वे कहाँ हैं।"
    • महत्वपूर्ण बात यह है कि उन्होंने रोबोट को एक विशेष "मैजिक टोकन" (एक गुप्त कोड शब्द) का उपयोग करना सिखाया ताकि वह संकेत दे सके कि वह गुप्त जानकारी खोजने की प्रक्रिया शुरू करने वाला है।
  • "विशेष प्रशिक्षण" (Fine-Tuning):
    उन्होंने एक मौजूदा स्मार्ट रोबोट (Kosmos-2.5) लिया और उसे इस नई नियम पुस्तिका का क्रैश कोर्स दिया। केवल चित्र का वर्णन करने के बजाय, रोबोट ने एक स्पॉटर (खोजकर्ता) के रूप में कार्य करना सीखा।

    • जब आप इसे "निजी जानकारी" खोजने के लिए कहते हैं, तो यह केवल टेक्स्ट को पढ़ता नहीं है; यह गुप्त शब्दों (जैसे नाम या तारीख) के चारों ओर एक अदृश्य बॉक्स बनाता है और बाकी तस्वीर को अनदेखा कर देता है।

3. परिणाम: "प्राइवेसी शील्ड" का एक्शन में होना

प्रशिक्षण के बाद, रोबोट इस प्रकार काम करता है:

  1. आप इसे संवेदनशील टेक्स्ट वाली एक तस्वीर दिखाते हैं।
  2. आप इसे एक प्रॉम्प्ट देते हैं: "निजी जानकारी खोजो।"
  3. रोबोट अपने "स्पॉटिंग" कौशल का उपयोग करके गुप्त टेक्स्ट का पता लगाता है और उसके चारों ओर एक सटीक बॉक्स बनाता है।
  4. फिर एक कंप्यूटर उस बॉक्स को लेता है और उसे ढक देता है (मास्क कर देता है), जिससे बाकी की इमेज साफ़ रहती है।

यह विशेष क्यों है?

  • यह लचीला है: पुराने उपकरणों के विपरीत जो केवल चेहरे छिपाने के लिए जाने जाते हैं, यह रोबोट वह सब कुछ छिपा सकता है जिसे आप परिभाषित करें। आप कह सकते हैं, "आज, केवल सोशल सिक्योरिटी नंबर छिपाएं," या "केवल बीमारी के नाम छिपाएं," और रोबोट तुरंत नियम समझ जाता है।
  • यह सटीक है: यह केवल अनुमान नहीं लगाता; यह टेक्स्ट के सटीक स्थान को ढूंढता है, ताकि आप केवल गुप्त हिस्से को ही कवर कर सकें बिना पूरी फोटो को धुंधला किए।
  • यह मजबूत है: लेखकों ने विभिन्न प्रकार की तस्वीरों, जैसे शहर की सड़कों से लेकर मेडिकल स्कैन और यहाँ तक कि हस्तलिखित नोट्स पर भी इसका परीक्षण किया। रोबोट सटीक बना रहा, जिससे साबित हुआ कि इसने गोपनीयता के सिद्धांत को सीखा है, न कि केवल विशिष्ट चित्रों को रटा है।

संक्षेप में, VisShield एक स्मार्ट इमेज-रीडिंग रोबोट को एक गोपनीयता-सचेत सहायक में बदल देता है जो जानता है कि संवेदनशील टेक्स्ट को कैसे ढूँढा जाए और कैसे छिपाया जाए, जिससे यह सुनिश्चित होता है कि जब हम विज़ुअल डेटा साझा करते हैं, तो हमारे रहस्य सुरक्षित रहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →