← नवीनतम पेपर
🤖 AI

WebPII: Benchmarking Visual PII Detection for Computer-Use Agents

यह शोधपत्र WebPII का परिचय देता है, जो एक बड़े पैमाने का सिंथेटिक बेंचमार्क और एक रियल-टाइम डिटेक्शन मॉडल (WebRedact) है, जिसे कंप्यूटर-यूज़ एजेंटों के महत्वपूर्ण गोपनीयता जोखिमों को संबोधित करने के लिए वेब स्क्रीनशॉट में व्यक्तिगत रूप से पहचान योग्य जानकारी (PII) का सूक्ष्म-स्तरीय, लेआउट-अपरिवर्तनीय पता लगाने में सक्षम बनाने के लिए डिज़ाइन किया गया है।

मूल लेखक: Nathan Zhao

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nathan Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, मददगार रोबोट सहायक है जो आपकी कंप्यूटर स्क्रीन देख सकता है, बटन दबा सकता है और आपके लिए फॉर्म भर सकता है। यह एक व्यक्तिगत सचिव की तरह है जो कभी सोता नहीं है। लेकिन इसमें एक पेंच है: अपना काम करने के लिए, इस रोबोट को आपकी स्क्रीन के "स्क्रीनशॉट" लेने होते हैं और अगला कदम उठाने के लिए उन्हें एक विशाल क्लाउड ब्रेन (cloud brain) को भेजना होता है।

समस्या क्या है? आपकी स्क्रीन रहस्यों से भरी है: आपका घर का पता, आपका क्रेडिट कार्ड नंबर, आपका नाम और यहाँ तक कि आपकी खरीदारी की आदतें भी। यदि आपका रोबट आपके बैंक खाते या चेकआउट पेज का स्क्रीनशॉट क्लाउड को भेज देता है, तो यह किसी अजनबी को आपका बटुआ दिखाकर यह कहने जैसा है, "लीजिए, इसे समझने में मदद करें कि भुगतान कैसे करना है।"

यह पेपर इस समस्या का समाधान पेश करता है, जिसे तीन मुख्य भागों में बनाया गया है: एक प्रशिक्षण मैदान (training ground), एक सुरक्षा गार्ड, और सोचने का एक नया तरीका

1. प्रशिक्षण मैदान: "नकली मॉल" (WEBPII)

कंप्यूटर को यह सिखाने के लिए कि वह रहस्यों को कैसे पहचाने, आपको उसे उदाहरण दिखाने होंगे। लेकिन आप AI को प्रशिक्षित करने के लिए वास्तविक लोगों के निजी डेटा की तस्वीरें नहीं ले सकते; यह गोपनीयता का एक बड़ा संकट होगा।

इसलिए, शोधकर्ताओं ने WEBPII बनाया, जो एक विशाल, अति-यथार्थवादी नकली शॉपिंग मॉल की तरह है।

  • सेटअप: उन्होंने उन्नत AI का उपयोग करके वास्तविक शॉपिंग वेबसाइटों (जैसे Amazon या Walmart) को देखा और उन्हें कोड का उपयोग करके फिर से बनाया। यह एक वास्तुकार (architect) की तरह है जो एक असली घर को देखता है और लेगो ब्रिक्स (Lego bricks) से उसकी एक सटीक नकल बनाता है।
  • ट्विस्ट: असली लोगों के नाम के बजाय, उन्होंने इन लेगो घरों में हजारों नकली नाम, पते और क्रेडिट कार्ड नंबर डाले।
  • जादू: क्योंकि उन्होंने घरों को कोड से बनाया है, वे जानते हैं कि हर एक गुप्त जानकारी कहाँ स्थित है। वे बिना किसी इमेज को मैन्युअल रूप से देखे, हर रहस्य के चारों ओर एक सटीक बॉक्स बना सकते हैं।
  • "पूर्वानुमानित" (Anticipatory) विशेषता: अधिकांश सुरक्षा प्रणालियाँ तब तक प्रतीक्षा करती हैं जब तक आप अपना पासवर्ड टाइप करना समाप्त न कर दें और फिर कहती हैं, "ओह, यह एक रहस्य है!" यह नई प्रणाली एक ऐसे गार्ड की तरह है जो देखता है कि आप टाइप करना शुरू कर रहे हैं और तुरंत कहता है, "रुको! तुम कुछ संवेदनशील प्रकट करने वाले हो!" यह AI को रहस्य टाइप होने के बाद नहीं, बल्कि टाइप करते समय ही पकड़ने के लिए प्रशिक्षित करता है।

2. सुरक्षा गार्ड: "WEBREDACT"

एक बार जब उन्होंने यह नकली मॉल बना लिया, तो उन्होंने WEBREDACT नामक एक नया सुरक्षा गार्ड प्रशिक्षित किया।

  • पुराना तरीका: पिछले सुरक्षा गार्ड पहले स्क्रीन पर मौजूद टेक्स्ट को पढ़ने की कोशिश करते थे (जैसे किताब पढ़ने के लिए स्कैनर का उपयोग करना) और फिर तय करते थे कि यह एक रहस्य है या नहीं। यह धीमा, अनाड़ी था, और अक्सर उन चीजों को भी छोड़ देता था जो टेक्स्ट की तरह दिखती थीं लेकिन वास्तव में एक तस्वीर या बटन का हिस्सा थीं।
  • नया तरीका: WEBREDACT एक्स-रे विजन (X-ray vision) वाले गार्ड की तरह है। यह सीधे इमेज को देखता है। इसे शब्दों को पहले पढ़ने की आवश्यकता नहीं है; यह बस क्रेडिट कार्ड बॉक्स के आकार या शिपिंग पते के लेआउट को देखता है और तुरंत समझ जाता है, "यह एक रहस्य है, इसे ढक दो!"
  • परिणाम: यह अविश्वसनीय रूप से तेज़ है। यह एक स्क्रीन को देख सकता है और 20 मिलीसेकंड (इतनी तेज़ी से कि एक इंसान पलक भी नहीं झपका पाता) में रहस्यों को ढूंढ सकता है। यह इतना अच्छा है कि इसने पुराने टेक्स्ट-स्कैनिंग तरीकों की तुलना में दोगुनी बार अधिक रहस्य खोजे।

3. "विस्तारित" (Extended) रहस्य

शोधकर्ताओं ने महसूस किया कि रहस्य केवल नाम और पते तक सीमित नहीं हैं।

  • उपमा: कल्पना कीजिए कि आप एक रसीद खो देते हैं। इसमें आपका नाम नहीं है, लेकिन इसमें आपका ऑर्डर नंबर, तारीख और वह स्टोर है जहाँ आप गए थे। यदि किसी के पास ऐसी कई रसीदें हों, तो वे पता लगा सकते हैं कि आप कौन हैं।
  • नवाचार: WEBPII इस AI को इन "अप्रत्यक्ष" रहस्यों को भी पहचानने के लिए प्रशिक्षित करता है। यह ऑर्डर नंबर, ट्रैकिंग आईडी और डिलीवरी की तारीखों को संवेदनशील मानकर फ्लैग करता है, क्योंकि गलत हाथों में, इन छोटी जानकारियों का उपयोग आपकी पहचान उजागर करने के लिए किया जा सकता है।

यह क्यों मायने रखता है?

अभी, जैसे-जैसे हम अपने खरीदारी और बैंकिंग के लिए AI एजेंटों का उपयोग करना शुरू कर रहे हैं, हम अनिवार्य रूप से अपने निजी जीवन को क्लाउड को सौंप रहे हैं। यह पेपर आपके अपने डिवाइस पर ही एक प्राइवेसी शील्ड (privacy shield) बनाने के उपकरण प्रदान करता है।

अपनी निजी स्क्रीनशॉट को विश्लेषण के लिए क्लाउड सर्वर पर भेजने के बजाय, आपका कंप्यूटर संवेदनशील हिस्सों को धुंधला (blur) करने के लिए इस हल्के-फुल्के "सुरक्षा गार्ड" का उपयोग कर सकता है। यह अपने लैपटॉप पर प्राइवेसी स्क्रीन लगाने जैसा है, जिससे यह सुनिश्चित होता है कि भले ही रोबोट सहायक को स्क्रीन देखनी पड़े, वह केवल सुरक्षित हिस्सों को ही देख पाए।

संक्षेप में: उन्होंने एक सुपर-फास्ट, सुपर-स्मार्ट सुरक्षा गार्ड को प्रशिक्षित करने के लिए एक नकली दुनिया बनाई जो आपके कंप्यूटर से बाहर जाने से पहले ही आपके रहस्यों को पहचान सके, जिससे आपके डिजिटल जीवन को सुरक्षित रखा जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →