← नवीनतम पेपर
💻 computer science

PersonaFingerprint: Measuring Persona Inference on Modern Websites with LLM-Driven Browsing

यह शोधपत्र "PersonaFingerprint" प्रस्तुत करता है, जो एक ऐसा अध्ययन है जो यह प्रदर्शित करता है कि आधुनिक एन्क्रिप्टेड वेब ट्रैफ़िक मेटाडेटा का उपयोग उच्च सटीकता के साथ उपयोगकर्ता के ब्राउज़िंग व्यक्तित्व (persona) का अनुमान लगाने के लिए किया जा सकता है, जो पारंपरिक वेबसाइट फिंगरप्रिंटिंग से परे एक नए गोपनीयता जोखिम को उजागर करता है।

मूल लेखक: Chuxu Song, Hao Wang, Richard Martin

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chuxu Song, Hao Wang, Richard Martin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हलचल भरे शहर में टहल रहे हैं। आपने एक भारी, अपारदर्शी (opaque) लबादा पहना है जो आपके बारे में सब कुछ छिपा देता है: आपका चेहरा, आपके कपड़े, आपका गंतव्य, और यहाँ तक कि आप क्या खरीद रहे हैं, यह भी। दूर से देखने वाले किसी भी व्यक्ति के लिए, आप एक सामान्य, गुमनाम आकृति की तरह दिखते हैं।

वर्षों तक, सुरक्षा विशेषज्ञों का मानना था कि यदि वे केवल आपके कदमों के आकार और समय (आपके इंटरनेट ट्रैफ़िक का "मेटाडेटा") को देख सकें, तो वे यह बता सकते हैं कि आप किस इमारत में प्रवेश कर रहे हैं (यानी आपने कौन सी वेबसाइट देखी)। इसे "वेबसाइट फिंगरप्रिंटिंग" कहा जाता है।

लेकिन यह शोध पत्र एक डरावना नया सवाल पूछता है: भले ही वे आपका चेहरा या आपका गंतव्य न देख सकें, क्या वे केवल यह देखकर बता सकते हैं कि आप कौन हैं?

नया जोखिम: "चलने की शैली" वाला जासूस

शोधकर्ताओं ने पाया कि आपका "डिजिटल चलने का अंदाज़" (आपका ब्राउज़िंग व्यक्तित्व) आपके एन्क्रिप्टेड ट्रैफ़िक के माध्यम से उतनी ही आसानी से बाहर आता है जितना कि आपका गंतव्य।

  • पुराना दृष्टिकोण: हमलावर आपके ट्रैफ़िक को देखता है और कहता है, "आह, वह अमेज़न की इमारत है।"
  • नया दृष्टिकोण: हमलावर उसी ट्रैफ़िक को देखता है और कहता है, "वह सिर्फ अमेज़न नहीं है; वह एक किफायती सौदा खोजने वाला है जो क्लिक करने से पहले पाँच कीमतें चेक करता है," या "वह एक जिज्ञासु छात्र है जो गहराई से हर एक समीक्षा को पढ़ता है।"

यह शोध पत्र इसे "पर्सोना फिंगरप्रिंटिंग" कहता है। इसका अर्थ है कि बिना आपकी स्क्रीन देखे या आपका नाम जाने भी, एक पर्यवेक्षक आपके डेटा स्ट्रीम के सूक्ष्म "पिंग्स" और "विरामों" (pauses) का विश्लेषण करके आपके व्यक्तित्व, आदतों और लक्ष्यों का अनुमान लगा सकता है।

उन्होंने इसका परीक्षण कैसे किया: "रोबोट अभिनेता"

इसे सिद्ध करने के लिए, शोधकर्ताओं को बिना हजारों वास्तविक मनुष्यों को काम पर रखे (जो महंगा होता और गोपनीयता संबंधी मुद्दे पैदा करता) हजारों विभिन्न प्रकार के लोगों के इंटरनेट ब्राउज़िंग का अनुकरण करने के लिए एक तरीका चाहिए था।

उन्होंने आर्टिफिशियल इंटेलिजेंस का उपयोग करके एक डिजिटल थिएटर बनाया:

  1. निर्देशक (LLM): उन्होंने एक स्मार्ट AI को एक विशिष्ट "चरित्र स्क्रिप्ट" दी। उदाहरण के लिए, "आप एक समय-बद्ध तकनीकी पेशेवर (Time-Pressed Tech Professional) हैं जो जल्दी में है, जिसे स्क्रॉल करना पसंद नहीं है, और केवल पहले सर्च रिजल्ट पर क्लिक करता है।"
  2. अभिनेता (कंप्यूटर एजेंट): इस AI "अभिनेता" ने वास्तव में वास्तविक वेबसाइटों (जैसे YouTube, Amazon और LinkedIn) पर जाकर उस चरित्र का अभिनय किया। उसने ठीक वैसे ही क्लिक किया, स्क्रॉल किया और खोज की जैसे उस व्यक्तित्व वाला कोई वास्तविक इंसान करता।
  3. जासूस (पैकेट स्निफर): जब रोबोट ने अभिनय किया, तो शोधकर्ताओं ने रोबोट के इंटरनेट कनेक्शन के एन्क्रिप्टेड "कदमों" (पैकेट आकार और समय) को रिकॉर्ड किया।

उन्होंने 15 अलग-अलग पात्र बनाए, जिनमें "सावधान वृद्ध उपयोगकर्ता" से लेकर "तेजी से ब्राउज़ करने वाले छात्र" तक शामिल थे, और उन्हें 10 प्रमुख वेबसाइटों पर भेजा।

परिणाम: मुखौटा उतर गया

परिणाम चौंकाने वाले थे। भले ही ट्रैफ़िक एन्क्रिप्टेड था और "अभिनेता" रोबोट थे, शोधकर्ताओं ने एक सरल AI जासूस बनाया जो ट्रैफ़िक को देखकर बहुत सटीकता से चरित्र के व्यक्तित्व का अनुमान लगा सकता था।

  • "कौन" का परीक्षण: जब AI ने मिश्रित वेबसाइटों के ट्रैफ़िक को देखा, तो वह लगभग 84% बार उपयोगकर्ता के "व्यक्तित्व" (persona) का सही अनुमान लगा सका।
  • "कहाँ" का परीक्षण: वह अभी भी लगभग 93% बार वेबसाइट का अनुमान लगा सकता था।
  • "लीकेज" का आश्चर्य: सबसे चिंताजनक खोज यह थी कि AI को व्यक्तित्व का अनुमान लगाने के लिए प्रशिक्षित करने की आवश्यकता नहीं थी। यदि वे एक ऐसे AI को लेते जिसे केवल वेबसाइटों का अनुमान लगाने के लिए प्रशिक्षित किया गया था और उसे एक छोटा, सरल एड-ऑन (जैसे एक सस्ता लेंस अटैचमेंट) दिया, तो वह अचानक यादृच्छिक अनुमान (random guessing) की तुलना में 20-30% बेहतर सटीकता के साथ व्यक्तित्व का अनुमान लगा सकता था।

उपमा: कल्पना कीजिए कि एक सुरक्षा गार्ड है जिसे यह पहचानने के लिए प्रशिक्षित किया गया है कि आप किस दुकान में प्रवेश करते हैं। शोध पत्र ने पाया कि गार्ड का प्रशिक्षण दुकान के "आकार" को पहचानने में इतना अच्छा था कि, बिना प्रयास किए भी, वे यह बता सकते थे कि आप "शर्मीले ग्राहक" हैं या "बेबाक खरीदार", सिर्फ आपके प्रवेश करने के तरीके से।

"ओपन वर्ल्ड" की समस्या

शोधकर्ताओं ने यह भी परीक्षण किया कि क्या होता है जब AI का सामना किसी "अजनबी" से होता है—एक ऐसी ब्राउज़िंग शैली जिसे उसने पहले नहीं देखा है (जैसे कि एक "नाइट ऑउल गेमर" जो उनकी 15 पात्रों की सूची में नहीं था)।

इन मामलों में भी, AI केवल यह नहीं कहता कि "मुझे नहीं पता।" इसके बजाय, यह अक्सर अजनबी को ज्ञात श्रेणियों में से एक में फिट करने की कोशिश करता है।

  • जोखिम: यदि किसी वास्तविक व्यक्ति की अनूठी ब्राउज़िंग शैली है, तो AI उन्हें गलत तरीके से "मूल्य-संवेदनशील खरीदार" या "सावधान शोधकर्ता" के रूप में लेबल कर सकता है।
  • परिणाम: यह खतरनाक है क्योंकि एक गलत अनुमान भी एक झूठी प्रोफ़ाइल बना देता है। हमलावर सोच सकता है, "ओह, यह व्यक्ति एक मोल-भाव करने वाला खरीदार है," और फिर उन्हें लक्षित विज्ञापन या घोटाले दिखाना शुरू कर सकता है, भले ही वे वास्तव में मोल-भाव करने वाले खरीदार न हों।

यह क्यों महत्वपूर्ण है

शोध पत्र निष्कर्ष निकालता है कि एन्क्रिप्शन का "लबादा" उतना अपारदर्शी नहीं है जितना कि हम सोचते थे।

  1. यह केवल इस बारे में नहीं है कि आप कहाँ जाते हैं: यह इस बारे में है कि आप कैसे जाते हैं। आपकी आदतें, धैर्य और जिज्ञासा डेटा में एक निशान छोड़ती हैं।
  2. इसे स्केल करना आसान है: क्योंकि उन्होंने डेटा उत्पन्न करने के लिए AI रोबोट का उपयोग किया, हमलावर आपके व्यक्तित्व का अनुमान लगाने में बेहतर होने के लिए लाखों "प्रशिक्षण उदाहरण" आसानी से बना सकते हैं।
  3. यह पहले से ही हो रहा है: हमारे द्वारा उपयोग किए जाने वाले उपकरण जो हमारी वेबसाइट गोपनीयता की रक्षा करते हैं, वे पहले से ही हमारे व्यक्तित्व डेटा को लीक कर रहे होंगे, और हमलावर के लिए इस जानकारी को अनलॉक करने के लिए बहुत कम अतिरिक्त प्रयास की आवश्यकता होती है।

संक्षेप में: आप अपना चेहरा छिपा सकते हैं, लेकिन आप अपनी चाल नहीं छिपा सकते। और डिजिटल दुनिया में, आपकी चाल आपके बारे में एक कहानी बताती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →