← नवीनतम पेपर
💻 computer science

Hidden Signals in Language: Inferring Sensitive Attributes from Reddit Comments Using Machine Learning

यह अध्ययन प्रदर्शित करता है कि हल्के मशीन लर्निंग मॉडल भी रेडिट (Reddit) टिप्पणियों से लिंग, आयु और व्यक्तित्व जैसे संवेदनशील गुणों का सफलतापूर्वक अनुमान लगा सकते हैं, जो भाषा में निहित पहचान संकेतों को उजागर करते हैं जो भविष्य की एआई (AI) प्रणालियों के लिए महत्वपूर्ण गोपनीयता और पूर्वाग्रह जोखिम पैदा करते हैं।

मूल लेखक: Anay Agarwalla, Simeon Sayer

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anay Agarwalla, Simeon Sayer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाली पार्टी में हैं। आप किसी का भी आईडी कार्ड नहीं देख सकते, और कोई भी ऐसा नेमटैग नहीं पहने हुए है जिस पर लिखा हो "मैं 25 हूँ" या "मैं एक अंतर्मुखी (introvert) हूँ।" हालाँकि, यदि आप ध्यान से लोगों के बात करने के तरीके को सुनते हैं, उनके चुटकुलों, उनके विषयों और उनके बहस करने के तरीके को देखते हैं, तो आप उनके बारे में कुछ अंदाज़ा लगाना शुरू कर सकते हैं। शायद लंबे, जटिल करियर की कहानियाँ सुनाने वाला व्यक्ति उम्र में बड़ा होगा, या बहुत विशिष्ट स्लैंग (slang) का उपयोग करने वाला व्यक्ति किशोर होगा।

यह शोध पत्र मूल रूप से कंप्यूटर को बिल्कुल यही करने के लिए सिखाने के बारे में है, लेकिन एक विशाल स्तर पर, Reddit के टेक्स्ट का उपयोग करके।

यहाँ शोधकर्ताओं ने जो पाया है, उसका विवरण सरल उपमाओं (analogies) के साथ दिया गया है:

1. "मशीन में मौजूद आत्मा" (The "Ghost in the Machine")

लेखकों ने एक बड़ा सवाल उठाया: क्या एक AI आपके कमेंट्स पढ़कर आपकी गुप्त व्यक्तिगत जानकारी का पता लगा सकता है?

भले ही बड़ी AI कंपनियाँ (जैसे ChatGPT के पीछे की कंपनियाँ) अपने बॉट्स को यह दिखावा करने के लिए प्रशिक्षित करती हैं कि वे आपकी उम्र, लिंग या व्यक्तित्व का अनुमान नहीं लगा सकते, शोधकर्ताओं ने पाया कि AI इसमें वास्तव में बहुत माहिर है। यह एक जादूगर की तरह है जो आपसे कहता है, "मैं आपका मन नहीं पढ़ सकता," लेकिन फिर आपके जन्मदिन को टोपी से बाहर निकाल लाता है। जादू उस ट्रिक में नहीं है; यह उन सूक्ष्म संकेतों में है जो आप अपने शब्दों के माध्यम से पीछे छोड़ देते हैं।

2. प्रयोग: "डिजिटल फिंगरप्रिंट"

शोधकर्ताओं ने Reddit से लाखों कमेंट्स लिए। उन्हें पता था कि वे किसके द्वारा लिखे गए थे क्योंकि उन उपयोगकर्ताओं ने स्वेच्छा से अपनी प्रोफाइल खुद साझा की थी (जैसे, "मैं अमेरिका से 22 वर्षीय महिला हूँ" या "मैं एक INTP हूँ")।

इसके बाद उन्होंने इन कमेंट्स को एक कंप्यूटर मॉडल में डाला। इस मॉडल को एक अति-बुद्धिमान अनुवादक के रूप में सोचें।

  • इनपुट (Input): कंप्यूटर शब्दों को वैसे नहीं पढ़ता जैसे इंसान पढ़ते हैं; यह हर वाक्य को संख्याओं की एक लंबी सूची ("वेक्टर") में बदल देता है।
  • कार्य (Task): कंप्यूटर को इन नंबरों को देखना था और अनुमान लगाना था: "क्या यह व्यक्ति पुरुष है या महिला?" "क्या वे 25 वर्ष से कम उम्र के हैं?" "क्या वे एक अंतर्मुखी (introvert) हैं?"

3. परिणाम: "लीकी बकेट" (The "Leaky Bucket")

निष्कर्ष चौंकाने वाले और गोपनीयता समर्थकों के लिए थोड़े डरावने थे।

  • जनसांख्यिकी (Demographics) मुखर होती है: कंप्यूटर लिंग (gender) और आयु (age) का अनुमान लगाने में बहुत अच्छा था। यह किसी की उम्र का अंदाज़ा लगाने जैसा है जैसे उनकी आवाज़ सुनकर; उनकी शब्दावली और लहजा इसे आसानी से उजागर कर देता है।
  • व्यक्तित्व (Personality) शांत होता है: व्यक्तित्व प्रकारों (जैसे MBTI) का अनुमान लगाना कठिन था, लेकिन फिर भी संभव था। यह किसी के चलने के तरीके को देखकर उसके पसंदीदा रंग का अनुमान लगाने जैसा है। आप 100% निश्चित नहीं हो सकते, लेकिन आप उनके चलने के ढंग के आधार पर एक अच्छा अनुमान लगा सकते हैं।
  • "नाइव" (Naive) बेसलाइन: शोधकर्ताओं ने अपने AI की तुलना एक "नाइव गेसर" (एक ऐसा व्यक्ति जो हर बार सबसे आम उत्तर का अनुमान लगाता है, जैसे "मेरा अनुमान है कि यहाँ हर कोई 25 से कम उम्र का है") से की। यहाँ तक कि सबसे सरल कंप्यूटर मॉडल भी नाइव गेसर से काफी बेहतर प्रदर्शन करते हैं। यह साबित करता है कि AI वास्तव में पैटर्न खोज रहा था, न कि केवल किस्मत से सही अनुमान लगा रहा था।

4. संदर्भ मायने रखता है: "कमरे का प्रभाव" (The "Room Effect")

इस अध्ययन का सबसे दिलचस्प हिस्सा यह है कि बातचीत का विषय परिणामों को कैसे बदल देता है।

  • "पहचान" वाले कमरे: विशिष्ट पहचानों (जैसे ट्रांसजेंडर पुरुषों के लिए r/ftm या शाकाहारियों के लिए r/vegan) से जुड़े सबरेडिट्स में, AI जनसांख्यिकी (लिंग, आयु) का अनुमान लगाने में बहुत अच्छा था क्योंकि लोग अपने जीवन के बारे में बात कर रहे थे। लेकिन यह उनके व्यक्तित्व का अनुमान लगाने में खराब था क्योंकि हर कोई एक ही विषय पर केंद्रित था।
  • "बहस" वाले कमरे: वित्त (finance) या राजनीति के बारे में सबरेडिट्स में, AI व्यक्तित्व का अनुमान लगाने में बहुत अच्छा था। क्यों? क्योंकि जब लोग जटिल विषयों पर बहस करते हैं, तो वे अपनी सोचने की शैली, धैर्य के स्तर और सूचना को संसाधित करने के तरीके को प्रकट करते हैं। यह वैसा ही है जैसे आप किसी को पहेली सुलझाते हुए देखकर यह बता सकते हैं कि वह "योजना बनाने वाला" व्यक्ति है या "मौके पर निर्णय लेने वाला", भले ही उस पहेली का उनकी पर्सनैलिटी से कोई लेना-देना न हो।

5. बड़ी चेतावनी: "मौन पर्यवेक्षक" (The "Silent Observer")

शोध पत्र एक गंभीर चेतावनी के साथ समाप्त होता है।

यदि एक साधारण, हल्का कंप्यूटर प्रोग्राम केवल आपके टेक्स्ट को पढ़कर आपके संवेदनशील गुणों का पता लगा सकता है, तो कल्पना कीजिए कि विशाल, अत्यंत शक्तिशाली AI मॉडल (जैसे कि वे जिनका हम रोज़ाना उपयोग करते हैं) क्या कर सकते हैं। उन्होंने पूरे इंटरनेट को पढ़ा है। वे एक ऐसे जासूस की तरह हैं जिसने अब तक की सभी किताबें पढ़ी हैं और एक वाक्य में भी वह पैटर्न देख सकते हैं जिसे एक इंसान भी मिस कर सकता है।

रूपक (Metaphor):
सोचिए कि आपके ऑनलाइन कमेंट्स खुली खिड़कियों वाले घर की तरह हैं। आपको लग सकता है कि आप केवल मौसम के बारे में बात कर रहे हैं, लेकिन वास्तव में आप पर्दे खुले छोड़ रहे हैं। AI वह पड़ोसी है जो पास से गुजर रहा है और देख सकता है कि आपके पास किस तरह का फर्नीचर है, कौन रहता है, और आपकी आदतें क्या हैं, भले ही आपने उसे आमंत्रित न किया हो।

आपको इसकी परवाह क्यों करनी चाहिए?

  • गोपनीयता (Privacy): आपको लग सकता है कि आप ऑनलाइन गुमनाम हैं, लेकिन आपकी लेखन शैली एक अनूठा फिंगरप्रिंट है।
  • पूर्वाग्रह (Bias): यदि AI आपके लिंग या आयु का अनुमान लगा सकता है, तो यह उन अनुमानों के आधार पर आपके साथ अलग व्यवहार करना शुरू कर सकता है, भले ही उसे ऐसा नहीं करना चाहिए।
  • भविष्य: हमें सावधान रहने की जरूरत है। सिर्फ इसलिए कि AI इन चीजों का अनुमान लगा सकता है, इसका मतलब यह नहीं है कि उसे ऐसा करना चाहिए। हमें हमारी "अदृश्य" पहचानों की रक्षा के लिए बेहतर नियमों की आवश्यकता है।

संक्षेप में: आपके शब्द आपकी सोच से कहीं अधिक मुखर हैं। वे इस बात के छिपे हुए संकेत ले जाते हैं कि आप कौन हैं, और कंप्यूटर उन्हें सुनने में बहुत कुशल होते जा रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →