← नवीनतम पेपर
💻 computer science

An Evaluation of Chat Safety Moderations in Roblox

यह अध्ययन 20 लाख संदेशों के एक संग्रह का विश्लेषण करके रोब्लॉक्स (Roblox) की स्वचालित चैट मॉडरेशन का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान प्रणाली ग्रूमिंग, उत्पीड़न और हिंसा सहित हानिकारक सामग्री की एक विस्तृत श्रृंखला को प्रभावी ढंग से रोकने में विफल रहती है और उपयोगकर्ता पहचान से बचने के लिए विभिन्न तकनीकों का सक्रिय रूप से उपयोग करते हैं।

मूल लेखक: Priya Kaushik, Sonja Brown, Rakibul Hasan, Sazzadur Rahaman

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Priya Kaushik, Sonja Brown, Rakibul Hasan, Sazzadur Rahaman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि Roblox एक विशाल, हलचल भरा डिजिटल खेल का मैदान है जहाँ हर दिन लाखों बच्चे समय बिताते हैं। यह एक विशाल, आभासी मॉल की तरह है जिसमें हजारों अलग-अलग गेम रूम हैं। हालाँकि यह मनोरंजन की जगह है, लेकिन जिस पेपर के बारे में आप पूछ रहे हैं वह इस खेल के मैदान के "आचरण के नियमों" का एक सुरक्षा ऑडिट (security audit) है।

शोधकर्ता यह जानना चाहते थे: क्या सुरक्षा गार्ड (चैट मॉडरेशन सिस्टम) वास्तव में अपना काम कर रहा है?

यहाँ उनके निष्कर्षों का सरल विवरण दिया गया है:

1. मिशन: "बुरे लोगों" को पकड़ना

शोधकर्ताओं को पता था कि Roblox के पास बुरे शब्दों और खतरनाक संदेशों को स्वचालित रूप से रोकने के लिए एक प्रणाली है। लेकिन उन्हें संदेह था कि कुछ "बुरे लोग" (वे लोग जो बच्चों को डराने, परेशान करने या उनका शोषण करने की कोशिश कर रहे हैं) सुरक्षा गार्ड के पास से बचकर निकल जा रहे हैं।

यह पता लगाने के लिए, वे केवल Roblox से बुरे संदेशों की सूची नहीं मांग सकते थे (क्योंकि Roblox इसे साझा नहीं करता है)। इसके बजाय, उन्होंने अंडरकवर रिपोर्टर की तरह काम किया। उन्होंने हफ्तों तक गेम की स्क्रीन रिकॉर्ड करने के लिए कैमरे लगाए, जिससे चार लोकप्रिय गेम्स से 20 लाख से अधिक चैट संदेश कैप्चर हुए। फिर उन्होंने विशेष सॉफ्टवेयर (एक हाई-टेक स्कैनर की तरह) का उपयोग किया ताकि वे उन वीडियो रिकॉर्डिंग को टेक्स्ट में बदल सकें ताकि वे उन्हें पढ़ सकें।

2. समस्या: गार्ड ड्यूटी पर सो रहा है

एक बार जब उनके पास टेक्स्ट आ गया, तो उन्हें एक परेशान करने वाली वास्तविकता का पता चला। सुरक्षा गार्ड स्पष्ट चीजों को पकड़ने में अच्छा है, जैसे कि कोई बड़े अक्षरों (all caps) में अपशब्द चिल्ला रहा हो। लेकिन वह धीमी-धीमी बढ़ती खतरनाक स्थितियों (slow-burn dangers) को पकड़ने में बहुत बुरा है।

इसे एक क्लब के बाउंसर की तरह समझें जो लाल शर्ट पहने लोगों को तो रोकता है, लेकिन उन लोगों को अंदर जाने देता है जिन्होंने नीली जैकेट के नीचे लाल शर्ट पहनी होती है, या जो चिल्लाने के बजाय फुसफुसाकर धमकी देते हैं।

शोधकर्ताओं ने पाया कि सिस्टम ने भारी मात्रा में हानिकारक सामग्री को मिस कर दिया, जिसमें शामिल थे:

  • ग्रूमिंग (Grooming): शिकारी (predators) बच्चों का भरोसा जीतने के लिए धीरे-धीरे संबंध बनाना ताकि वे असल जिंदगी में मिल सकें या निजी तस्वीरें साझा कर सकें।
  • बुलिंग और नफरत (Bullying & Hate): नस्लवादी शब्द और अपमानजनक बातें।
  • यौन सामग्री (Sexual Content): स्पष्ट बातचीत और रोलप्ले।
  • आत्म-नुकसान (Self-Harm): बच्चे खुद को चोट पहुँचाने के बारे में बात कर रहे हैं।
  • PII लीक (PII Leaks): बच्चे गलती से अपना असली पता या फोन नंबर साझा कर रहे हैं।

उपमा (Analogy): गार्ड आपको तब रोकता है जब आप तलवार लेकर अंदर जाने की कोशिश करते हैं, लेकिन वह आपको तब अंदर आने देता है जब आप तलवार को पिज्जा बॉक्स के अंदर छिपा लेते हैं और फिर एक बार अंदर पहुँचने के बाद उसे बाहर निकाल लेते हैं।

3. "चूहे और बिल्ली" का खेल: कैसे बच्चे (और बुरे लोग) गार्ड को चकमा देते हैं

शोधकर्ताओं ने यह भी देखा कि क्या होता है जब गार्ड किसी संदेश को ब्लॉक कर देता है। उन्होंने पाया कि बुरे संदेश भेजने वाले लोग हार नहीं मानते; वे रचनात्मक हो जाते हैं। वे मॉडरेशन सिस्टम के साथ ऐसे व्यवहार करते हैं जैसे कि वह एक वीडियो गेम बॉस हो जिसे उन्हें हराना है।

वे कंप्यूटर को बेवकूफ बनाने के लिए चालाक तरकीबें इस्तेमाल करते हैं:

  • "स्प्लिट सेंटेंस" (Split Sentence) की ट्रिक: यदि गार्ड "die" शब्द को ब्लॉक करता है, तो उपयोगकर्ता एक संदेश में "I just want to..." लिखता है, और अगले संदेश में "die" लिखता है। गार्ड दो सुरक्षित संदेश देखता है, लेकिन पाठक पूरा डरावना वाक्य देख लेता है।
  • "कोड वर्ड" (Code Word) की ट्रिक: "bitch" कहने के बजाय, वे "b" या "btc" टाइप करते हैं। यह कंप्यूटर के लिए निरर्थक लगता है, लेकिन दूसरे खिलाड़ी ठीक से जानते हैं कि इसका क्या मतलब है।
  • "लीट स्पीक" (Leet Speak) की ट्रिक: वे अक्षरों को नंबरों या प्रतीकों से बदल देते हैं, जैसे "hacker" के बजाय "h4ck3r" लिखना।
  • "प्रोब" (Probe) की ट्रिक: वे माहौल को परखते हैं। वे पूछते हैं, "क्या आपके पास [ब्लॉक किया गया शब्द] है?" जब यह ब्लॉक हो जाता है, तो वे पूछते हैं, "क्या आपके पास एक ऐप है जो 'D' से शुरू होता है और 'rd' पर समाप्त होता है?" वे वास्तव में गार्ड की कमियों (blind spots) का परीक्षण कर रहे हैं ताकि वे देख सकें कि वे क्या छिपा सकते हैं।

4. मुख्य निष्कर्ष (The Big Takeaway)

पेपर यह निष्कर्ष निकालता है कि वर्तमान प्रणाली प्रतिक्रियात्मक (reactive) है, प्रोएक्टिव (proactive) नहीं। यह एक विशिष्ट बुरे शब्द के आने का इंतज़ार करती है, लेकिन यह बातचीत के पीछे की कहानी या इरादे को नहीं समझती है।

  • गार्ड देखता है: "Hello" (सुरक्षित) + "How old are you?" (सुरक्षित) + "Where do you live?" (सुरक्षित)।
  • वास्तविकता: यह एक शिकारी है जो बच्चे का पता जानने की कोशिश कर रहा है।

शोधकर्ता सुझाव देते हैं कि इसे ठीक करने के लिए, सिस्टम को संदेशों को एक-एक करके (जैसे व्यक्तिगत ईंटों की जाँच करना) देखने के बजाय पूरी बातचीत (जैसे पूरी दीवार को देखना) को देखना चाहिए। वे यह भी सुझाव देते हैं कि यदि कोई उपयोगकर्ता बार-बार नियम तोड़ने की कोशिश करता है, तो सिस्टम को केवल उनके व्यक्तिगत शब्दों को बार-बार ब्लॉक करने के बजाय विशेष रूप रूप से उस व्यक्ति को फ्लैग (flag) करना चाहिए।

संक्षेप में: डिजिटल खेल के मैदान में एक सुरक्षा गार्ड है, लेकिन बुरे लोग बहुत स्मार्ट हैं, और गार्ड गलत चीजों पर बहुत अधिक ध्यान केंद्रित कर रहा है। बच्चे उन शिकारियों के सामने असुरक्षित छोड़ दिए गए हैं जो ठीक से जानते हैं कि दरारों से कैसे निकलना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →