← नवीनतम पेपर
💬 NLP

Comparative Analysis of AutoML and BiLSTM Models for Cyberbullying Detection on Indonesian Instagram Comments

यह अध्ययन इंडोनेशियाई इंस्टाग्राम टिप्पणियों में साइबर बुलिंग का पता लगाने के लिए मशीन लर्निंग और डीप लर्निंग मॉडल का मूल्यांकन और तुलना करता है, जिसमें यह पाया गया कि जबकि अटेंशन मैकेनिज्म के साथ BiLSTM उच्चतम समग्र प्रदर्शन प्राप्त करता है, लॉजिस्टिक रिग्रेशन एक प्रतिस्पर्धी और संसाधन-कुशल विकल्प बना हुआ है।

मूल लेखक: Raihana Adelia Putri, Aisyah Musfirah, Anggi Puspita Ningrum, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

प्रकाशित 2026-04-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Raihana Adelia Putri, Aisyah Musfirah, Anggi Puspita Ningrum, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इंस्टाग्राम की कल्पना एक विशाल, हलचल भरे डिजिटल शहर के चौक के रूप में करें। हालांकि यह फोटो साझा करने और जुड़ने की जगह है, लेकिन इसका एक काला पक्ष भी है: साइबर बुलिंग (Cyberbullying)। यह तब होता है जब लोग दूसरों को परेशान करने, धमकाने या अपमानित करने के लिए इंटरनेट का उपयोग करते हैं। इंडोनेशिया में, यह कई युवाओं को प्रभावित करने वाली एक गंभीर समस्या है।

यह शोध पत्र एक जासूसी रिपोर्ट की तरह है जो यह पता लगाने की कोशिश कर रहा है कि एक "डिजिटल सुरक्षा गार्ड" बनाने का सबसे अच्छा तरीका क्या है जो इन अपमानजनक टिप्पणियों को किसी को चोट पहुँचाने से पहले ही इंडोनेशियाई भाषा में स्वचालित रूप से पहचान सके।

यहाँ उनकी जांच की कहानी दी गई है, जिसे सरल रूप में विभाजित किया गया है:

1. संदिग्ध (डेटा)

शोधकर्ताओं ने एक "वांटेड लिस्ट" (वांछित सूची) एकत्र की जिसमें 650 इंस्टाग्राम कमेंट्स थे।

  • स्रोत: ये प्रसिद्ध इंडोनेशियाई कलाकारों और इन्फ्लुएंसर्स के कमेंट सेक्शन से लिए गए थे।
  • मिश्रण: यह सूची पूरी तरह से संतुलित थी: 325 कमेंट्स अपमानजनक (Bullying) थे और 325 अच्छे (Non-Bullying) थे।
  • चुनौती: ये औपचारिक निबंध नहीं थे। ये अव्यवस्थित, छोटे और स्लैंग (slang), संक्षिप्त शब्दों और इमोजी से भरे हुए थे—बिल्कुल वैसे ही जैसे वास्तविक किशोर बात करते हैं।

2. सफाई दल (Preprocessing)

कंप्यूटर द्वारा इन कमेंट्स को पढ़ने से पहले, उन्हें साफ करना आवश्यक था। कल्पना कीजिए कि आप एक ऐसी किताब पढ़ने की कोशिश कर रहे हैं जो ऐसी भाषा में लिखी गई है जहाँ लोग लगातार शब्दों को गलत लिखते हैं या उन्हें खींचकर लंबा कर देते हैं (जैसे "banget" के बजाय "baaaanget")।

शोधकर्ताओं ने छह चरणों वाला एक विशेष सफाई मशीन बनाया:

  1. केस फोल्डिंग (Case Folding): सब कुछ लोअरकेस (lowercase) में बदलना (ताकि "Hello" और "hello" एक ही हों)।
  2. सफाई (Cleaning): हैशटैग, लिंक और @मेंशन को हटाना।
  3. स्लैंग नॉर्मलाइजेशन (Slang Normalization): स्लैंग को ठीक करना (जैसे "bgt" को वापस "banget" में बदलना)।
  4. स्टॉपवर्ड रिमूवल (Stopword Removal): उन सामान्य शब्दों को फेंक देना जैसे "and" या "the" जो बुलिंग पहचानने में मदद नहीं करते।
  5. स्टेमिंग (Stemming): शब्दों को उनके मूल रूप तक काटना (जैसे "running" को "run" में बदलना)।
  6. टोकेनाइजेशन (Tokenization): वाक्य को व्यक्तिगत शब्द के टुकड़ों में काटना।

इस चरण के बिना, कंप्यूटर इंटरनेट स्लैंग के कारण भ्रमित हो जाएगा।

3. प्रतियोगी (मॉडल)

शोधकर्ताओं ने दो अलग-अलग प्रकार के "जासूसों" को एक-दूसरे के खिलाफ खड़ा किया ताकि देखा जा सके कि कौन बुलियों (bullies) को बेहतर तरीके से पकड़ सकता है।

टीम A: क्लासिक डिटेक्टिव्स (Machine Learning)

ये पुराने और भरोसेमंद तरीके हैं। ये शब्दों को देखते हैं और गिनते हैं कि विशिष्ट "बुरे" शब्द कितनी बार आते हैं।

  • नेव बेयस (Naive Bayes): संभावना के आधार पर एक त्वरित अनुमान लगाने वाला।
  • लॉजिस्टिक्स रिग्रेशन (Logistic Regression): एक स्थिर कैलकुलेटर जो अच्छे और बुरे के बीच एक रेखा खींचता है।
  • एसवीएम (SVM - Support Vector Machine): एक पैनी नज़र वाला क्लासिफायर जो दोनों समूहों के बीच एक आदर्श सीमा खोजने की कोशिश करता है।
  • टूल: उन्होंने TF-IDF नामक एक विधि का उपयोग किया, जो एक हाइलाइटर की तरह है जो उन शब्दों को चिह्नित करता है जो वाक्य में अद्वितीय और महत्वपूर्ण हैं।

टीम B: डीप थिंकर (Deep Learning)

ये उन्नत एआई (AI) जासूस हैं जो केवल शब्दों को ही नहीं, बल्कि वाक्य के संदर्भ (context) और प्रवाह (flow) को समझने की कोशिश करते हैं।

  • Bi-LSTM: एक मॉडल जो वाक्य को बाएं-से-दाएं और दाएं-से-बाएं दोनों दिशाओं में एक साथ पढ़ता है, जैसे एक किताब पढ़ते समय साथ ही साथ यह भी याद रखना जो आपने अभी पढ़ा है।
  • Bi-LSTM + Attention: वही मॉडल, लेकिन एक "स्पॉटलाइट" (Attention mechanism) के साथ। यह स्पॉटलाइट मॉडल को वाक्य के सबसे भावनात्मक या महत्वपूर्ण शब्दों पर अतिरिक्त ध्यान देने के लिए कहती है।

4. परिणाम: कौन जीता?

शोधकर्ताओं ने यह देखने के लिए एक दौड़ आयोजित की कि कौन सा मॉडल बुलिंग कमेंट्स को सही ढंग से पहचान सकता है।

  • क्लासिक विजेता: पुराने जमाने के जासूसों में, लॉजिस्टिक्स रिग्रेशन चैंपियन था। इसने लगभग 85.25% बार सही पहचान की। यह तेज़, कुशल था और इसे चलाने के लिए सुपरकंप्यूटर की आवश्यकता नहीं थी।
  • डीप लर्निंग विजेता: "स्पॉटलाइट" (Attention) वाला Bi-LSTM समग्र रूप से विजेता बना। इसने लगभग 84.62% बार सही पहचान की।
    • क्या यह कम है? वास्तव में, यह बहुत करीब है! "स्पॉटलाइट" ने मॉडल को अन्य मॉडलों की तुलना में बुलिंग के बारीक अंतर (nuance) को बेहतर ढंग से समझने में मदद की, भले ही कच्चा प्रतिशत थोड़ा कम रहा हो।
    • मानक Bi-LSTM (बिना स्पॉटलाइट के) खराब प्रदर्शन करता था (78.46%), जिससे साबित हुआ कि "स्पॉटलाइट" अत्यंत महत्वपूर्ण थी।

5. निर्णय (The Verdict)

शोध पत्र कुछ मुख्य निष्कर्षों के साथ समाप्त होता है:

  • डीप लर्निंग "सबसे स्मार्ट" है: स्पॉटलाइट वाला मॉडल (Bi-LSTM + Attention) इंडोनेशियाई स्लैंग और भावनात्मक हमलों के जटिल, अव्यवस्थित संदर्भ को समझने में सबसे अच्छा है।
  • मशीन लर्निंग "सबसे कुशल" है: यदि आपके पास शक्तिशाली कंप्यूटर नहीं है या आपको कुछ ऐसा चाहिए जो बहुत तेज़ी से चले, तो क्लासिक लॉजिस्टिक्स रिग्रेशन एक बहुत ही मजबूत और व्यावहारिक विकल्प है। इसने जटिल एआई के लगभग बराबर प्रदर्शन किया लेकिन यह बहुत हल्का है।
  • सफाई (Cleaning) महत्वपूर्ण है: अध्ययन इस बात पर जोर देता है कि यदि आप पहले स्लैंग को साफ नहीं करते और टाइपो को ठीक नहीं करते हैं, तो सबसे स्मार्ट एआई भी विफल हो जाएगा।

सीमाएं (The Fine Print)

लेखक अपने अध्ययन की सीमाओं के बारे में ईमानदार हैं:

  • छोटा नमूना (Small Sample): उन्होंने केवल 650 कमेंट्स का उपयोग किया। यह 650 लोगों के सर्वेक्षण के आधार पर पूरे देश की संगीत पसंद का आकलन करने जैसा है। एक बड़ा डेटासेट परिणामों को अधिक विश्वसनीय बनाएगा।
  • विशिष्ट स्रोत: सभी कमेंट्स प्रसिद्ध कलाकारों के पेजों से आए थे। एक सामान्य व्यक्ति के पेज पर बुलिंग अलग दिख सकती है।
  • सरल लेबल: उन्होंने कमेंट्स को केवल "बुलिंग" या "बुलिंग नहीं" के रूप में लेबल किया। उन्होंने इसे और अधिक विस्तार से नहीं बांटा (जैसे, "बॉडी शेमिंग" बनाम "हेट स्पीच")।

संक्षेप में: इंडोनेशियाई इंस्टाग्राम कमेंट्स में साइबर बुलियों को पकड़ने के लिए, आपको पहले एक अच्छी सफाई टीम की आवश्यकता है। फिर, आपके पास मौजूद कंप्यूटिंग पावर के आधार पर, आप एक तेज़, भरोसेमंद क्लासिक जासूस (लॉजिस्टिक्स रिग्रेशन) या एक अत्यधिक बुद्धिमान, संदर्भ-जागरूक एआई (स्पॉटलाइट के साथ Bi-LSTM + Attention) के बीच चयन कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →