← नवीनतम पेपर
💬 NLP

Spam and Sentiment Detection in Arabic Tweets Using MARBERT Model

यह अध्ययन सऊदी टेलीकॉम कंपनी (STC) के संबंध में 24,513 अरबी ट्वीट्स में स्पैम का पता लगाने और भावना (sentiment) का विश्लेषण करने के लिए MARBERT मॉडल का उपयोग करते हुए एक डीप लर्निंग दृष्टिकोण प्रस्तावित करता है, जिसका उद्देश्य बेहतर सेंटिमेंट क्लासिफिकेशन मेट्रिक्स के माध्यम से ग्राहक सेवा को बढ़ाना है।

मूल लेखक: Abrar Alotaibi, Atta-ur Rahman, Raheel Alhaza, Wala Alkhalifa, Narjes Alhajjaj, Atheer Alharthi, Dhai Abushoumi, Maryam Alqahtani, Dania Alkhulaifi

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abrar Alotaibi, Atta-ur Rahman, Raheel Alhaza, Wala Alkhalifa, Narjes Alhajjaj, Atheer Alharthi, Dhai Abushoumi, Maryam Alqahtani, Dania Alkhulaifi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि STC (सऊदी टेलीकॉम कंपनी) एक विशाल, हलचल भरा शहर का चौक है। हर सेकंड, हजारों लोग ट्विटर के माध्यम से अपनी राय, शिकायतें और प्रशंसा हवा में चिल्ला रहे हैं। कंपनी अपनी सेवा को बेहतर बनाने के लिए हर एक आवाज को सुनना चाहती है, लेकिन इंसानी सुनने वालों की टीम के लिए इतनी सारी आवाजों का मुकाबला करना नामुमकिन है। यह एक तूफान के बीच एक धीमी फुसफुसाहट को सुनने की कोशिश करने जैसा है।

यह शोध पत्र एक सुपर-स्मार्ट रोबोटिक कान (एक AI मॉडल) बनाने के बारे में है जो इस अराजक भीड़ को सुन सके, समझ सके कि वे क्या कह रहे हैं, और उनकी चीखों को व्यवस्थित श्रेणियों में छाँट सके।

यहाँ शोधकर्ताओं ने इस रोबोट को कैसे बनाया, इसे सरल भाषा में समझाया गया है:

1. समस्या: भाषा की बाधा और "शोर"

शोधकर्ताओं को दो मुख्य बाधाओं का सामना करना पड़ा:

  • भाषा: अरबी पेचीदा है। यह केवल एक समान भाषा नहीं है; इसके कई रूप हैं—एक औपचारिक संस्करण (जैसे किताबों की भाषा) और कई अलग-अलग "स्ट्रीट" बोलियाँ (जैसे चैट रूम में इस्तेमाल होने वाली स्लैंग)। यह एक रोबोट को अंग्रेजी समझने के लिए सिखाने जैसा है, लेकिन रोबोट को औपचारिक शेक्सपियर अंग्रेजी और भारी न्यूयॉर्क स्ट्रीट स्लैंग दोनों को एक साथ संभालना होगा।
  • शोर: ट्वीट्स केवल साफ-सुथरे वाक्य नहीं हैं। वे "हैशटैग" (जैसे #STC), लिंक, यूजरनेम और बार-बार आने वाले संदेशों से भरे होते हैं। यह एक ऐसी किताब पढ़ने की कोशिश करने जैसा है जिसका हर पन्ना स्टिकी नोट्स और स्क्रिबल्स से ढका हुआ है।

2. समाधान: "MARBERT" रोबोट

शून्य से एक नया रोबोट बनाने के बजाय, टीम ने MARBERT नामक एक प्री-ट्रेंड मस्तिष्क का उपयोग किया।

  • उपमा: एक ऐसे छात्र की कल्पना करें जिसने पहले ही लाखों अरबी किताबें और ट्वीट्स पढ़ रखे हैं। यह छात्र अरबी भाषा के व्याकरण, स्लैंग और संदर्भ को पूरी तरह से जानता है। यही MARBERT है।
  • ट्विस्ट: अधिकांश AI मॉडल औपचारिक टेक्स्ट पर प्रशिक्षित होते हैं। MARBERT विशेष है क्योंकि इसे विशेष रूप से ट्वीट्स पर प्रशिक्षित किया गया था, जिसका अर्थ है कि यह सोशल मीडिया पर लोग वास्तव में जिस अनौपचारिक और बोली-प्रधान तरीके से बात करते हैं, उसे समझता है।

3. प्रशिक्षण: रोबोट को छाँटना सिखाना

शोधकर्ताओं ने STC के ग्राहकों के 24,513 वास्तविक ट्वीट्स का एक विशाल ढेर लिया और रोबोट को उन्हें पाँच अलग-अलग डिब्बों में छाँटना सिखाया:

  1. सकारात्मक (Positive): "शानदार सेवा!"
  2. नकारात्मक (Negative): "मेरा इंटरनेट बंद है!"
  3. तटस्थ (Neutral): "मैंने अभी अपना बैलेंस चेक किया।"
  4. व्यंग्य (Sarcasm): "ओह, बहुत बढ़िया, एक और आउटेज। बस इसी की ज़रूरत थी।" (इसे पकड़ना सबसे कठिन है क्योंकि शब्द "बढ़िया" कहते हैं, लेकिन अर्थ "बुरा" होता है।)
  5. अनिश्चित (Indeterminate): "मुझे नहीं पता कि क्या कहना है।"

"इम्बैलेंस्ड क्लास" (असंतुलित वर्ग) की समस्या:
शोधकर्ताओं ने एक समस्या देखी: रोबोट "नकारात्मक" और "सकारात्मक" ट्वीट्स को पहचानने में बहुत अच्छा था, लेकिन वह "व्यंग्य" और "अनिश्चित" ट्वीट्स के मामले में भ्रमित होता रहा।

  • रूपक: एक ऐसे शिक्षक की कल्पना करें जो एक टेस्ट ग्रेड कर रहा है जहाँ 90% उत्तर "हाँ" हैं और केवल 10% "नहीं" हैं। छात्र आलसी हो जाता है और हर बार "हाँ" का अनुमान लगाने लगता है क्योंकि वह ज्यादातर समय सही होता है। रोबमा भी ऐसा ही कर रहा था; उसने दुर्लभ "व्यंग्य" वाले ट्वीट्स को अनदेखा कर दिया क्योंकि सीखने के लिए पर्याप्त उदाहरण नहीं थे।
  • समाधान: शोधकर्ताओं ने वापस ट्विटर पर जाकर और अधिक व्यंग्यात्मक ट्वीट्स एकत्र किए ताकि ढेर को संतुलित किया जा सके। उन्होंने रोबोट की "लर्निंग सेटिंग्स" (जैसे कि वह कितनी तेजी से सीखता है और एक बार में कितने उदाहरण देखता है) को भी ट्यून किया ताकि वह कठिन और दुर्लभ मामलों पर अधिक ध्यान दे सके।

4. परिणाम: एक स्मार्ट कान

रोबोट को ट्यून करने और उसे अधिक डेटा खिलाने के बाद, परिणाम प्रभावशाली थे:

  • स्पैम डिटेक्शन: रोबोट "स्पैम" (जंक मैसेज) को पहचानने में बहुत कुशल हो गया, जिसने 98% बार सही पहचान की।
  • सेंटिमेंट एनालिसिस: इसने सफलतापूर्वक ग्राहक ट्वीट्स को पाँच श्रेणियों में उच्च सटीकता के साथ वर्गीकृत किया।
  • सीक्रेट सॉस: शोधकर्ताओं ने पाया कि एक विशिष्ट "बैच साइज" (कितने ट्वीट देखने के बाद रोबोट ब्रेक लेता है) और एक धीमी "लर्निंग रेट" (सीखने में समय लेना) का उपयोग करना सबसे अच्छा काम करता है।

5. लक्ष्य

अंतिम लक्ष्य केवल एक कूल रोबोट बनाना नहीं है; यह STC की मदद करना है। इन ट्वीट्स को स्वचालित रूप से पढ़कर, STC तुरंत जान सकता है कि ग्राहक नाराज हैं, खुश हैं या व्यंग्य कर रहे हैं। यह उन्हें समस्याओं को तेज़ी से ठीक करने और अपनी ग्राहक सेवा में सुधार करने की अनुमति देता है, जिससे चिल्लाती आवाजों वाले उस अराजक शहर के चौक को एक प्रबंधनीय बातचीत में बदला जा सके।

संक्षेप में: यह शोध पत्र एक स्मार्ट, प्री-ट्रेंड अरबी भाषा के मस्तिष्क (MARBERT) को लेने, ट्वीट्स के एक बिखरे हुए ढेर को साफ करने, व्यंग्य और जंक मेल को पहचानने के लिए उसे प्रशिक्षित करने और इसे तब तक ट्यून करने का वर्णन करता है जब तक कि यह ग्राहकों की भावनाओं को समझने के लिए एक अत्यधिक प्रभावी उपकरण न बन जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →