← नवीनतम पेपर
💻 computer science

A Comparison of Traditional Machine Learning Algorithms and LSTM-Based Deep Learning Models for Email Sentiment Analysis

यह अध्ययन ईमेल भावना विश्लेषण के लिए पारंपरिक मशीन लर्निंग एल्गोरिदम और LSTM-आधारित डीप लर्निंग मॉडल की तुलना करता है, जिसमें यह पाया गया कि जबकि LSTM स्पैम डिटेक्शन के लिए मजबूत रिकॉल प्रदान करता है, लीनियर कर्नेल वाले सपोर्ट वेक्टर मशीनें उच्च सटीकता (98.74%) और प्रसंस्करण दक्षता का इष्टतम संतुलन प्राप्त करती हैं।

मूल लेखक: Virdio Samuel Saragih, Baruna Abirawa, Kartini Lovian Simbolon, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manullang

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Virdio Samuel Saragih, Baruna Abirawa, Kartini Lovian Simbolon, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manullang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त कार्यालय के प्रबंधक हैं जहाँ हर दिन हज़ारों ईमेल आते हैं। आपका काम उन्हें दो ढेरों में छाँटना है: "Ham" (दोस्तों और सहकर्मियों के वास्तविक, महत्वपूर्ण संदेश) और "Spam" (परेशान करने वाला कचरा, घोटाले और मैलवेयर)। इसे हाथों से करना असंभव है, इसलिए आपने इस छंटनी को करने के लिए चार अलग-अलग "डिजिटल सहायकों" को काम पर रखा है।

यह शोध पत्र एक रिपोर्ट कार्ड है जो तुलना करता है कि इन चार सहायकों ने काम को कितनी अच्छी तरह से किया।

चार सहायक

  1. तीन "पारंपरिक" सहायक (मशीन लर्निंग):

    • SVM (सपोर्ट वेक्टर मशीन): इस सहायक को एक तेज़ नज़र वाले लाइब्रेरियन के रूप में सोचें। यह ईमेल में शब्दों को देखता है और "अच्छी" किताबों को "बुरी" किताबों से अलग करने के लिए रेत में एक सटीक रेखा खींचने की कोशिश करता है। यह बहुत सटीक और तेज़ होने के लिए जाना जाता है।
    • लॉजिस्टिक रिग्रेशन (Logistic Regression): यह एक सांख्यिकीविद् (statistician) की तरह है जो संभावनाओं की गणना करता है। यह शब्दों को देखता है और कहता है, "नंबरों के आधार पर, 9ط% संभावना है कि यह स्पैम है।" यह विश्वसनीय है लेकिन नंबरों को प्रोसेस करने में थोड़ा धीमा हो सकता है।
    • नेव बेज़ (Naive Bayes): यह सहायक एक त्वरित अनुमान लगाने वाला (quick guesser) है। यह मान लेता है कि ईमेल का हर शब्द स्वतंत्र रूप से कार्य करता है (जैसे पासा फेंकना)। यह बहुत तेज़ है लेकिन गलतियाँ कर सकता है क्योंकि यह नहीं देखता कि वाक्य में शब्द एक साथ कैसे काम करते हैं।
  2. "डीप लर्निंग" सहायक (LSTM):

    • LSTM (लॉन्ग शॉर्ट-टर्म मेमोरी): यह एक सुपर-स्मार्ट जासूस है जिसकी याददाश्त बहुत अच्छी है। अन्य सहायकों के विपरीत, जो केवल व्यक्तिगत शब्दों को देखते हैं, यह जासूस शब्दों के क्रम और समय के साथ उनके संबंध को याद रखता है। यह कीवर्ड्स की सूची को स्कैन करने के बजाय, संदर्भ को समझने के लिए पूरी कहानी पढ़ने जैसा है। हालाँकि, इस जासूस को सोचने में लंबा समय लगता है और इसे काम करने के लिए बहुत अधिक ऊर्जा (कंप्यूटिंग पावर) की आवश्यकता होती है।

प्रशिक्षण मैदान (डेटासेट)

इन सहायकों का परीक्षण करने के लिए, शोधकर्ताओं ने उन्हें इंडोनेशियाई भाषा में लिखे गए 2,620 ईमेल का एक विशाल ढेर दिया।

  • सफाई: इससे पहले कि सहायक ईमेल पढ़ पाते, शोधकर्ताओं ने ईमेल को साफ किया। उन्होंने लिंक, ईमेल पते और उन उबाऊ शब्दों को हटा दिया जैसे "और" या "द" जो स्पैम और वास्तविक मेल के बीच अंतर करने में मदद नहीं करते हैं।
  • अनुवाद: उन्होंने शब्दों को नंबरों में बदल दिया (जिसे Word2Vec कहा जाता है)। कल्पना कीजिए कि हर शब्द को एक मानचित्र पर एक विशिष्ट निर्देशांक (coordinate) में बदल दिया गया है। समान अर्थ वाले शब्द इस मानचित्र पर एक-दूसरे के करीब आ जाते हैं।

दौड़ के परिणाम

सहायकों का परीक्षण ईमेल के एक नए बैच पर किया गया जिसे उन्होंने पहले कभी नहीं देखा था, ताकि देखा जा सके कि कौन सबसे अच्छा है।

1. विजेता: तेज़ नज़र वाला लाइब्रेरियन (SVM)

  • प्रदर्शन: SVM सहायक स्पष्ट विजेता था। इसने 98.74% ईमेल सही पहचाने।
  • गति: इसने काम को एक सेकंड से भी कम समय (0.9 सेकंड) में पूरा कर लिया।
  • जीत का कारण: शोधकर्ताओं ने पाया कि जब आप शब्दों को उन "मानचित्र निर्देशांकों" (Word2Vec) में बदलते हैं, तो अच्छे और बुरे ईमेल के बीच सीधी रेखा खींचने की SVM की क्षमता पूरी तरह से काम करती है। इसे बहुत अधिक सोचने की ज़रूरत नहीं थी; इसने पैटर्न को स्पष्ट रूप से देख लिया।

2. उपविजेता: सांख्यिकीविद् (Logistic Regression)

  • प्रदर्शन: इसने भी बहुत अच्छा प्रदर्शन किया, लगभग 97.5% सही पहचान की।
  • गति: यह धीमा था, इसे लगभग 2.7 सेकंड लगे। यह दूसरे स्थान पर एक मजबूत दावेदार था लेकिन गति और सटीकता के संयोजन में लाइब्रेरियन को नहीं हरा सका।

3. तीसरे स्थान पर: त्वरित अनुमान लगाने वाला (Naive Bayes)

  • प्रदर्शन: इसने लगभग 94.5% सही पहचान की।
  • हार का कारण: यह शोधकर्ताओं द्वारा उपयोग किए गए "मानचित्र निर्देशांकों" के साथ संघर्ष करता रहा। यह इस विशिष्ट प्रकार के डेटा के लिए बहुत सरल था।

4. गहरा विचारक (LSTM)

  • प्रदर्शन: सुपर-स्मार्ट जासूस ने बहुत अच्छा काम किया, जिसने 97% सही पहचान की। यह स्पैम पकड़ने में विशेष रूप से अच्छा था (इसने बहुत कम स्पैम छोड़े), जो सुरक्षा के लिए बहुत अच्छा है।
  • चुनौती: इसे प्रशिक्षित करने और चलाने में काफी अधिक समय लगा। यह एक ऐसे जीनियस की तरह है जो पहेली को पूरी तरह से हल करता है लेकिन उसे करने में 30 मिनट लेता है, जबकि लाइब्रेरियन एक सेकंड में इसे हल कर देता है।

अंतिम निर्णय

शोध पत्र निष्कर्ष निकालता है कि इस विशिष्ट कार्य के लिए—इन विशिष्ट "शब्द मानचित्रों" का उपयोग करके ईमेल छाँटने के लिए—आपको सुपर-जटिल, धीमे जासूस की आवश्यकता नहीं है।

SVM (तेज़ नज़र वाले लाइब्रेरियन) ने सबसे अच्छा संतुलन प्रदान किया। यह अविश्वसनीय रूप से सटीक (लगभग पूर्ण) और बिजली की तरह तेज़ था। जबकि डीप लर्निंग जासूस (LSTM) प्रभावशाली था और उसकी याददाश्त बेहतरीन थी, पारंपरिक तरीका इस काम के लिए बस अधिक कुशल था।

संक्षेप में: यदि आप ईमेल को तेज़ी से और सटीकता से फ़िल्टर करने के लिए एक सिस्टम बनाना चाहते हैं, तो पुराना तरीका (SVM) वर्तमान में इस काम के लिए सबसे अच्छा उपकरण है, जो फैंसी, धीमे डीप-लर्निंग मॉडल को पीछे छोड़ देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →