← नवीनतम पेपर
💬 NLP

Benchmarking Logistic Regression, SVM, and LightGBM Against BiLSTM with Attention for Sentiment Analysis on Indonesian Product Reviews

यह शोध पत्र इंडोनेशियाई सेंटीमेंट एनालिसिस के लिए एक BiLSTM विद अटेंशन मॉडल के विरुद्ध पारंपरिक मशीन लर्निंग एल्गोरिदम (लॉजिस्टिक्स रिग्रेशन, SVM, और LightGBM) का बेंचमार्किंग करता है, जिसमें यह पाया गया कि सबसे अच्छा प्रदर्शन करने वाला ML मॉडल (लॉजिस्टिक्स रिग्रेशन) डीप लर्निंग दृष्टिकोण से थोड़ा बेहतर प्रदर्शन करता है और साथ ही अधिक कम्प्यूटेशनल दक्षता प्रदान करता है।

मूल लेखक: Razin Hafid Hamdi, Ivana Margareth Hutabarat, Hanna Gresia Sinaga, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manullang

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Razin Hafid Hamdi, Ivana Margareth Hutabarat, Hanna Gresia Sinaga, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manullang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप इंडोनेशिया में एक विशाल ऑनलाइन स्टोर चला रहे हैं। हर दिन, हजारों ग्राहक आपके उत्पादों के बारे में समीक्षाएं (reviews) छोड़ते हैं। कुछ कहते हैं, "यह अद्भुत है!" और अन्य कहते हैं, "यह भयानक है!" हर एक को मैन्युअल रूप से पढ़ना एक आग की बौछार से पानी पीने की कोशिश करने जैसा है—यह असंभव है, धीमा है, और आप थक सकते हैं और गलतियाँ कर सकते हैं।

इस समस्या को हल करने के लिए, इस शोध पत्र के लेखकों ने दो अलग-अलग "डिजिटल सहायक" बनाए ताकि वे इन समीक्षाओं को पढ़ सकें और आपको बता सकें कि ग्राहक खुश हैं या नाखुश। वे यह देखना चाहते थे कि कौन सा सहायक बेहतर था: पुराने जमाने का जासूस (मशीन लर्निंग) या हाई-टेक दिमाग (डीप लर्निंग)।

यहाँ बताया गया है कि उन्होंने इस दौड़ को कैसे व्यवस्थित किया और क्या हुआ।

प्रतियोगी

1. पुराना जमाने का जासूस (मशीन लर्निंग)
इस टीम ने PyCaret नामक एक स्मार्ट टूलकिट का उपयोग किया। इसे एक अत्यंत कुशल फाइलिंग कैबिनेट की तरह समझें। यह बिखरी हुई समीक्षाओं को लेता है, उन्हें साफ करता है, और उन्हें कीवर्ड्स (जैसे "अच्छा," "बुरा," "तेज़," "धीमा") की एक व्यवस्थित सूची में बदल देता है।

  • टूल्स: उन्होंने तीन प्रकार के जासूसों का परीक्षण किया:
    • लॉजिस्टिक रिग्रेशन (Logistic Regression): एक सीधा, तार्किक विचारक जो सरल पैटर्न की तलाश करता है।
    • SVM: एक सख्त जज जो "अच्छी" और "बुरी" समीक्षाओं के बीच एक स्पष्ट रेखा खींचता है।
    • LightGBM: एक तेज़, शक्तिशाली कैलकुलेटर जो उत्तर खोजने के लिए कई छोटे निर्णय वृक्षों (decision trees) का निर्माण करता है।
  • रणनीति: उन्होंने इन टूल्स को अध्ययन करने के लिए 15,782 समीक्षाएं दीं और फिर उन्हें 3,946 समीक्षाओं के एक नए बैच पर परखा, जिन्हें उन्होंने पहले नहीं देखा था।

2. हाई-टेक दिमाग (डीप लर्निंग)
इस टीम ने PyTorch का उपयोग करके एक BiLSTM with Attention बनाया। इस बुद्धिमान रोबोट की कल्पना करें जो न केवल शब्द पढ़ता है; बल्कि यह पूरे वाक्य को शुरू से अंत तक और फिर अंत से शुरू तक पढ़ता है।

  • "अटेंशन" (Attention) की सुपरपावर: इस रोबट के पास "अटेंशन" नामक एक विशेष क्षमता है। यह एक आवर्धक लेंस (magnifying glass) की तरह है जो तुरंत वाक्य के सबसे महत्वपूर्ण शब्दों (जैसे "नहीं" या "प्यार") पर ज़ूम करता है और उबाऊ शब्दों को अनदेखा कर देता है। यह शब्दों के पीछे के संदर्भ (context) और भावनाओं को समझने की कोशिश करता है, न कि केवल शब्दों को।

दौड़ की शर्तें

  • ट्रैक: उन्होंने 19,728 इंडोनेशियाई उत्पाद समीक्षाओं का डेटासेट उपयोग किया।
  • संतुलन: ट्रैक पूरी तरह से निष्पक्ष था। ठीक आधी समीक्षाएं सकारात्मक थीं, और आधी नकारात्मक। इसका मतलब था कि किसी भी सहायक को कोई अनुचित लाभ नहीं मिला।
  • तैयारी: दौड़ से पहले, उन्होंने टेक्स्ट को साफ किया। उन्होंने लिंक और हैशटैग हटा दिए और स्लैंग (जैसे "bgt" को "banget" में बदलना) को परिवर्तित किया ताकि दोनों सहायक एक ही स्पष्ट भाषा पढ़ सकें।

परिणाम: कौन जीता?

आप उम्मीद कर सकते हैं कि हाई-टेक दिमाग, पुराने जमाने के जासूस को पछाड़ देगा क्योंकि यह अधिक जटिल और "स्मार्ट" है। लेकिन परिणाम चौंकाने वाले थे!

  • पुराना जमाने का जासूस (लॉजिस्टिक्स रिग्रेशन):

    • स्कोर: 97.26% सटीकता (accuracy)।
    • गति: यह अविश्वसनीय रूप से तेज़ था, इसने लगभग 12 सेकंड प्रति राउंड में अपना प्रशिक्षण पूरा किया।
    • निर्णय: यह बहुत मामूली अंतर से विजेता रहा।
  • हाई-टेक दिमाग (BiLSTM + Attention):

    • स्कोर: 97.24% सटीकता।
    • गति: इसे प्रशिक्षित करने में बहुत अधिक समय लगा और इसे चलाने के लिए एक शक्तिशाली कंप्यूटर (GPU) की आवश्यकता थी।
    • निर्णय: यह बहुत ही करीबी दूसरे स्थान पर आया, जो केवल 0.02% से पीछे रह गया।

इसका क्या अर्थ है? ("अहा!" क्षण)

लेखकों ने कुछ दिलचस्प पाया: कभी-कभी, एक सरल उपकरण जटिल उपकरण से बेहतर होता है।

क्योंकि समीक्षाएं छोटी थीं और "खुश" और "दुखी" के बीच का अंतर बहुत स्पष्ट था (डेटा "लीनियली सेपरेबल" था), सरल लॉजिस्टिक रिग्रेशन मॉडल को बहुत अधिक सोचने की आवश्यकता नहीं थी। उसे बस सही कीवर्ड्स को गिनने की आवश्यकता थी, और उसने वह बखूबी किया।

हाई-टेक दिमाग संदर्भ को समझने में उत्कृष्ट था और डेटा के संतुलन से भ्रमित नहीं हुआ, लेकिन यह ऐसा था जैसे किराने की दुकान तक जाने के लिए फेरारी का उपयोग करना। वह काम तो कर सकता था, लेकिन यह बहुत अधिक क्षमता वाला (overkill) था और इसमें बहुत अधिक ऊर्जा लगती थी।

मुख्य बात (The Bottom Line)

यदि आपके पास इंडोनेशियाई भाषा में छोटी उत्पाद समीक्षाओं का एक बड़ा ढेर है और आपको उन्हें जल्दी से छांटने की आवश्यकता है:

  • इसे बहुत जटिल न बनाएं। एक सरल, अच्छी तरह से तैयार किया गया मशीन लर्निंग मॉडल (जैसे लॉजिस्टिक रिग्रेशन) एक फैंसी डीप लर्निंग मॉडल के समान ही अच्छा है।
  • अपने संसाधनों को बचाएं। सरल मॉडल तेज़ है, चलाने में सस्ता है, और समझाने में आसान है।
  • "अटेंशन" तंत्र जटिल मॉडल में चीजों को संतुलित रखने के लिए बेहतरीन काम करता है, लेकिन इस विशिष्ट कार्य के लिए, सरल मॉडल पहले से ही प्रदर्शन की उच्चतम सीमा (ceiling) पर था।

संक्षेप में: इस विशिष्ट कार्य के लिए, सरल, तार्किक जासूस ने एक बाल के बराबर अंतर से हाई-टेक रोबोट को हरा दिया, जिससे यह साबित हुआ कि काम पूरा करने के लिए आपको हमेशा सबसे जटिल उपकरण की आवश्यकता नहीं होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →