← नवीनतम पेपर
💬 NLP

Benchmarking LightGBM and BiLSTM for Sentiment Analysis on Indonesian E-Commerce Reviews

यह अध्ययन एक इंडोनेशियाई ई-कॉमर्स सेंटीमेंट एनालिसिस डेटासेट पर मशीन लर्निंग और डीप लर्निंग दृष्टिकोणों का बेंचमार्किंग करता है, जिसमें यह पाया गया कि एक BiLSTM मॉडल 98.87% सटीकता के साथ LightGBM और अन्य ML एल्गोरिदम से बेहतर प्रदर्शन करता है, हालांकि LightGBM एक अत्यधिक कुशल विकल्प बना हुआ है।

मूल लेखक: Lidia Natasyah Marpaung, Vania Claresta, Iqfina Haula Halika, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

प्रकाशित 2026-05-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Lidia Natasyah Marpaung, Vania Claresta, Iqfina Haula Halika, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप इंडोनेशिया में एक विशाल ऑनलाइन स्टोर के मालिक हैं। हर दिन, हजारों ग्राहक आपके उत्पादों के बारे में समीक्षाएं (reviews) छोड़ते हैं। कुछ खुश हैं, कुछ नाराज हैं, और कुछ बस उदासीन हैं। लेकिन पेच यह है कि इंडोनेशियाई इंटरनेट स्लैंग (slang) बहुत उलझा हुआ है। लोग भाषाएं मिलाते हैं, संक्षिप्त शब्दों का उपयोग करते हैं, और कभी-कभी इसका उल्टा कहते हैं जो वे वास्तव में महसूस कर रहे हैं (जैसे कि कहना "बहुत बढ़िया, आपने मुझे धोखा दिया!" जब वे वास्तव में बहुत क्रोधित होते हैं)।

आपको एक कंप्यूटर प्रोग्राम की आवश्यकता है जो इन हजारों समीक्षाओं को पढ़े और उन्हें तीन ढेरों में वर्गीकृत करे: खुश (Happy), दुखी (Sad), या औसत (Meh)

यह पेपर दो अलग-अलग प्रकार के कंप्यूटर दिमागों के बीच एक "दौड़" है जो इस छंटनी के काम को करने की कोशिश कर रहे हैं।

दो प्रतियोगी

1. द स्पीडी स्काउट (मशीन लर्निंग / LightGBM)
इस दृष्टिकोण को एक बहुत ही तेज़, कुशल स्काउट के रूप में सोचें। यह PyCaret नामक एक टूल का उपयोग करता है (जो एक स्मार्ट सहायक की तरह है जो आपके लिए सर्वोत्तम नियम खुद चुनता है)।

  • यह कैसे काम करता है: यह समीक्षाओं को देखता है और इस बात की गिनती करता है कि कुछ शब्द कितनी बार आते हैं। यह एक लाइब्रेरियन की तरह है जो जानता है कि यदि "टूटा हुआ" (broken) शब्द आता है, तो समीक्षा संभवतः नकारात्मक है। यह LightGBM (एक प्रकार का निर्णय लेने वाला पेड़/decision-making tree) नामक एक विशिष्ट एल्गोरिदम का उपयोग करता है।
  • उपमा: एक जासूस की कल्पना करें जिसके पास एक चेकलिस्ट है। यदि वह "बुरा" देखता है, तो वह उसे नकारात्मक के रूप में चिह्नित करता है। यदि वह "अच्छा" देखता है, तो वह उसे सकारात्मक के रूप में चिह्नित करता है। यह अविश्वसनीय रूप से तेज़ है और इसे शब्दों के क्रम पर गहराई से सोचने की आवश्यकता नहीं होती है।

2. द कॉन्टेक्स्टुअल रीडर (डीप लर्निंग / BiLSTM)
इसे एक विचारशील, द्विभाषी पाठक के रूप में सोचें जो हर वाक्य को दो बार पढ़ता है।

  • यह कैसे काम करता है: यह एक BiLSTM (बाइडायरेक्शनल लॉन्ग शॉर्ट-टर्म मेमोरी) का उपयोग करता है। "Bi" का अर्थ है कि यह वाक्य को बाएँ-से-दाएँ और दाएँ-से-बाएँ दोनों दिशाओं में एक साथ पढ़ता है।
  • उपमा: एक व्यंग्यात्मक मजाक पढ़ने की कल्पना करें। यदि आप केवल आधा हिस्सा पढ़ते हैं, तो आप सोच सकते हैं कि यह एक प्रशंसा है। लेकिन यदि आप पूरा वाक्य पढ़ते हैं और शुरुआत की ओर देखते हैं, तो आपको एहसास होता है, "ओह, वे व्यंग्य कर रहे थे!" BiLSTM एक ऐसे पाठक की तरह है जो समझता है कि वाक्य के अंत में आया "great" शब्द वाक्य की शुरुआत में आए "terrible" शब्द का अर्थ बदल देता है। यह वाक्य की 'कहानी' को समझता है, न कि केवल व्यक्तिगत शब्दों को।

दौड़ के परिणाम

शोधकर्ताओं ने दोनों कंप्यूटरों को 15,000 वास्तविक इंडोनेशियाई ई-कॉमर्स समीक्षाओं का डेटासेट दिया। यहाँ उनका प्रदर्शन दिया गया है:

  • द स्पीडी स्काउट (LightGBM):

    • गति (Speed): यह बिजली की तरह तेज़ था। इसने पूरी ट्रेनिंग प्रक्रिया लगभग 5 सेकंड में पूरी कर ली।
    • सटीकता (Accuracy): इसने लगभग 98.2% समीक्षाओं को सही पहचाना।
    • निर्णय: यह एक शानदार, कुशल कार्यकर्ता है। यदि आपको समीक्षाओं को तुरंत छांटने की आवश्यकता है, तो यह एक बेहतरीन विकल्प है।
  • द कॉन्टेक्स्टुअल रीडर (BiLSTM):

    • गति (Speed): इसे थोड़ा अधिक समय लगा, लगभग 3.7 मिनट ट्रेनिंग में।
    • सटीकता (Accuracy): इसने लगभग 98.9% समीक्षाओं को सही पहचाना।
    • निर्णय: यह विजेता रहा। क्योंकि यह संदर्भ (context) को पढ़ सकता था और व्यंग्य को बेहतर समझ सकता था, इसने कम गलतियाँ कीं।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि जबकि "स्पीडी स्काउट" (LightGBM) अपनी गति के लिए प्रभावशाली है, "कॉन्टेक्स्टुअल रीडर" (BiLSTM) इस विशिष्ट कार्य के लिए असली चैंपियन है।

क्यों? क्योंकि इंडोनेशियाई समीक्षाएं पेचीदा होती हैं। वे स्लैंग, मिश्रित भाषाओं और व्यंग्य से भरी होती हैं। BiLSTM की दोनों दिशाओं में पूरे वाक्य को देखने की क्षमता ने इसे उन सूक्ष्म बारीकियों को पकड़ने में मदद की जिन्हें तेज़ मॉडल मिस कर गया था।

सरल शब्दों में: यदि आप एक ऐसा रोबोट चाहते हैं जो समीक्षाओं को तुरंत छाँट दे, तो पहले वाले का उपयोग करें। लेकिन यदि आप एक ऐसा रोबोट चाहते है जो शब्दों के पीछे की वास्तविक भावना को समझ सके—भले ही ग्राहक व्यंग्य कर रहा हो—तो दूसरे वाले का उपयोग करें। शोधकर्ताओं ने साबित कर दिया कि इंडोनेशियाई ई-कॉमर्स के लिए, "कॉन्टेक्स्टुअल रीडर" सबसे अच्छा उपकरण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →