← नवीनतम पेपर
💻 computer science

How Annotator Agreement Affects Sentiment Classification Performance for Indonesian Coastal Tourism Reviews

यह अध्ययन प्रदर्शित करता है कि इंडोनेशियाई तटीय पर्यटन समीक्षाओं के एक बड़े, बहुमत-मत वाले डेटासेट पर सेंटीमेंट क्लासिफायर को प्रशिक्षित करने से सख्त सर्वसम्मत-आम सहमति वाले डेटासेट की तुलना में उच्च प्रदर्शन प्राप्त होता है, हालांकि परिणाम यह सुझाव देते हैं कि अस्पष्ट उदाहरणों को बनाए रखने के बजाय डेटा की बढ़ी हुई मात्रा और वर्ग संतुलन सुधार के प्राथमिक चालक हो सकते हैं जबकि इंडोबर्ट (IndoBERT) तटस्थ समीक्षाओं के व्यवस्थित गलत वर्गीकरण को प्रभावी ढंग से कम करता है।

मूल लेखक: Sandy Kurniawan, Henri Tantyoko, Khadijah Khadijah, Helmie Arif Wibawa

प्रकाशित 2026-08-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sandy Kurniawan, Henri Tantyoko, Khadijah Khadijah, Helmie Arif Wibawa

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल युग में, यात्री की आवाज़ मानवीय राय का एक विशाल, असंरचित पुस्तकालय बन गई है। लाखों लोग समुद्र तटों, होटलों और रेस्तरां के बारे में समीक्षाएं लिखते हैं, अपनी आशाओं, निराशाओं और टिप्पणियों को ऐसे टेक्स्ट में उंडेलते हैं जो अक्सर अनौपचारिक, स्लैंग से भरे और गहराई से सूक्ष्म होते हैं। व्यवसायों और शोधकर्ताओं के लिए, इस बाढ़ को समझना एक चुनौती है। उन्हें न केवल यह जानने की आवश्यकता है कि कोई समीक्षा अच्छी है या बुरी, बल्कि यह भी कि लेखक वास्तव में कैसा महसूस कर रहा है। यह सेंटीमेंट एनालिसिस (भावना विश्लेषण) का क्षेत्र है, जो कंप्यूटर विज्ञान की एक शाखा है जो मशीनों को भावनाएं पढ़ना सिखाती है। वर्षों से, मानक दृष्टिकोण यह रहा है कि इन समीक्षाओं को "सकारात्मक," "नकारात्मक," या "तटस्थ" जैसे सरल श्रेणियों के साथ मनुष्यों द्वारा लेबल कराया जाए, और फिर कंप्यूटर को उन पैटर्न को पहचानने के लिए प्रशिक्षित किया जाए। हालाँकि, मानवीय निर्णय शायद ही कभी पूर्ण होते हैं। जब तीन लोग एक ही समीक्षा को पढ़ते हैं, तो वे इस बात पर असहमत हो सकते हैं कि क्या वह वास्तव में तटस्थ है या थोड़ा नकारात्मक। यह असहमति वैज्ञानिकों के लिए एक पहेली पैदा करती है: क्या उन्हें केवल उन्हीं समीक्षाओं को रखने के लिए भ्रमित करने वाली समीक्षाओं को फेंक देना चाहिए जिन पर सभी सहमत हों, या उन्हें उन उलझे हुए, विवादित मामलों को रखना चाहिए ताकि कंप्यूटर को सीखने के लिए अधिक उदाहरण मिल सकें?

इंडोनेशिया के डिपोनेगोरो विश्वविद्यालय के शोधकर्ताओं ने तटीय पर्यटन स्थलों की समीक्षाओं का उपयोग करके इस विशिष्ट पहेली को हल करने का प्रयास किया। उन्होंने इंडोनेशियाई भाषा पर ध्यान केंद्रित किया, जो अनौपचारिक अभिव्यक्तियों और क्षेत्रीय विविधताओं से समृद्ध है, जो इसे कंप्यूटर के लिए एक विशेष रूप से कठिन परीक्षण मामला बनाती है। शोधकर्ताओं ने पूरे द्वीप समूह के समुद्र तटों को कवर करने वाले गूगल मैप्स से लाखों सार्वजनिक समीक्षाएं एकत्र कीं। डेटा को साफ करने और डुप्लिकेट या गैर-इंडोनेशियाई टेक्स्ट को फ़िल्टर करने के बाद, उन्होंने लगभग 22,000 समीक्षाओं का एक संतुलित नमूना चुना जिसे तीन मानव एनोटेटरों द्वारा पढ़ा जाना था। प्रत्येक व्यक्ति ने स्वतंत्र रूप से निर्णय लिया कि एक समीक्षा सकारात्मक, नकारात्मक या तटस्थ थी। इस प्रक्रिया ने एक स्वाभाविक वास्तविकता को प्रकट किया: मनुष्य हमेशा सहमत नहीं होते थे। कुछ समीक्षाएं इतनी स्पष्ट थीं कि तीनों एनोटेटरों ने एक ही लेबल चुना, जबकि अन्य इतनी अस्पष्ट थीं कि दो सहमत थे और एक असहमत था, या जहाँ तीनों ने अलग-अलग विकल्प चुने थे।

शोधकर्ताओं ने फिर अपने डेटा को दो अलग-अलग समूहों में विभाजित किया ताकि यह देखा जा सके कि इस असहमति ने कंप्यूटर की सीखने की प्रक्रिया को कैसे प्रभावित किया। पहले समूह में, जिसे उन्होंने "यूनिमस" (सर्वसम्मत) सेट कहा, केवल वे समीक्षाएं शामिल थीं जहाँ तीनों मनुष्य सहमत थे। यह 15,527 समीक्षाओं का एक छोटा, स्वच्छ संग्रह था, लेकिन इसमें पेचीदा, अस्पष्ट मामले गायब थे। दूसरे समूह में, जिसे उन्होंने "मेजोरिटी" (बहुमत) सेट कहा, सर्वसम्मत समीक्षाओं को रखा गया और साथ ही उन समीक्षाओं को भी जोड़ा गया जहाँ तीन में से दो मनुष्य सहमत थे। इस बड़े सेट में 21,235 समीक्षाएं शामिल थीं और इसमें कई अधिक तटस्थ, मिश्रित-भावना वाले, या भ्रमित करने वाले टेक्स्ट शामिल थे जो अक्सर कंप्यूटर को उलझा देते हैं। इसके बाद उन्होंने इन दो समूहों पर तीन अलग-अलग प्रकार के कंप्यूटर प्रोग्राम प्रशिक्षित किए। दो प्रोग्रामों ने पुराने, पारंपरिक तरीकों का उपयोग किया जो शब्द आवृत्तियों (word frequencies) को देखते हैं, जबकि तीसरे ने इंडोबर्ट (IndoBERT) नामक एक आधुनिक, उन्नत प्रणाली का उपयोग किया, जो इंडोनेशियाई भाषा में शब्दों के संदर्भ और संबंधों को समझने के लिए डिज़ाइन की गई है, ठीक वैसे ही जैसे एक मानव पाठक करता है।

परिणाम स्पष्ट और कुछ हद तक आश्चर्यजनक थे। इस विचार के विपरीत कि एक कंप्यूटर केवल पूरी तरह से सहमत उदाहरणों से सबसे अच्छा सीखता है, प्रत्येक प्रोग्राम ने बड़े, अधिक उलझे हुए समूह पर प्रशिक्षित होने पर बेहतर प्रदर्शन किया जिसमें विवादित समीक्षाएं भी शामिल थीं। सबसे उन्नत प्रणाली, इंडोबर्ट ने यूनिमस समूह की तुलना में मेजोरिटी-वोट समूह से सीखने पर उच्च स्कोर प्राप्त किया। यह सुझाव देता है कि पूर्ण सहमति सुनिश्चित करने के लिए अस्पष्ट समीक्षाओं को फेंक देने से, शोधकर्ता वास्तव में मूल्यवान सबक खो रहे थे। विवादित समीक्षाओं में अक्सर वे जटिल, मिश्रित भावनाएं होती हैं जो वास्तविक यात्री व्यक्त करते हैं, और इन उदाहरणों की अधिक उपलब्धता ने कंप्यूटर को मानवीय भावनाओं की पूरी सीमा को समझने में मदद की। अध्ययन में पाया गया कि सबसे बड़ा सुधार "तटस्थ" समीक्षाओं को सही ढंग से पहचानने की क्षमता में आया। जब कंप्यूटर को केवल स्वच्छ, सर्वसम्मत डेटा पर प्रशिक्षित किया गया, तो उसे वास्तव में तटस्थ समीक्षा और थोड़ी सकारात्मक या नकारात्मक समीक्षा के बीच अंतर करने में संघर्ष करना पड़ा। लेकिन जब इसे मेजोरिटी-वोट डेटा के साथ अध्ययन करने की अनुमति दी गई, जिसमें तटस्थ मामलों के बहुत अधिक उदाहरण थे, तो यह उन्हें पहचानने में बहुत बेहतर हो गया।

हालाँकि, शोधकर्ता इस बात पर सावधानीपूर्वक ध्यान दिलाना चाहते थे कि यह सुधार केवल असहमति के कारण नहीं हो सकता है। बड़े समूह में स्वाभाविक रूप से अधिक डेटा और तटस्थ उदाहरणों का बेहतर संतुलन था, जो स्पष्ट-कट सकारात्मक या नकारात्मक उदाहरणों की तुलना में ढूंढना कठिन होता है। अध्ययन ने यह साबित नहीं किया कि असहमति अपने आप में अच्छी है, बल्कि यह कि इसे फ़िल्टर करना बहुत सारी उपयोगी जानकारी को हटा देता है। कंप्यूटर अभी भी कुछ प्रकार के जटिल लेखन के साथ संघर्ष कर रहा था, जैसे कि ऐसी समीक्षाएं जो समुद्र तट के एक हिस्से की प्रशंसा करती थीं और दूसरे की आलोचना करती थीं, या वे जो निराशा व्यक्त करने के लिए सूक्ष्म, अप्रत्यक्ष भाषा का उपयोग करती थीं। ये कठिन मामले सबसे उन्नत मॉडल के लिए भी एक चुनौती बने रहे। अंततः, यह कार्य सुझाव देता है कि मानवीय भाषा की उलझी हुई दुनिया में, कंप्यूटर को यात्री की आवाज़ की बारीकियों को वास्तव में समझने के लिए प्रशिक्षित करने हेतु प्रशिक्षण डेटा में थोड़ी असहमति आवश्यक हो सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →