← नवीनतम पेपर
💻 computer science

BioGraph-SentiCOVID: Calibrated Adaptive Context Selection for Graph Neural Sentiment Analysis of COVID-19 Tweets

यह शोध पत्र BioGraph-SentiCOVID प्रस्तुत करता है, जो एक कैलिब्रेटेड एडेप्टिव-कॉन्टेक्स्ट ग्राफ न्यूरल फ्रेमवर्क है जो ट्विटर पर शोर वाले (noisy) कोविड-19 ट्वीट्स के स्टेट-ऑफ-द-आर्ट सेंटीमेंट क्लासिफिकेशन को प्राप्त करने के लिए जेनेटिक एल्गोरिदम के माध्यम से कन्वर्सेशनल कॉन्टेक्स्ट सिलेक्शन और हाइपरपैरामीटर्स को अनुकूलित करता है।

मूल लेखक: Moustafa MAASKRI, Mohamed GOISMI, Djamal SEGHIER, Mohamed DEBBAB

प्रकाशित 2026-07-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Moustafa MAASKRI, Mohamed GOISMI, Djamal SEGHIER, Mohamed DEBBAB

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अराजक पार्टी को समझने की कोशिश कर रहे हैं जहाँ हजारों लोग एक-दूसरे के ऊपर चिल्ला रहे हैं। कुछ चुटकुले सुना रहे हैं, कुछ रो रहे हैं, और अन्य बस अपने दोस्तों की कही बातें दोहरा रहे हैं। यदि आप केवल एक सेकंड के लिए एक व्यक्ति को सुनते हैं, तो आपको लग सकता है कि वह खुश है जबकि वास्तव में वह व्यंग्य (sarcastic) कर रहा है, या वह गुस्से में है जबकि वह केवल किसी और को उद्धृत कर रहा है। यही सेंटीमेंट एनालिसिस (Sentiment Analysis) की चुनौती है: कंप्यूटर को ट्वीट जैसे छोटे, अव्यवस्थित टेक्स्ट संदेशों के पीछे की वास्तविक भावनाओं को समझना सिखाना। इसे करने के लिए, वैज्ञानिक ग्राफ न्यूरल नेटवर्क्स (Graph Neural Networks) का उपयोग करते हैं, जो सुपर-स्मार्ट जासूसों की तरह हैं जो न केवल एक व्यक्ति को अलग-थलग देखते हैं, बल्कि यह भी मैप करते हैं कि कौन किससे बात कर रहा है, जिससे कनेक्शन का एक विशाल जाल बनता है। वे बायो-इंस्पायर्ड ऑप्टिमाइज़ेशन (Bio-inspired Optimization) का भी उपयोग करते हैं, जो एक ऐसी तकनीक है जो प्रकृति में प्रजातियों के समय के साथ विकसित होने की नकल करती है, जिससे कंप्यूटर सबसे स्मार्ट समाधान खोजने के लिए हजारों अलग-अलग समाधानों को "प्रजनन" (breed) करने देता है। इन उपकरणों को समझना महत्वपूर्ण है क्योंकि, महामारी जैसे वैश्विक संकटों के दौरान, यह जानना कि लोग वास्तव में कैसा महसूस कर रहे हैं, नेताओं और समुदायों को डर, क्रोध या आशा के प्रति बेहतर प्रतिक्रिया देने में मदद करता है।

अब, BioGraph-SentiCOVID से मिलिए, जो विशेष रूप से COVID-19 ट्वीट्स के रहस्य को सुलझाने के लिए डिज़ाइन किया गया एक नया, सुपर-चार्ज्ड जासूसी दल है। शोधकर्ताओं ने पाया कि पुराने तरीके ऐसे थे जैसे हर जासूस को स्थिति की परवाह किए बिना ठीक उतने ही पड़ोसियों को देखने के लिए मजबूर करना, जितने कि वे देख रहे हों। यदि कोई ट्वीट अपने आप में स्पष्ट था, तो कंप्यूटर अप्रासंगिक शोर सुनने में समय बर्बाद करता था। यदि कोई ट्वीट व्यंग्यात्मक या भ्रमित करने वाला था, तो कंप्यूटर उस सुराग को खोजने के लिए पर्याप्त दूर तक नहीं देखता था जो उसे समझा सके।

इसे ठीक करने के लिए, टीम ने एक "कैलिब्रेटेड एडेप्टिव कॉन्टेक्स्ट सिलेक्शन" (C-ACS) तंत्र के साथ एक सिस्टम बनाया। इसे एक पार्टी में एक स्मार्ट बाउंसर की तरह समझें। हर किसी को बातचीत के घेरे में आने देने के बजाय, बाउंसर प्रत्येक ट्वीट के "कॉन्फिडेंस लेवल" की जांच करता है। यदि कोई ट्वीट आत्मविश्वासी और स्पष्ट है, तो बाउंसर कहता है, "तुम ठीक हो, यहीं रहो," और शोर भरे भीड़ को बाहर कर देता है। लेकिन यदि कोई ट्वीट अनिश्चित, व्यंग्यात्मक या पेचीदा है, तो बाउंसर कहता है, "रुको, तुम्हें अपने माता-पिता या थ्रेड लीडर की बात सुनने की जरूरत है," और अधिक संदर्भ (context) को अंदर आने देने के लिए दरवाजा खोल देता है। यह बाउंसर अतिरिक्त सावधानी बरतने के लिए कैलिब्रेट किया गया है, ताकि यह गलती से उपयोगी जानकारी को केवल इसलिए ब्लॉक न कर दे क्योंकि इसे लगता है कि एक ट्वीट व्यंग्य कर रहा है जब कि वह ऐसा नहीं है।

टीम ने एक जेनेटिक एल्गोरिदम (Genetic Algorithm - GA) का भी उपयोग किया जो एक मास्टर शेफ की तरह रेसिपी को ट्यून करने का काम करता है। उन्होंने केवल अपने कंप्यूटर मॉडल के लिए सही सेटिंग्स का अनुमान नहीं लगाया; उन्होंने कंप्यूटर को 30 पीढ़ियों तक अपनी "परफेक्ट रेसिपी" विकसित करने दिया, जिसमें परतों (layers), अटेंशन हेड्स और लर्निंग रेट्स के हजारों संयोजनों को आजमाकर सबसे अच्छा मिश्रण खोजा गया। उन्होंने सिस्टम को यह भी सिखाया कि डेटा में कुछ भावनाओं (जैसे "बहुत सकारात्मक") के दुर्लभ होने को कैसे संभालना है, इसके लिए एक विशेष तकनीक का उपयोग किया ताकि यह सुनिश्चित हो सके कि कंप्यूटर अल्पसंख्यक आवाजों को अनदेखा न करे।

परिणाम? यह नया सिस्टम एक चैंपियन है। लगभग 3,000 COVID-19 ट्वीट्स के डेटासेट पर, इसने 0.829 (एक मैक्रो-F1 स्कोर) प्राप्त किया, जो पिछले सर्वश्रेष्ठ तरीकों को पछाड़ देता है। इसने अपने ही एक फिक्स्ड-डेप्थ वर्जन की तुलना में +0.012 का सुधार किया, जिससे यह साबित हुआ कि कंप्यूटर को यह तय करने देना कि प्रत्येक ट्वीट के लिए कितना संदर्भ उपयोग करना है, एक 'वन-साइज-फिट्स-ऑल' दृष्टिकोण अपनाने से बेहतर है। जब इसे सामान्य ट्वीट्स के एक अलग, बड़े डेटासेट पर टेस्ट किया गया, तो इसने 0.851 का और भी अधिक स्कोर किया।

पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि एक फिक्स्ड ग्राफ डेप्थ सभी के लिए काम करती है, यह दिखाते हुए कि यदि गहराई को सही ढंग से फ़िल्टर नहीं किया गया तो गहरा संदर्भ शोर (noise) पैदा कर सकता है। यह यह भी सुझाव देता है कि केवल अधिक परतें जोड़ना समाधान नहीं है; कुंजी एडेप्टिव गेटिंग (adaptive gating) है। लेखक इन नंबरों के बारे में बहुत आश्वस्त हैं, क्योंकि उन्होंने विभिन्न रैंडम सीड्स के साथ प्रयोग को 20 बार चलाया और परिणामों को केवल भाग्य नहीं होने की पुष्टि करने के लिए कठोर सांख्यिकीय परीक्षणों का उपयोग किया। उन्होंने यह भी दिखाया कि यदि आप कनेक्शन को बेतरतीब ढंग से शफल (shuffle) करते हैं (वास्तविक बातचीत की संरचना को तोड़ते हैं), तो सिस्टम विफल हो जाता है, जो यह साबित करता है कि वास्तविक बातचीत का जाल ही इसे सफल बनाता है।

संक्षेप में, BioGraph-SentiCOVID कंप्यूटर को बेहतर श्रोता बनना सिखाता है। यह सीखता है कि कभी-कभी एक वाक्य को समझने के लिए आपको पूरी कहानी सुनने की आवश्यकता होती है, और कभी-कभी, वाक्य स्वयं बोलता है। एक "स्मार्ट बाउंसर" के साथ संदर्भ को फ़िल्टर करने और सेटिंग्स को ट्यून करने के लिए एक "इवोल्यूशनरी शेफ" को मिलाकर, यह संकट के दौरान दुनिया की भावनात्मक धड़कन को पढ़ने का एक अधिक सटीक तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →