← नवीनतम पेपर
💬 NLP

PromotionGo at SemEval-2025 Task 11: A Feature-Centric Framework for Cross-Lingual Multi-Emotion Detection in Short Texts

यह शोध पत्र लघु ग्रंथों में क्रॉस-लिंगुअल बहु-भावना पहचान के लिए एक स्केलेबल, फीचर-केंद्रित ढांचे को प्रस्तुत करता है जो 28 भाषाओं में दस्तावेज़ निरूपण और शिक्षण एल्गोरिदम को गतिशील रूप से अनुकूलित करता है, यह प्रदर्शित करते हुए कि TF-IDF कम-संसाधन सेटिंग्स में उत्कृष्ट है जबकि कॉन्टेक्स्टुअल एम्बेडिंग्स और PCA-उन्नत न्यूरल मॉडल विविध भाषाई संदर्भों के लिए अनुकूलित प्रदर्शन और दक्षता प्रदान करते हैं।

मूल लेखक: Ziyi Huang, Xia Cui

प्रकाशित 2026-02-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyi Huang, Xia Cui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप 28 अलग-अलग भाषाएँ बोलने वाले लोगों से भरे कमरे के मिजाज (mood) को समझने की कोशिश कर रहे हैं। कुछ फुसफुसा रहे हैं, कुछ चिल्ला रहे हैं, और कई लोग एक साथ कई भावनाओं का मिश्रण महसूस कर रहे हैं—जैसे कि खुश और हैरान दोनों होना। यही वह चुनौती थी जिसे PromotionGo टीम ने SemilEval-2025 Task 11 प्रतियोगिता के लिए हल किया। उनका लक्ष्य एक ऐसा कंप्यूटर सिस्टम बनाना था जो इन कई भाषाओं में छोटे टेक्स्ट संदेशों को पढ़ सके और सही ढंग से पहचान सके कि कौन सी भावनाएँ मौजूद हैं, भले ही कई भावनाएँ आपस में मिली हुई हों।

यहाँ उन्होंने इसे कैसे किया, इसे सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. मुख्य समस्या: एक लेबल काफी नहीं है

पारंपरिक भावना डिटेक्टर एक सख्त शिक्षक की तरह होते हैं जो छात्र को पूरे दिन के लिए केवल एक भावना चुनने के लिए मजबूर करता है: "क्या आप खुश हैं, दुखी हैं, या क्रोधित हैं?" लेकिन वास्तविक जीवन अधिक जटिल है। आप पदोन्नति (promotion) से आनंदित हो सकते हैं लेकिन नई जिम्मेदारी को लेकर डरे हुए भी हो सकते हैं। टीम का सिस्टम इस "मिश्रित थैले" (mixed bag) को संभालने के लिए डिज़ाइन किया गया है, जो यह पहचानता है कि एक वाक्य में एक साथ कई भावनाएं हो सकती हैं।

2. तीन-चरणीय रेसिपी

टीम ने एक "फीचर-सेंट्रिक फ्रेमवर्क" बनाया, जो बस एक फैंसी तरीका है यह कहने का कि उन्होंने एक मॉड्यूलर किचन बनाया जहाँ वे यह देखने के लिए सामग्री बदल सकते थे कि प्रत्येक भाषा के लिए सबसे अच्छा व्यंजन क्या बनेगा। उनकी रेसिपी में तीन मुख्य चरण थे:

चरण A: शब्दों को नंबरों में बदलना (डॉक्यूमेंट रिप्रेजेंटेशन)

कंप्यूटर शब्द नहीं पढ़ सकते; वे केवल नंबर समझते हैं। टीम ने टेक्स्ट को नंबरों में बदलने के तीन अलग-अलग तरीके आजमाए:

  • "शब्द गणना" विधि (TF-IDF): कल्पना कीजिए कि आप किसी टेक्स्ट में विशिष्ट शब्दों के कितनी बार आने की गिनती कर रहे हैं, लेकिन आप "the" या "and" जैसे सामान्य शब्दों को अनदेखा कर देते हैं क्योंकि वे बहुत अधिक भावना व्यक्त नहीं करते। यह एक साधारण टैली शीट का उपयोग करने जैसा है। टीम ने पाया कि यह आश्चर्यजनक रूप से प्रभावी था, विशेष रूप से उन भाषाओं के लिए जिनके पास प्रशिक्षण डेटा कम था (लो-रिसोर्स भाषाएं)। यह एक भरोसेमंद, पुराने तरीके का उपकरण है जो तब अच्छा काम करता है जब आपके पास विशाल लाइब्रेरी न हो।
  • "संदर्भगत शब्दकोश" विधि (FastText और BPE): यह कंप्यूटर को एक ऐसा शब्दकोश देने जैसा है जो न केवल यह जानता है कि एक शब्द का क्या अर्थ है, बल्कि यह भी कि उसके हिस्से एक साथ कैसे फिट होते हैं। यह उस शब्द का अर्थ भी अनुमान लगा सकता है जिसे उसने पहले कभी नहीं देखा है, इसके छोटे हिस्सों को देखकर (जैसे "unhappiness" को पहचानना भले ही वह केवल "happy" और "un-" को जानता हो)।
  • "गहरी समझ" विधि (Sentence-BERT): यह "सबसे स्मार्ट" उपकरण है। यह एक बहुभाषी (polyglot) की तरह है जो एक वाक्य को पढ़ता है और केवल व्यक्तिगत शब्दों को ही नहीं, बल्कि उसके 'वाइब' और संदर्भ को भी समझता है। यह अंतर बता सकता है कि "मैं इतना खुश हूँ कि चिल्ला सकूँ!" और "मैं इतना गुस्से में हूँ कि चिल्ला सकूँ!" के बीच, भले ही शब्द समान हों। हालांकि, यह टूल भारी है और कभी-कभी उन भाषाओं के साथ संघर्ष करता है जिन पर इसे विशेष रूप से प्रशिक्षित नहीं किया गया है।

आश्चर्य: अध्ययन की कई भाषाओं के लिए, सरल "शब्द गणना" विधि (TF-IDF) वास्तव में सुपर-स्मार्ट "गहरी समझ" विधि की तुलना में बेहतर काम कर रही थी। यह पता चला कि कुछ भाषाओं के लिए, शब्दों को गिनना गहरे संदर्भ का अनुमान लगाने से अधिक विश्वसनीय है।

चरण B: गड़बड़ी को साफ करना (डायमेंशनलिटी रिडक्शन)

कभी-कभी कंप्यूटर बहुत अधिक जानकारी से अभिभूत (overwhelmed) हो जाता है। कल्पना कीजिए कि आप एक लाइब्रेरी में एक विशिष्ट पुस्तक खोजने की कोशिश कर रहे हैं जहाँ हर एक किताब एक विशाल, अराजक ढेर में रखी है।
टीम ने PCA (प्रिंसिपल कंपोनेंट एनालिसिस) नामक तकनीक का उपयोग किया। इसे एक स्मार्ट लाइब्रेरियन के रूप में सोचें जो तेजी से किताबों को छाँटता है, डुप्लिकेट और उन चीजों को फेंक देता है जो महत्वपूर्ण नहीं हैं, जिससे आपके पास एक व्यवस्थित शेल्फ बचता है।

  • परिणाम: इसने कंप्यूटर को अनिवार्य रूप से स्मार्टर तो नहीं बनाया, लेकिन इसे बहुत तेज़ बना दिया। इसने जटिल मॉडलों के लिए प्रशिक्षण समय को कम कर दिया, बिना उनकी सटीकता को नुकसान पहुँचाए।

चरण C: अंतिम निर्णायक (मॉडल ट्रेनिंग)

एक बार जब टेक्स्ट को बदला और साफ कर लिया गया, तो टीम को भावनाओं का निर्णय लेने के लिए एक "जज" की आवश्यकता थी। उन्होंने अलग-अलग जज आजमाए:

  • "सोलो एक्ट" (डिसीजन ट्री): एक सरल जज जो फ्लोचार्ट के आधार पर त्वरित निर्णय लेता है। तेज़, लेकिन कभी-कभी बारीकियों को चूक जाता है।
  • "जजों का पैनल" (वोटिंग क्लासिफायर): विभिन्न जजों (जैसे डिसीजन ट्री, रैंडम फॉरेस्ट और K-नियरेस्ट नेबर) का एक समूह जो उत्तर पर वोट करता है। यह एक एकल जज की तुलना में अधिक स्थिर और विश्वसनीय है।
  • "गहरा विचारक" (MLP): एक न्यूरल नेटवर्क जो जटिल पैटर्न सीखता है। यह विजेता था। यह सूक्ष्म, मिश्रित भावनाओं को पहचानने में सबसे अच्छा था, हालांकि इसे "पढ़ने" (ट्रेन होने) में सबसे अधिक समय लगा।

3. उन्होंने जो बड़ी चुनौतियाँ पाईं

  • "असंतुलन" की समस्या: उनके डेटा में, कुछ भावनाएं (जैसे "गुस्सा नहीं") अन्य भावनाओं (जैसे "डर") की तुलना में बहुत अधिक बार दिखाई दीं। यह एक ऐसी कक्षा की तरह है जहाँ 90% छात्र शांत हैं और केवल 10% चिल्ला रहे हैं। कंप्यूटर शांत छात्रों को पहचानने में बहुत अच्छा हो गया लेकिन चिल्लाने वालों को पहचानने में संघर्ष करता रहा। इसके कारण सामान्य भावनाओं के लिए उच्च सटीकता मिली लेकिन दुर्लभ भावनाओं के लिए कम सटीकता।
  • "अनदेखी भाषा" का तरीका: उन भाषाओं के लिए जिन्हें कंप्यूटर ने पहले कभी नहीं देखा था (जैसे ओरोमो), उन्होंने एक चतुर हैक का उपयोग किया। उन्होंने एक बड़े AI मॉडल से एक "कजिन" (सहोदर) भाषा खोजने के लिए कहा जिसे कंप्यूटर जानता था, और फिर उस कजिन भाषा के शब्दकोश का उपयोग करके नई भाषा को समझने के लिए किया। यह एक स्पेनिश शब्दकोश का उपयोग करके पुर्तगाली शब्द का अर्थ समझने जैसा है क्योंकि दोनों भाषाएं संबंधित हैं।

4. निष्कर्ष

PromotionGo सिस्टम ने साबित कर दिया कि भावना पहचान (emotion detection) के लिए कोई "एक आकार सभी के लिए उपयुक्त" (one-size-fits-all) समाधान नहीं है।

  • कुछ भाषाओं के लिए, सरल, तेज़ उपकरण (TF-IDF) विजेता हैं।
  • दूसरों के लिए, जटिल, गहरे उपकरण (Sentence-BERT + MLP) आवश्यक हैं।
  • गति बनाम बुद्धिमत्ता: आपको चुनना होगा। यदि आपको तत्काल परिणाम चाहिए, तो सरल उपकरणों का उपयोग करें। यदि आपको उच्चतम संभव सटीकता चाहिए और आप थोड़ा अधिक समय तक कंप्यूटर के "सोचने" का इंतज़ार कर सकते हैं, तो डीप लर्निंग मॉडल्स का उपयोग करें।

टीम का फ्रेमवर्क एक स्विस आर्मी नाइफ की तरह है: यह केवल एक ब्लेड पर निर्भर नहीं है। इसके बजाय, यह गतिशील रूप से प्रत्येक विशिष्ट भाषा के लिए सही उपकरण (रिप्रेजेंटेशन), कार्यक्षेत्र को साफ करता है (डायमेंशनलिटी रिडक्शन), और सर्वश्रेष्ठ जज (मॉडल) चुनता है, जिससे यह सुनिश्चित होता है कि सिस्टम एक विविध, वैश्विक दर्शकों के लिए अच्छी तरह से काम करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →