← नवीनतम पेपर
💬 NLP

SwanNLP at SemEval-2026 Task 5: An LLM-based Framework for Plausibility Scoring in Narrative Word Sense Disambiguation

स्वानएनएलपी (SwanNLP) टीम ने सेमेव-2026 टास्क 5 (SemEval-2026 Task 5) के लिए एक एलएलएम-आधारित (LLM-based) ढांचे का प्रस्ताव दिया है जो नैरेटिव टेक्स्ट में शब्द अर्थों की मानव-अनुभूत संभाव्यता (human-perceived plausibility) की प्रभावी ढंग से भविष्यवाणी करने के लिए संरचित तर्क (structured reasoning), गतिशील फ्यू-शॉट प्रॉम्प्टिंग (dynamic few-shot prompting) और मॉडल एंसेम्बलिंग (model ensembling) का उपयोग करता है, यह प्रदर्शित करते हुए कि वाणिज्यिक बड़े-पैरामीटर वाले मॉडल मानव निर्णयों की बारीकी से नकल करते हैं।

मूल लेखक: Deshan Sumanathilaka, Nicholas Micallef, Julian Hough, Saman Jayasinghe

प्रकाशित 2026-04-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Deshan Sumanathilaka, Nicholas Micallef, Julian Hough, Saman Jayasinghe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को एक लघु कहानी सुना रहे हैं। अचानक, आपका सामना एक ऐसे शब्द से होता है जिसके दो बहुत अलग अर्थ हैं, जैसे कि शब्द "bat"। यह एक उड़ने वाला जानवर भी हो सकता है, या खेल का एक उपकरण भी।

एक सरल वाक्य में जैसे "The bat flew out of the cave" (चमगादड़ गुफा से बाहर उड़ गया), यह स्पष्ट है। लेकिन एक जटिल कहानी में, सुराग बहुत सूक्ष्म हो सकते हैं। शायद कहानी बेसबॉल के खेल के बारे में है, लेकिन पात्र ने एक केप (cape) पहना हुआ है। क्या वह "bat" एक जानवर है या खेल का सामान? इंसान पूरी कहानी के आधार पर यह अनुमान लगाने में बहुत अच्छे होते हैं कि कौन सा अर्थ सबसे अधिक तर्कसंगnt (sensible) लगता है।

यह शोध पत्र इसी काम को करने के लिए कंप्यूटर को सिखाने के बारे में है: कंप्यूटर को यह अनुमान लगाना सिखाना कि कहानी में किसी शब्द का कौन सा अर्थ सबसे अधिक तर्कसंगत लगता है।

यहाँ बताया गया है कि स्वानसी यूनिवर्सिटी (Swansea University) के शोधकर्ताओं ने कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए क्या किया।

1. समस्या: "अस्पष्ट कहानी" की पहेली

शोधकर्ता SemEval-2026 Task 5 नामक एक प्रतियोगिता में भाग ले रहे थे। इसे एक विशाल पहेली प्रतियोगिता समझें।

  • चुनौती: उन्हें ट्रिकी (tricky) शब्दों वाली छोटी कहानियाँ दी गईं।
  • लक्ष्य: केवल एक उत्तर चुनने के बजाय (जैसे कि बहुविकल्पीय परीक्षा में), उन्हें कहानी को 1 से 5 तक का "प्लासिबिलिटी स्कोर" (Plausibility Score - तर्कसंगतता स्कोर) देना था।
    • 5: "ओह, यह बिल्कुल सही लग रहा है! यहाँ शब्द का अर्थ निश्चित रूप से X है।"
    • 1: "बिल्कुल नहीं। यह अर्थ इस कहानी में उतना ही फिट बैठता है जितना एक गोल छेद में चौकोर खूँटा।"
  • ट्विस्ट: उन्हें मानवीय निर्णय की नकल करनी थी। कभी-कभी, इंसान असहमत होते हैं। एक व्यक्ति सोच सकता है कि "bat" एक जानवर है (स्कोर 4), जबकि दूसरा सोच सकता है कि यह खेल का सामान है (स्कोर 2)। कंप्यूटर को यह समझना था कि मनुष्य अलग-अलग क्यों महसूस कर सकते हैं।

2. समाधान: तीन अलग-अलग "दिमाग" रणनीतियाँ

टीम ने कंप्यूटर मॉडल को इंसानों की तरह सोचना सिखाने के लिए तीन अलग-अलग तरीके आजमाए।

रणनीति A: "शिक्षार्थी" (छोटे मॉडल्स को फाइन-ट्यूनिंग करना)

कल्पना कीजिए कि आपके पास एक बुद्धिमान लेकिन युवा छात्र है (एक छोटा AI मॉडल)। आप चाहते हैं कि वह कहानियों को ग्रेड करना सीखे।

  • पुराना तरीका: आप बस उन्हें कहानी दिखाते हैं और ग्रेड मांगते हैं।
  • नया तरीका: आप एक सख्त शिक्षक की तरह व्यवहार करते हैं। आप कहते हैं, "पहले, सुरागों को देखो। क्या कहानी बेसबॉल के बारे में है या गुफा के बारे में? क्या इसे समझना आसान है, या यह कठिन है? फिर मुझे ग्रेड दो।"
  • परिणाम: कंप्यूटर को "बोलकर सोचने" (जिसे Chain-of-Thought कहा जाता है) और पहले यह जांचने के लिए मजबूर करने कि कहानी "आसान" है या "कठिन", जिससे वह सही स्कोर का अनुमान लगाने में बहुत बेहतर हो गया। यह छात्र को उत्तर देने से पहले एक चेकलिस्ट का उपयोग करने के लिए सिखाने जैसा था।

रणनीति B: "सलाहकार" (डायनेमिक फ्यू-शॉट लर्निंग)

बड़े, स्मार्ट कंप्यूटरों (व्यावसायिक LLMs जैसे GPT-4) के लिए, उन्हें शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं थी। इसके बजाय, उन्होंने एक संदर्भ पुस्तकालय (Reference Library) का उपयोग किया।

  • उपमा: कल्पना कीजिए कि आप एक प्रतियोगिता में जज हैं। अपना निर्णय लेने से पहले, आप पिछले मामलों को देखते हैं जो अभी जिस मामले की आप जांच कर रहे हैं, उससे बहुत मिलते-जुलते हैं।
  • यह कैसे काम करता था: कंप्यूटर को कहानी दी गई, और फिर उसे अन्य कहानियों के कुछ उदाहरण दिखाए गए और बताया गया कि मनुष्यों ने उन्हें कैसे स्कोर दिया था।
  • परिणाम: यह कंप्यूटर को "समान स्थितियों" की एक चीट शीट देने जैसा था। इसने कंप्यूटर को यह समझने में मदद की, "आह, यह कहानी उस दूसरी कहानी जैसी है जहाँ स्कोर उच्च था," जिससे अधिक सटीक मानवीय स्कोर प्राप्त करने में मदद मिली।

रणनीति C: "जजों की परिषद" (एनसेम्बलिंग - Ensembling)

शोधकर्ताओं ने देखा कि कभी-कभी एक कंप्यूटर गलती करता है, ठीक वैसे ही जैसे एक इंसान का बुरा दिन हो सकता है।

  • उपमा: एक व्यक्ति से कहानी को ग्रेड करने के बजाय, उन्होंने पाँच अलग-अलग कंप्यूटरों से स्वतंत्र रूप से ग्रेड करने के लिए कहा। फिर, उन्होंने उन पाँचों के स्कोर का औसत निकाला।
  • परिणाम: यह एक टैलेंट शो में जजों के पैनल जैसा है। यदि एक जज बहुत कठोर है और दूसरा बहुत उदार है, तो औसत स्कोर आमतौर पर अधिक निष्पक्ष होता है और दर्शकों (इंसानों) ने वास्तव में क्या सोचा था, उसके करीब होता है। यह तरीका समग्र रूप से सबसे अच्छा रहा।

3. मुख्य निष्कर्ष

  • सोचना महत्वपूर्ण है: जिन कंप्यूटरों को कहानी के माध्यम से "तर्क" करने (सुरागों की जाँच करना, कठिनाई की जाँच करना) के लिए मजबूर किया गया था, वे केवल अनुमान लगाने वाले कंप्यूटरों की तुलना में बहुत बेहतर प्रदर्शन कर रहे थे।
  • संदर्भ ही सर्वोपरि है (Context is King): बड़े, महंगे कंप्यूटर जो "समान पिछली कहानियों" को देख सकते थे (सलाहकार रणनीति), वे मानवीय बारीकियों की नकल करने में सबसे अच्छे थे।
  • टीम वर्क जीतता है: जब उन्होंने कई मॉडलों के विचारों को मिलाया (परिषद का समूह), तो परिणाम किसी भी एकल मॉडल द्वारा अकेले हासिल किए जाने वाले मानवीय सहमति से भी अधिक करीब थे।

4. निर्णय

टीम ने प्रतियोगिता में 10वां स्थान प्राप्त किया। हालांकि वे पहले स्थान पर नहीं आए, लेकिन उन्होंने साबित कर दिया कि कंप्यूटर अब केवल व्याकरण को ही नहीं, बल्कि कहानी के भाव और तर्क को भी समझने में बहुत अच्छे होते जा रहे हैं।

संक्षेप में: उन्होंने कंप्यूटर को केवल शब्दों को पढ़ना ही नहीं, बल्कि चेकलिस्ट, संदर्भ पुस्तकों और समूह चर्चाओं का उपयोग करके यह समझना सिखाया कि एक कहानी वास्तव में क्या कहना चाह रही है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →