Creating and Evaluating Figurative Language Dataset for Sindhi
यह शोध पत्र SiNFluD प्रस्तुत करता है, जो विविध स्रोतों से निर्मित और मूल भाषियों द्वारा एनोटेट किया गया सिंधी आलंकारिक भाषा वर्गीकरण के लिए एक नया बेंचमार्क डेटासेट है, साथ ही विभिन्न प्री-ट्रेंड मॉडलों का एक मूल्यांकन भी प्रस्तुत करता है जहाँ XLM-RoBERTa-XL ने सर्वश्रेष्ठ प्रदर्शन किया।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि सिंधी भाषा कहानियों, कविताओं और दैनिक बातचीत से भरी एक विशाल, प्राचीन लाइब्रेरी है। लंबे समय से, कंप्यूटर जो इस लाइब्रेरी को "पढ़ने" की कोशिश कर रहे थे (नेचुरल लैंग्वेज प्रोसेसिंग), वे केवल साधारण, शाब्दिक तथ्यों को ही समझ पाते थे। यदि कोई कहता, "सूरज मुस्कुरा रहा है," तो कंप्यूटर सोचता कि सूरज का वास्तव में एक मुँह है और वह मुस्कुरा रहा है। वह मुख्य बात चूक जाता था: लेखक एक सुंदर सुबह का वर्णन करने के लिए एक रूपक (metaphor) का उपयोग कर रहा था।
यह शोध पत्र एक विशेष "प्रशिक्षण नियमावली" बनाने के बारे में है ताकि कंप्यूटर को सिंधी में इन छिपे हुए अर्थों को समझने के लिए सिखाया जा सके। यह उन्हें कैसे किया गया, इसका सरल विवरण है:
1. समस्या: कंप्यूटर "मजाक" को नहीं समझ पाते
मानवीय भाषा चालों से भरी होती है। हम मुहावरों (idioms) (जैसे "raining cats and dogs"), कहावतों (proverbs) (ज्ञान से भरी पुरानी बातें), रूपकों (metaphors) और उपमाओं (similes) (तुलना करने के लिए "जैसे" या "तरह" का उपयोग करना) का उपयोग करते हैं। इनका शाब्दिक अर्थ नहीं लिया जाना चाहिए।
अंग्रेजी जैसी भाषाओं के लिए, हमारे पास इन चालाकियों के विशाल शब्दकोश हैं। लेकिन सिंधी के लिए—जो पाकिस्तान और भारत में लाखों लोगों द्वारा बोली जाने वाली एक समृद्ध कविता और सूफी परंपराओं वाली भाषा है—इन गैर-शाब्दिक अभिव्यक्तियों के लिए लगभग कोई डिजिटल मानचित्र नहीं था। यह एक छात्र को कठिन शब्दों के लिए शब्दकोश दिए बिना एक जटिल उपन्यास पढ़ना सिखाने जैसा था।
2. समाधान: "SiNFluD" डेटासेट बनाना
लेखकों ने SiNFluD (सिंधी नॉन-लिटरल फिगुरेटिव लैंग्वेज डेटासेट) नामक एक नया संसाधन बनाया। इसे फ्लैशकार्ड डेक के एक विशाल, सावधानीपूर्वक व्यवस्थित संग्रह के रूप में सोचें।
- कार्ड इकट्ठा करना: उन्होंने इन्हें केवल मनगढ़ंत नहीं बनाया। वे पुरानी किताबों, ब्लॉगों, सोशल मीडिया पोस्ट और विकिस्रोत (Wikisource) जैसी वेबसाइटों में से वास्तविक उदाहरण खोजने के लिए खुदाई करने गए, जहाँ सिंधी लोग इन लाक्षणिक अभिव्यक्तियों का उपयोग कर रहे थे।
- मानवीय स्पर्श: दो मूल निवासी सिंधी वक्ताओं ने "शिक्षकों" के रूप में कार्य किया। उन्होंने प्रत्येक वाक्य को पढ़ा और उसे लेबल किया:
- शाब्दिक (0): "बिल्ली चटाई पर है।" (साधारण सत्य)।
- लाक्षणिक (1): "उसका दिल पत्थर का है।" (पत्थर का नहीं, बल्कि भावनाहीन)।
- उन्होंने लाक्षणिक वाले हिस्से को चार श्रेणियों में भी बांटा: मुहावरे (Idioms), कहावतें (Proverbs), रूपक (Metaphors), और उपमा (Similes)।
- दोहरा सत्यापन: यह सुनिश्चित करने के लिए कि वे सहमत हैं, उन्होंने अपने काम की तुलना की। वे 81% बार सहमत हुए, जो कि एक बहुत ही उच्च स्कोर है, जिसका अर्थ है कि "फ्लैशकार्ड" विश्वसनीय हैं।
- सफाई: उन्होंने डुप्लिकेट्स को हटाया और फॉर्मेटिंग त्रुटियों को ठीक किया, जिससे लगभग 4,451 स्वच्छ उदाहरण प्राप्त हुए।
3. परीक्षण: कंप्यूटर को सिखाना
एक बार जब उनके पास उनके फ्लैशकार्ड आ गए, तो उन्हें यह देखने की आवश्यकता थी कि क्या आधुनिक AI सीख सकता है। उन्होंने इसे कंप्यूटर के लिए एक स्कूल परीक्षा की तरह माना।
- छात्र: उन्होंने चार अलग-अलग "छात्र" AI मॉडल का परीक्षण किया:
- mBERT: एक मानक बहुभाषी छात्र।
- XLM-RoBERTa: एक अधिक उन्नत छात्र जिसने अधिक किताबें पढ़ी हैं।
- XLM-RoBERTa-XL: "सुपर स्टूडेंट" जिसके पास एक विशाल मस्तिष्क (अधिक पैरामीटर्स) है और जिसने 100 से अधिक भाषाएँ पढ़ी हैं।
- SetFit: एक "स्पीड लर्नर" जिसे बहुत कम उदाहरणों के साथ अच्छे परिणाम देने के लिए डिज़ाइन किया गया है (फ्यू-शॉट लर्निंग)।
- परीक्षा: उन्होंने डेटा को ट्रेनिंग सेट और टेस्ट सेट (जैसे अभ्यास क्विज़ और अंतिम परीक्षा) में विभाजित किया, ताकि यह सुनिश्चित हो सके कि परिणाम केवल भाग्य के कारण नहीं हैं, जिसके लिए "क्रॉस-वैलिडेशन" पद्धति का उपयोग किया गया।
4. परिणाम: कौन पास हुआ?
परिणाम काफी उत्साहजनक थे:
- विजेता: XLM-RoBERTa-XL मॉडल (सुपर स्टूडेंट) ने उच्चतम स्कोर प्राप्त किया, जिसने लगभग 92.27% बार लाक्षणिक भाषा को सही ढंग से पहचाना।
- उप-विजेता: अन्य मॉडलों ने भी बहुत अच्छा प्रदर्शन किया, जिनका स्कोर 90% और 91% के बीच रहा।
- सबक: यह हमें बताता है कि डेटासेट उच्च गुणवत्ता वाला और संतुलित है। यह यह भी दर्शाता है कि बड़े, अधिक उन्नत AI मॉडल सिंधी में सूक्ष्म "अर्थों की छाया" को समझने में बेहतर होते हैं, लेकिन कुशल "स्पीड लर्नर" (SetFit) ने भी आश्चर्यजनक रूप से अच्छा प्रदर्शन किया।
सारांश
संक्षेप में, लेखकों ने सिंधी भाषा के लिए पहले प्रमुख "छिपे हुए अर्थों के शब्दकोश" का निर्माण किया। उन्होंने साबित किया कि इस नए उपकरण के साथ, कंप्यूटर अंततः यह समझने में सक्षम हो सकते हैं कि जब एक सिंधी वक्ता कुछ काव्यमय या मुहावरेदार कहता है, तो वे निरर्थक बातें नहीं कर रहे होते हैं—वे गहराई और संस्कृति के साथ बोल रहे होते हैं। यह शोधकर्ताओं को भविष्य में सिंधी के लिए बेहतर अनुवाद टूल, चैटबॉट और सेंटिमेंट एनालाइज़र बनाने के लिए एक ठोस आधार प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।