PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing
यह शोध पत्र PERCEPT को प्रस्तुत करता है, जो यूनिवर्सल डिपेंडेंसीज POS टैग के साथ एनोटेट किया गया पहला बड़े पैमाने का फारसी-अंग्रेजी कोड-मिक्स्ड कॉर्पस है, साथ ही एक LLM-सहायता प्राप्त एनोटेशन फ्रेमवर्क और एक व्यापक भाषाई विश्लेषण भी प्रस्तुत करता है जो सोशल मीडिया में कोड-मिक्सिंग के प्लेटफॉर्म-विशिष्ट पैटर्न को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक खेल का मैदान है जहाँ दुनिया भर के लोग एक साथ चिल्ला रहे हैं, फुसफुसा रहे हैं और बातचीत कर रहे हैं। इस खेल के मैदान में, कई लोग केवल एक भाषा नहीं बोलते; वे उन्हें एक स्मूदी की तरह आपस में मिला देते हैं। इसे "कोड-मिक्सिंग" (code-mixing) कहा जाता है। यह तब होता है जब कोई अपनी मातृभाषा में एक वाक्य शुरू करता है और अचानक उसमें एक अंग्रेजी शब्द डाल देता है क्योंकि वह बिल्कुल सही लगता है, या इसलिए क्योंकि उस नए गैजेट के लिए उसे केवल वही शब्द पता है। कंप्यूटरों के लिए, यह एक बुरा सपना है। यदि कोई कंप्यूटर एक वाक्य को समझने की कोशिश कर रहा है, तो वह उम्मीद करता है कि शब्द सख्त नियमों का पालन करेंगे। लेकिन जब भाषाएँ आपस में मिल जाती हैं, तो कंप्यूटर भ्रमित हो जाता है, जैसे कोई शेफ केक बनाने के बीच में ही मीट्रिक कप से बदलकर इंपीरियल औंस (imperial ounces) का उपयोग करने वाले रेसिपी का पालन करने की कोशिश कर रहा हो। कंप्यूटरों को यह सिखाने के लिए कि वे इस बिखरी हुई, मजेदार वास्तविकता को कैसे संभालें, वैज्ञानिकों को एक विशेष शब्दकोश और नियमों के एक सेट की आवश्यकता होती है—एक "कॉर्पस" (corpus)—जो उन्हें ठीक से दिखाता है कि ये मिश्रित शब्द कैसे काम करते हैं।
यहाँ PERCEPT आता है, जो एक नया प्रोजेक्ट है जो उन फारसी (Persian) भाषियों के लिए एक विशाल, व्यवस्थित पुस्तकालय की तरह कार्य करता है जो अपनी पोस्ट में अंग्रेजी मिलाना पसंद करते हैं। शोधकर्ताओं ने, जो ईरान के भाषाविदों और कंप्यूटर वैज्ञानिकों की एक टीम है, देखा कि जबकि हमारे पास अन्य मिश्रित भाषा जोड़ों के लिए मानचित्र मौजूद हैं, फारसी-अंग्रेजी का मिश्रण एक अंधेरे, अनछप्लो जंगल की तरह था। वे वहाँ क्या हो रहा है, यह देखने के लिए एक टॉर्च बनाना चाहते थे। इसलिए, उन्होंने तीन लोकप्रिय डिजिटल ठिकानों से 6,800 पोस्ट एकत्र किए: X (पूर्व में ट्विटर), इंस्टाग्राम और डिजिकाल (Digikala - एक विशाल ऑनलाइन शॉपिंग साइट)। उन्होंने केवल शब्द ही एकत्र नहीं किए; उन्होंने 'जेमिनी' (Gemini) नामक एक सुपर-स्मार्ट AI सहायक का उपयोग किया जो एक जासूस की तरह कार्य करता है, जिसने वाक्य में प्रत्येक अंग्रेजी शब्द (या फारसी अक्षरों में लिखा गया अंग्रेजी शब्द) को उसके "कार्य" (job) के साथ टैग किया। व्याकरण में, इस कार्य को "पार्ट-ऑफ-स्पीच" (Part-of-Speech - POS) कहा जाता है। क्या वह शब्द एक संज्ञा (noun - एक चीज़) है? एक क्रिया (verb - एक कार्य)? एक विशेषण (adjective - एक विवरण)? टीम ने AI से यह भी अनुमान लगाने को कहा कि पोस्ट किस बारे में है, जैसे कि "शॉपिंग," "राजनीति," या "मजेदार मीम्स।"
यहाँ रोमांचक हिस्सा है: टीम ने केवल पुस्तकालय ही नहीं बनाया; वे इसके अंदर गए और पैटर्न खोजने के लिए किताबें पढ़ना शुरू किया। उन्होंने पाया कि जब फारसी भाषी अंग्रेजी का मिश्रण करते हैं, तो वे ज्यादातर संज्ञाओं (nouns - चीजों) के लिए इसका उपयोग करते हैं। यह ऐसा है जैसे वे अंग्रेजी से "वस्तुओं" को उधार ले रहे हैं लेकिन "क्रियाओं" और "विवरणों" को फारसी में ही रख रहे हैं। उदाहरण के लिए, वे कह सकते हैं, "मैंने एक नया laptop खरीदा," जहाँ "laptop" एक उधार ली गई संज्ञा है, लेकिन बाकी का वाक्य फारसी में रहता है। हालाँकि, इस मिश्रण का "स्वाद" इस बात पर निर्भर करता है कि आप कहाँ हैं। शॉपिंग साइट, डिजिकाल पर, लोगों ने बहुत सारे ब्रांड नाम और उत्पाद मॉडल (जो विशेष नाम, या "प्रॉपर नाउन्स" हैं) मिलाए। X पर, उन्होंने अधिक क्रियाओं (verbs) को मिलाया, और इंस्टाग्राम पर, वे विशेषणों (adjectives) की ओर झुके।
शोधकर्ताओं ने यह भी देखा कि ये मिश्रित शब्द वाक्य में कहाँ छिपे होते हैं। उन्होंने एक आश्चर्यजनक निरंतरता पाई: चाहे आप किसी भी प्लेटफॉर्म का उपयोग करें, मिश्रित शब्द वाक्य की शुरुआत में या बीच में दिखाई देते हैं, अंत में शायद ही कभी। यह ऐसा है जैसे बोलने वाले दृश्य सेट करने के लिए अंग्रेजी शब्द को जल्दी डाल देते हैं, और फिर फारसी में विचार को पूरा करते हैं। लेकिन सबसे दिलचस्प खोज "ट्रिगरिंग" (triggering) के बारे में थी। डिजिकाल पर, यदि किसी ने एक अंग्रेजी शब्द का उपयोग किया, तो इसकी बहुत अधिक संभावना थी कि वे तुरंत बाद एक और शब्द का उपयोग करेंगे। यह ऐसा है जैसे एक बार जब आप किसी विशिष्ट ब्रांड या उत्पाद के बारे में बात करना शुरू करते हैं, तो अंग्रेजी शब्द बस बहते चले जाते हैं। यह इंस्टाग्राम या X पर उतना नहीं हुआ।
अंत में, उन्होंने जांचा कि किन विषयों ने सबसे अधिक मिश्रण को जन्म दिया। बिना आश्चर्य के, "उद्योग और वाणिज्य" (Industry & Commerce) और "ब्रांड और व्यवसाय" (Brand & Business) के विषयों में कोड-मिक्सिंग की मात्रा सबसे अधिक थी। जब लोग खरीदारी, तकनीक या व्यवसाय के बारे में बात करते हैं, तो वे अंग्रेजी शब्दों को छिड़कने से खुद को रोक नहीं पाते हैं। टीम ने मानव विशेषज्ञों से एक नमूने की दोबारा जांच करवाकर अपने AI के काम की पुष्टि की, और इंसान लगभग हर समय AI से सहमत हुए, जिससे साबित हुआ कि उनका नया पुस्तकालय विश्वसनीय है।
संक्षेप में, यह पेपर केवल हमें एक नया डेटासेट ही नहीं देता; यह हमें एक स्पष्ट तस्वीर देता है कि फारसी भाषी स्वाभाविक रूप से भाषाओं को कैसे मिलाते हैं। यह सुझाव देता है कि जबकि उधार लिए गए शब्दों के प्रकार प्लेटफॉर्म के आधार पर बदलते हैं, उनके मिश्रण का तरीका एक स्थिर लय का पालन करता है। यह मानचित्र अब किसी के भी उपयोग के लिए खुला है, जो बेहतर अनुवाद उपकरण, स्मार्ट चैटबॉट्स बनाने और इस बात की गहरी समझ विकसित करने में मदद करता है कि हम एक ऐसी दुनिया में कैसे संवाद करते हैं जहाँ भाषाएँ लगातार एक साथ नृत्य कर रही हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।