← नवीनतम पेपर
💬 NLP

PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing

यह शोध पत्र PERCEPT को प्रस्तुत करता है, जो यूनिवर्सल डिपेंडेंसीज POS टैग के साथ एनोटेट किया गया पहला बड़े पैमाने का फारसी-अंग्रेजी कोड-मिक्स्ड कॉर्पस है, साथ ही एक LLM-सहायता प्राप्त एनोटेशन फ्रेमवर्क और एक व्यापक भाषाई विश्लेषण भी प्रस्तुत करता है जो सोशल मीडिया में कोड-मिक्सिंग के प्लेटफॉर्म-विशिष्ट पैटर्न को प्रकट करता है।

मूल लेखक: Ghazal Kalhor, Zahra Jafari, Amirarsalan Shahbazi, Behnam Bahrak

प्रकाशित 2026-08-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ghazal Kalhor, Zahra Jafari, Amirarsalan Shahbazi, Behnam Bahrak

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक खेल का मैदान है जहाँ दुनिया भर के लोग एक साथ चिल्ला रहे हैं, फुसफुसा रहे हैं और बातचीत कर रहे हैं। इस खेल के मैदान में, कई लोग केवल एक भाषा नहीं बोलते; वे उन्हें एक स्मूदी की तरह आपस में मिला देते हैं। इसे "कोड-मिक्सिंग" (code-mixing) कहा जाता है। यह तब होता है जब कोई अपनी मातृभाषा में एक वाक्य शुरू करता है और अचानक उसमें एक अंग्रेजी शब्द डाल देता है क्योंकि वह बिल्कुल सही लगता है, या इसलिए क्योंकि उस नए गैजेट के लिए उसे केवल वही शब्द पता है। कंप्यूटरों के लिए, यह एक बुरा सपना है। यदि कोई कंप्यूटर एक वाक्य को समझने की कोशिश कर रहा है, तो वह उम्मीद करता है कि शब्द सख्त नियमों का पालन करेंगे। लेकिन जब भाषाएँ आपस में मिल जाती हैं, तो कंप्यूटर भ्रमित हो जाता है, जैसे कोई शेफ केक बनाने के बीच में ही मीट्रिक कप से बदलकर इंपीरियल औंस (imperial ounces) का उपयोग करने वाले रेसिपी का पालन करने की कोशिश कर रहा हो। कंप्यूटरों को यह सिखाने के लिए कि वे इस बिखरी हुई, मजेदार वास्तविकता को कैसे संभालें, वैज्ञानिकों को एक विशेष शब्दकोश और नियमों के एक सेट की आवश्यकता होती है—एक "कॉर्पस" (corpus)—जो उन्हें ठीक से दिखाता है कि ये मिश्रित शब्द कैसे काम करते हैं।

यहाँ PERCEPT आता है, जो एक नया प्रोजेक्ट है जो उन फारसी (Persian) भाषियों के लिए एक विशाल, व्यवस्थित पुस्तकालय की तरह कार्य करता है जो अपनी पोस्ट में अंग्रेजी मिलाना पसंद करते हैं। शोधकर्ताओं ने, जो ईरान के भाषाविदों और कंप्यूटर वैज्ञानिकों की एक टीम है, देखा कि जबकि हमारे पास अन्य मिश्रित भाषा जोड़ों के लिए मानचित्र मौजूद हैं, फारसी-अंग्रेजी का मिश्रण एक अंधेरे, अनछप्लो जंगल की तरह था। वे वहाँ क्या हो रहा है, यह देखने के लिए एक टॉर्च बनाना चाहते थे। इसलिए, उन्होंने तीन लोकप्रिय डिजिटल ठिकानों से 6,800 पोस्ट एकत्र किए: X (पूर्व में ट्विटर), इंस्टाग्राम और डिजिकाल (Digikala - एक विशाल ऑनलाइन शॉपिंग साइट)। उन्होंने केवल शब्द ही एकत्र नहीं किए; उन्होंने 'जेमिनी' (Gemini) नामक एक सुपर-स्मार्ट AI सहायक का उपयोग किया जो एक जासूस की तरह कार्य करता है, जिसने वाक्य में प्रत्येक अंग्रेजी शब्द (या फारसी अक्षरों में लिखा गया अंग्रेजी शब्द) को उसके "कार्य" (job) के साथ टैग किया। व्याकरण में, इस कार्य को "पार्ट-ऑफ-स्पीच" (Part-of-Speech - POS) कहा जाता है। क्या वह शब्द एक संज्ञा (noun - एक चीज़) है? एक क्रिया (verb - एक कार्य)? एक विशेषण (adjective - एक विवरण)? टीम ने AI से यह भी अनुमान लगाने को कहा कि पोस्ट किस बारे में है, जैसे कि "शॉपिंग," "राजनीति," या "मजेदार मीम्स।"

यहाँ रोमांचक हिस्सा है: टीम ने केवल पुस्तकालय ही नहीं बनाया; वे इसके अंदर गए और पैटर्न खोजने के लिए किताबें पढ़ना शुरू किया। उन्होंने पाया कि जब फारसी भाषी अंग्रेजी का मिश्रण करते हैं, तो वे ज्यादातर संज्ञाओं (nouns - चीजों) के लिए इसका उपयोग करते हैं। यह ऐसा है जैसे वे अंग्रेजी से "वस्तुओं" को उधार ले रहे हैं लेकिन "क्रियाओं" और "विवरणों" को फारसी में ही रख रहे हैं। उदाहरण के लिए, वे कह सकते हैं, "मैंने एक नया laptop खरीदा," जहाँ "laptop" एक उधार ली गई संज्ञा है, लेकिन बाकी का वाक्य फारसी में रहता है। हालाँकि, इस मिश्रण का "स्वाद" इस बात पर निर्भर करता है कि आप कहाँ हैं। शॉपिंग साइट, डिजिकाल पर, लोगों ने बहुत सारे ब्रांड नाम और उत्पाद मॉडल (जो विशेष नाम, या "प्रॉपर नाउन्स" हैं) मिलाए। X पर, उन्होंने अधिक क्रियाओं (verbs) को मिलाया, और इंस्टाग्राम पर, वे विशेषणों (adjectives) की ओर झुके।

शोधकर्ताओं ने यह भी देखा कि ये मिश्रित शब्द वाक्य में कहाँ छिपे होते हैं। उन्होंने एक आश्चर्यजनक निरंतरता पाई: चाहे आप किसी भी प्लेटफॉर्म का उपयोग करें, मिश्रित शब्द वाक्य की शुरुआत में या बीच में दिखाई देते हैं, अंत में शायद ही कभी। यह ऐसा है जैसे बोलने वाले दृश्य सेट करने के लिए अंग्रेजी शब्द को जल्दी डाल देते हैं, और फिर फारसी में विचार को पूरा करते हैं। लेकिन सबसे दिलचस्प खोज "ट्रिगरिंग" (triggering) के बारे में थी। डिजिकाल पर, यदि किसी ने एक अंग्रेजी शब्द का उपयोग किया, तो इसकी बहुत अधिक संभावना थी कि वे तुरंत बाद एक और शब्द का उपयोग करेंगे। यह ऐसा है जैसे एक बार जब आप किसी विशिष्ट ब्रांड या उत्पाद के बारे में बात करना शुरू करते हैं, तो अंग्रेजी शब्द बस बहते चले जाते हैं। यह इंस्टाग्राम या X पर उतना नहीं हुआ।

अंत में, उन्होंने जांचा कि किन विषयों ने सबसे अधिक मिश्रण को जन्म दिया। बिना आश्चर्य के, "उद्योग और वाणिज्य" (Industry & Commerce) और "ब्रांड और व्यवसाय" (Brand & Business) के विषयों में कोड-मिक्सिंग की मात्रा सबसे अधिक थी। जब लोग खरीदारी, तकनीक या व्यवसाय के बारे में बात करते हैं, तो वे अंग्रेजी शब्दों को छिड़कने से खुद को रोक नहीं पाते हैं। टीम ने मानव विशेषज्ञों से एक नमूने की दोबारा जांच करवाकर अपने AI के काम की पुष्टि की, और इंसान लगभग हर समय AI से सहमत हुए, जिससे साबित हुआ कि उनका नया पुस्तकालय विश्वसनीय है।

संक्षेप में, यह पेपर केवल हमें एक नया डेटासेट ही नहीं देता; यह हमें एक स्पष्ट तस्वीर देता है कि फारसी भाषी स्वाभाविक रूप से भाषाओं को कैसे मिलाते हैं। यह सुझाव देता है कि जबकि उधार लिए गए शब्दों के प्रकार प्लेटफॉर्म के आधार पर बदलते हैं, उनके मिश्रण का तरीका एक स्थिर लय का पालन करता है। यह मानचित्र अब किसी के भी उपयोग के लिए खुला है, जो बेहतर अनुवाद उपकरण, स्मार्ट चैटबॉट्स बनाने और इस बात की गहरी समझ विकसित करने में मदद करता है कि हम एक ऐसी दुनिया में कैसे संवाद करते हैं जहाँ भाषाएँ लगातार एक साथ नृत्य कर रही हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →