← नवीनतम पेपर
💬 NLP

Loanword or Switch? The Annotation Boundary, Not the Model, Drives Kazakh-Russian Code-Switching Identification

यह शोध पत्र यह तर्क देता है कि कज़ाख-रूसी कोड-स्विचिंग की पहचान करने में प्राथमिक चुनौती भाषा पहचान मॉडल का चयन नहीं है, बल्कि एकीकृत ऋणशब्दों (loanwords) और वास्तविक कोड-स्विचिंग के बीच अंतर करने वाली एनोटेशन सीमा है, जिसे एक नए जारी किए गए डॉक्यूमेंट-लेवल गोल्ड डेटासेट और एक फ़िल्टर-फर्स्ट कैस्केड दृष्टिकोण द्वारा स्पष्ट किया गया है।

मूल लेखक: Bogdan Savelyev

प्रकाशित 2026-08-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bogdan Savelyev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

द ग्रेट लैंग्वेज मिक्स-अप: क्यों कंप्यूटर उधार लिए गए शब्दों से भ्रमित हो जाते हैं

कल्पना कीजिए कि आप एक रोबोट को दो अलग-अलग भाषाएँ सिखाने की कोशिश कर रहे हैं जो संयोग से एक ही वर्णमाला का उपयोग करती हैं, जैसे दो पड़ोसी जो अलग-अलग बोलियाँ बोलते हैं लेकिन लिखने के लिए एक ही अक्षरों के सेट का उपयोग करते हैं। यह नेचुरल लैंग्वेज प्रोसेसिंग (NLP) की दुनिया है, जो कंप्यूटर विज्ञान की एक शाखा है जहाँ मशीनें मानव भाषण को पढ़ने, लिखने और समझने की कोशिश करती हैं। रोबोट के पहले कामों में से एक है लैंग्वेज आइडेंटिफिकेशन (LID): बस यह पता लगाना कि, "क्या यह वाक्य फ्रेंच है या स्पेनिश?" या "क्या यह कज़ाख है या रूसी?"

आमतौर पर, यह आसान होता है। यदि कोई वाक्य फ्रेंच शब्दों से भरा है, तो रोबोट कहता है "फ्रेंच।" लेकिन चीजें तब जटिल हो जाती हैं जब लोग एक ही संदेश में भाषाओं को मिला देते हैं, जिसे कोड-स्विचिंग (code-switching) कहा जाता है। यह तब होता है जब कोई एक भाषा में वाक्य शुरू करता है और दूसरी में समाप्त करता है, जैसे यह कहना, "I went to the bakery to buy khleb।" इस परिदृश्य में, रोबोट को निर्णय लेना होता है: क्या यह दो भाषाओं का एक अस्त-व्यस्त मिश्रण है, या यह केवल एक भाषा है जिसने दूसरी भाषा से कुछ शब्द उधार लिए हैं? यदि रोबोट इससे गलत निर्णय लेता है, तो वह एक शुद्ध संदेश को एक अस्त-व्यस्त मिश्रण समझ सकता है, या वास्तविक मिश्रण को पूरी तरह से मिस कर सकता है। यह महत्वपूर्ण है क्योंकि यदि कंप्यूटर सोचता है कि एक संदेश "मिश्रित" है जबकि वह वास्तव में केवल एक ही भाषा है, तो वह इसे गलत तरीके से अनुवाद करने या इसके मूड का विश्लेषण करने की कोशिश कर सकता है, जिससे सोशल मीडिया मॉडरेशन से लेकर कस्टमर सर्विस बॉट्स तक सब कुछ भ्रमित हो सकता है।

शोध पत्र की कहानी: यह रोबोट की गलती नहीं है, यह नियम पुस्तिका की गलती है

इस शोध पत्र में, शोधकर्ता बोгдаन सावेलेव (Bogdan Savelyev) कज़ाख और रूसी से जुड़ी एक विशिष्ट समस्या का समाधान करते हैं, जो कज़ाकिस्तान में लाखों लोगों द्वारा बोली जाने वाली दो भाषाएँ हैं और दोनों ही सिरिलिक (Cyrillic) वर्णमाला का उपयोग करती हैं। समस्या क्या है? कंप्यूटर लगभग हर कज़ाख वाक्य को देखकर "MIXED!" चिल्ला रहे थे। क्यों? क्योंकि कज़ाख ने वर्षों से रूसी से हजारों शब्द उधार लिए हैं (जैसे "quality" का kachestvo बन जाना)। एक कंप्यूटर के लिए जो केवल अक्षरों को देखता है, रूसी ऋणशब्द (loanword) वाला कज़ाख वाक्य बिल्कुल वैसा ही दिखता है जैसा कि एक वाक्य जिसमें भाषाओं को स्विच किया गया हो।

शोध पत्र का तर्क है कि गलती यह नहीं थी कि कंप्यूटर मॉडल बहुत मूर्ख थे; गलती उन नियमों में थी जो हमने उन्हें दिए थे। शोधकर्ताओं ने महसूस किया कि "मिश्रित" की परिभाषा बहुत ढीली थी। उन्होंने एक नया, सख्त नियम प्रस्तावित किया: एकीकृत ऋणशब्द (Integrated loanwords) अभी भी मूल भाषा ही हैं। यदि एक कज़ाख वाक्य रूसी शब्द का उपयोग करता है लेकिन कज़ाख व्याकरण और वाक्य संरचना को बनाए रखता है, तो वह कज़ाख है, न कि मिश्रित। वास्तविक "मिश्रित" टेक्स्ट तभी होता है जब बोलने वाला वास्तव में व्याकरणिक संरचनाओं को बदल देता है, जैसे कि एक पूरा क्लॉज रूसी में समाप्त करना और फिर कज़ाख में एक नया क्लॉज शुरू करना।

इसे साबित करने के लिए, टीम ने 3,000 से अधिक संदेशों का एक "गोल्ड स्टैंडर्ड" डेटासेट बनाया, जिसे मनुष्यों द्वारा इस नए, सख्त नियम का पालन करते हुए सावधानीपूर्वक लेबल किया गया था। फिर उन्होंने इस नए नियमकोश के विरुद्ध कई अलग-अलग कंप्यूटर मॉडलों का परीक्षण किया।

यहाँ उन्हें क्या मिला:

  • "अक्षर गिनने" की गलती: सरल उपकरण जो कज़ाख पाठ के भीतर रूसी अक्षरों की जाँच करते थे, वे बहुत खराब थे। उन्होंने लगभग सब कुछ को "मिश्रित" के रूप में लेबल किया क्योंकि वे उधार लिए गए शब्द और वास्तविक भाषा स्विच के बीच अंतर नहीं कर सके।
  • "विंडो" ट्रिक: उन्होंने HeLI नामक एक चतुर नॉन-न्यूरल विधि का परीक्षण किया जो पूरे वाक्य के बजाय शब्दों के छोटे "विंडोज़" (जैसे एक बार में 2 या 3 शब्द देखना) को देखती है। ज्ञात उधार लिए गए शब्दों को पहले हटाकर और फिर इन छोटे विंडोज़ की जाँच करके, इस पद्धति ने वास्तविक स्विच को पहचानने में बहुत सुधार किया। यह लगभग 70% सही उत्तरों से बढ़कर लगभग 87% तक पहुँच गया।
  • संदर्भ की शक्ति: सबसे अच्छा प्रदर्शन करने वाला एक आधुनिक AI मॉडल था जिसे XLM-R कहा जाता है। क्योंकि यह मॉडल एक साथ पूरे संदेश को पढ़ता है और संदर्भ को समझता है, यह स्वाभाविक रूप से उधार लिए गए शब्द और वास्तविक स्विच के बीच अंतर कर सकता है। इसने 0.966 (1.0 में से) का स्कोर प्राप्त किया, जो अविश्वसनीय रूप से उच्च है।
  • वास्तविक दुनिया का प्रभाव: जब उन्होंने इस स्मार्ट फ़िल्टर को 331,468 से अधिक वास्तविक सोशल मीडिया पोस्ट के विशाल ढेर पर लागू किया, तो परिणाम चौंकाने वाले थे। पुराने, सरल नियमों ने लगभग 28,000 पोस्ट को "मिश्रित" के रूप में चिह्नित किया, लेकिन जब एक मानव ने नमूने की जाँच की, तो केवल लगभग 1.66% ही वास्तव में मिश्रित थे। नया, स्मार्ट फ़िल्टर ने केवल 4.9% कुल पोस्ट को मिश्रित के रूप में सही ढंग से पहचाना। इसका मतलब है कि पुराने नियमों ने मिश्रित संदेशों की संख्या को बहुत बड़े अंतर से बढ़ा दिया था, जिससे ऐसा लग रहा था कि लोग लगातार भाषा बदल रहे हैं जबकि वे ज्यादातर केवल उधार लिए गए शब्दों के साथ कज़ाख बोल रहे थे।

शोध पत्र निष्कर्ष निकालता है कि बाधा कंप्यूटर मॉडल स्वयं नहीं है; यह एनोटेशन बाउंड्री (annotation boundary) है—वह रेखा जो हम "उधार लिए गए शब्द" और "भाषा स्विच" के बीच खींचते हैं। एक बार जब हम उस रेखा को स्पष्ट रूप से खींच लेते हैं, तो सरल मॉडल भी ठीक-ठाक काम कर सकते हैं, और उन्नत मॉडल लगभग पूर्ण सटीकता तक पहुँच सकते हैं। लेखक ने अपना डेटा और उपकरण भी जारी किए हैं ताकि अन्य लोग वही गलती न करें। हालाँकि, वे स्वीकार करते हैं कि उनके मानव लेबल एक अकेले व्यक्ति द्वारा किए गए थे (एक टीम द्वारा नहीं), इसलिए मानवीय त्रुटि की एक छोटी संभावना है, और विशाल डेटासेट पर अंतिम परिणाम भविष्यवाणियाँ हैं, दूसरा मानव चेक नहीं। लेकिन साक्ष्य मजबूत है: यदि आप कोड-स्विचिंग को समझना चाहते हैं, तो आपको अपने कंप्यूटर को केवल अक्षर गिनने के बजाय, एक ऋणशब्द और एक स्विच के बीच का अंतर सिखाना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →