← नवीनतम पेपर
💬 NLP

CoPiT: Cognitive Pivot Translation for Digraphic Low-Resource Mongolian in the Traditional Script

यह शोध पत्र CoPiT को प्रस्तुत करता है, जो एक संज्ञानात्मक पिवट अनुवाद ढांचा (cognitive pivot translation framework) है जो वर्तनी संबंधी अस्पष्टता को दूर करने के लिए कम संसाधन वाले पारंपरिक मंगोलियाई को उसके बेहतर संसाधन वाले सिरिलिक लिपि के माध्यम से रूट करता है, जिससे अनुवाद की गुणवत्ता में महत्वपूर्ण सुधार होता है और कम प्रतिनिधित्व वाले भाषा युग्मों के लिए सिंथेटिक डेटा जनरेशन सक्षम होता है।

मूल लेखक: Burte Bayarsaikhan, Serynn Kim, Buru Chang

प्रकाशित 2026-07-08
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Burte Bayarsaikhan, Serynn Kim, Buru Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्राचीन, रहस्यमय कोड (पारंपरिक मंगोलियाई लिपि) में लिखी गई एक कहानी का आधुनिक भाषाओं जैसे अंग्रेजी, कोरियाई या रूसी में अनुवाद करने की कोशिश कर रहे हैं। समस्या यह है कि यह प्राचीन कोड एक पहेली की तरह है जिसके कुछ हिस्से गायब हैं: अक्षर इस बात पर निर्भर करते हैं कि वे शब्द में कहाँ स्थित हैं और वे अलग दिखते हैं, और एक ही आकृति तीन अलग-अलग ध्वनियाँ व्यक्त कर सकती है। क्योंकि बहुत कम लोगों ने इस प्राचीन कोड में डिजिटल पुस्तकें लिखी हैं, इसलिए कंप्यूटर (AI) इसे सीधे पढ़ने में बहुत खराब हैं। वे भ्रमित हो जाते हैं और कचरा (garbage) अनुवाद उत्पन्न करते हैं।

हालाँकि, वही कहानी एक बहुत ही सामान्य, आधुनिक कोड (सिरिलिक लिपि) में भी लिखी गई है, जो एक स्पष्ट, मानक वर्णमाला की तरह है। कंप्यूटर के सीखने के लिए इस आधुनिक कोड के लाखों उदाहरण उपलब्ध हैं।

यह शोध पत्र एक नई विधि पेश करता है जिसे CoPiT (कॉग्निटिव पिवट ट्रांसलेशन) कहा जाता है। प्राचीन कोड का अर्थ सीधे समझने के लिए कंप्यूटर को मजबूर करने के बजाय, CoPiT एक स्मार्ट अनुवादक की तरह कार्य करता है जो धाराप्रवाह मंगोलियाई बोलने वालों द्वारा उपयोग की जाने वाली एक गुप्त तकनीक जानता है।

"गुप्त तकनीक" का सादृश्य (Analogy)

एक धाराप्रवाह मंगोलियाई वक्ता के बारे में सोचें जो प्राचीन लिपि पढ़ रहा है। वे केवल आकृतियों को देखकर अनुमान नहीं लगाते; उनका मस्तिष्क उन आकृतियों को अपने दिमाग में परिचित आधुनिक अक्षरों में स्वचालित रूप से परिवर्तित करता है, सटीक ध्वनियाँ समझता है, और फिर अर्थ को समझता है।

CoPiT बिल्कुल यही करता है, लेकिन चरणों में:

  1. "रूपात्मक विभाजन" (Morphological Segmentation - केक काटना):
    प्राचीन लिपि अव्यवस्थित है। यह अक्सर अजीब जगहों पर स्थान (spaces) रखती है, जैसे कि फ्रॉस्टिंग लगने से पहले ही केक को काट देना। CoPiT पहले उन टुकड़ों को सावधानीपूर्वक फिर से जोड़ता है, यह पता लगाता है कि शब्द वास्तव में कहाँ शुरू और समाप्त होता है, और मुख्य "केक" (मूल शब्द) के साथ सही "चीनी के छिड़काव" (व्याकरण संबंधी प्रत्यय/suffixes) जोड़ता है।

  2. "स्वर सामंजस्य" (Vowel Harmony - संगीत का नियम):
    मंगोलियाई शब्दों में "स्वर सामंजस्य" नामक एक संगीत नियम होता है। एक शब्द के स्वरों को एक निश्चित "टोन" (जैसे उच्च या निम्न स्वर) में मेल खाना चाहिए। प्राचीन लिपि में, यह अक्सर छिपा हुआ होता है। CoPiT एक संगीत कंडक्टर की तरह कार्य करता है, शब्द के पहले नोट को सुनता है और बाकी सभी नोट्स को सही सामंजस्य के साथ मेल खाने के लिए मजबूर करता है, जिससे संभावनाएं सीमित हो जाती हैं।

  3. "लैटिन सेतु" (The Latin Bridge - बिचौलिया):
    अतिरिक्त निश्चितता के लिए, CoPiT अस्थायी रूप से शब्द को एक "लैटिन" संस्करण (जैसे अंग्रेजी वर्णमाला) में अनुवादित करता है जो सटीक ध्वनियों को दर्शाता है। यह यह सुनिश्चित करने के लिए एक ध्वन्यात्मक नोटबुक में प्राचीन कोड को लिखने जैसा है कि कोई ध्वनि छूट न जाए।

  4. "सिरिलिक रूपांतरण" (The Cyrillic Conversion - अंतिम अनुवाद):
    अब जब ध्वनियाँ स्पष्ट हैं, CoPiT उस शब्द को साफ, आधुनिक सिरिलिक लिपि में लिखता है। यह "पिवट" (pivot) बिंदु है। अब यह एक रहस्यमय प्राचीन पहेली नहीं है; यह एक मानक, अच्छी तरह से समझ में आने वाला पाठ है।

  5. "आत्म-चिंतन" (The Self-Reflection - संपादक):
    अंतिम अनुवादक को पाठ भेजने से पहले, CoPiT एक कदम पीछे हटता है और पूछता है, "क्या यह पूरा वाक्य मिलकर अर्थपूर्ण लग रहा है?" यह व्याकरण और तर्क संबंधी त्रुटियों की जाँच करता है जो व्यक्तिगत शब्द जाँचों के दौरान छूट गई होंगी, यह एक सख्त संपादक की तरह कार्य करता है।

  6. अंतिम अनुवाद:
    अंत में, कंप्यूटर इस साफ, आधुनिक सिरिलिक पाठ का अंग्रेजी, कोरियाई या रूसी में अनुवाद करता है। क्योंकि कंप्यूटर अब एक स्पष्ट, स्पष्ट पाठ के साथ काम कर रहा है, इसलिए अनुवाद बहुत बेहतर होता है।

यह क्यों महत्वपूर्ण है

शोध पत्र दिखाता है कि आधुनिक लिपि के माध्यम से यह "डेतूर" (विपथ) अद्भुत परिणाम देता है।

  • बेहतर परिणाम: इस विधि का उपयोग करने वाले छोटे, ओपन-सोर्स कंप्यूटर मॉडल भी उन विशाल, महंगे "GPT-4" मॉडलों को पछाड़ देते हैं जो सीधे प्राचीन लिपि का अनुवाद करने की कोशिश करते हैं।
  • डेटा का निर्माण: क्योंकि यह विधि प्राचीन लिपि को आधुनिक लिपि में बदलने में इतनी कुशल है, शोधकर्ताओं ने इसका उपयोग अनुवादित वाक्यों के एक विशाल नए पुस्तकालय (8,000+ जोड़े) को बनाने के लिए किया है। यह भविष्य के लिए "डेटा की कमी" की समस्या को हल करने में मदद करता है, जिससे कंप्यूटर बिना मनुष्यों द्वारा हजारों नए अनुवाद लिखे, बेहतर तरीके से सीख सकते हैं।

संक्षेप में, CoPiT कंप्यूटर को प्राचीन कोड में जीनियस बनने के लिए मजबूर नहीं करता है। इसके बजाय, यह कंप्यूटर को प्राचीन कोड को समझने के लिए एक "चीट शीट" (आधुनिक लिपि) देता है, जिससे यह सुनिश्चित होता है कि अंतिम अनुवाद सटीक और स्वाभाविक हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →