← नवीनतम पेपर
🤖 machine learning

Digitizing Nepal's Written Heritage: A Comprehensive HTR Pipeline for Old Nepali Manuscripts

यह शोध पत्र पुराने नेपाली पांडुलिपियों के लिए पहला एंड-टू-एंड हस्तलिखित पाठ पहचान (Handwritten Text Recognition) पाइपलाइन प्रस्तुत करता है, जिसने एनकोडर-डिकोडर आर्किटेक्चर और डेटा-केंद्रित तकनीकों के व्यवस्थित अन्वेषण के माध्यम से 4.9% वर्ण त्रुटि दर (Character Error Rate) प्राप्त की है, साथ ही कम-संसाधन वाले ऐतिहासिक लिपि अनुसंधान को समर्थन देने के लिए कोड और कॉन्फ़िगरेशन भी जारी किए हैं।

मूल लेखक: Anjali Sarawgi, Esteban Garces Arias, Christof Zotter

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anjali Sarawgi, Esteban Garces Arias, Christof Zotter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास प्राचीन, नाजुक किताबों का एक पुस्तकालय है जो एक ऐसी भाषा में लिखी गई है जिसे सदियों से उसके मूल रूप में नहीं बोला गया है। स्याही फीकी पड़ गई है, कागज सिकुड़ा हुआ है, और लिखावट इतनी अनूठी है जैसे किसी उंगलियों के निशान की हो—कोई भी दो लेखक एक जैसा नहीं लिखते। इन किताबों को पढ़ने के लिए कंप्यूटर को तैयार करना एक रोबोट को उस गुप्त कोड को समझने के लिए कहने जैसा है जो हजारों अलग-अलग कलाकारों द्वारा लिखा गया है, और वे सभी प्रतीकों की एक उलझी हुई बेलों जैसी लिपि का उपयोग कर रहे हैं।

यह शोध पत्र इस बात की कहानी है कि कैसे शोधकर्ताओं की एक टीम ने पुरानी नेपाली पांडुलिपियों को डिजिटल बनाने के लिए एक "सुपर-रीडर" बनाया। उन्होंने इसे कैसे किया, यहाँ सरल भाषा में समझाया गया है:

चुनौती: घास के ढेर में सुई ढूँढना

शोधकर्ता कंप्यूटर को पुरानी नेपाली पढ़ना सिखाना चाहते थे, जो देवनागरी लिपि (वही लिपि जिसका उपयोग आधुनिक हिंदी और नेपाली के लिए किया जाता है, लेकिन कुछ पुराने-ढटे अंदाज़ के साथ) में लिखी गई है।

  • समस्या: कंप्यूटर के अध्ययन के लिए इन पुराने हस्तलिखित नोट्स के बहुत कम उदाहरण उपलब्ध हैं। यह किसी को एक विशिष्ट प्रकार के पक्षी को पहचानने के लिए सिखाने जैसा है जब आपके पास केवल उसकी तीन धुंधली तस्वीरें हों।
  • अव्यवस्था: दस्तावेज़ अस्त-व्यस्त हैं। स्याही फैल गई है, कागज मुड़ा हुआ है, और लेखकों ने शब्दों के बीच खाली जगह (स्पेस) का उपयोग नहीं किया था। उन्होंने कुछ अजीब प्रतीकों का भी उपयोग किया जो बिंदुओं या रेखाओं की तरह दिखते हैं, जो उनके स्थान के आधार पर अपना अर्थ बदल देते हैं।

समाधान: तीन-चरणीय प्रशिक्षण शिविर

चूंकि उनके पास कंप्यूटर को सीधे सिखाने के लिए पर्याप्त "असली" पुरानी किताबें नहीं थीं, इसलिए उन्होंने एक तीन-चरणीय प्रशिक्षण पाइपलाइन बनाई। इसे एक छात्र के जाने के रूप में समझें जो पीएचडी थीसिस करने से पहले किंडरगार्टन से कॉलेज तक जाता है।

  1. चरण 1: सिंथेटिक प्लेग्राउंड (किंडरगार्टन)
    कंप्यूटर अभी असली पुरानी किताबों से नहीं सीख सकता था क्योंकि वे पर्याप्त नहीं थीं। इसलिए, टीम ने कंप्यूटर-जनित टेक्स्ट का उपयोग करके एक विशाल "नकली" लाइब्रेरी बनाई। उन्होंने आधुनिक नेपाली पाठ्यपुस्तकों को लिया, उन्हें 11 अलग-अलग फोंट में छापा, और फिर जानबूझकर उन्हें "खराब" कर दिया। उन्होंने डिजिटल शोर जोड़ा, रेखाओं को धुंधला किया, और पन्नों को इस तरह मरोड़ा जैसे कि वे 200 साल तक धूल भरी अटारी में पड़े रहे हों। इससे कंप्यूटर को अक्षरों के बुनियादी आकार सीखने के लिए 1,00,000 अभ्यास उदाहरण मिले।

  2. चरण 2: प्रिंटेड ब्रिज (हाई स्कूल)
    इसके बाद, वे वास्तविक, लेकिन मुद्रित (प्रिंटेड) देवनागरी टेक्स्ट पर आए। यह एक वीडियो गेम से वास्तविक कक्षा में जाने जैसा है। टेक्स्ट अभी भी साफ और स्पष्ट है, लेकिन यह एक विश्वविद्यालय के संग्रह से प्राप्त वास्तविक डेटा है। इस कदम ने कंप्यूटर को "नकली" बिखरे हुए चित्रों और वास्तविक दुनिया के बीच के अंतर को पाटने में मदद की।

  3. चरण 3: अंतिम परीक्षा (कॉलेज)
    अंत में, उन्होंने कंप्यूटर को असली खजाना खिलाया: 155 प्राचीन पांडुलिपियों से 3,100 पंक्तियाँ वास्तविक, हस्तलिखित पुरानी नेपाली। क्योंकि कंप्यूटर पहले दो चरणों पर अच्छी तरह से प्रशिक्षित हो चुका था, अब वह विशेष रूप से पुरानी लिखावट, धब्बों और लेखकों की अनूठी शैली पर ध्यान केंद्रित कर सकता था।

सीक्रेट सॉस: सफाई और खिंचाव

शोधकर्ताओं ने महसूस किया कि डेटा की गुणवत्ता कंप्यूटर के दिमाग की जटिलता से अधिक महत्वपूर्ण थी।

  • लेबल की सफाई: उन्होंने पाया कि डिजिटल नोट्स जो यह बताते थे कि लिखावट को क्या कहना चाहिए था, उनमें छोटी त्रुटियां थीं (जैसे एक ही बिंदु प्रतीक के लिए दो अलग-अलग कोड का उपयोग करना)। उन्होंने इन नोट्स को "साफ" किया ताकि कंप्यूटर अपने ही शिक्षक से भ्रमित न हो।
  • डेटा ऑग्मेंटेशन (जिम): कंप्यूटर को मजबूत बनाने के लिए, उन्होंने मौजूदा छवियों को डिजिटल रूप से "खींचा," "मरोड़ा," और "धुंधला" किया। यह एक वेटलिफ्टर द्वारा बारबेल पर अतिरिक्त वजन जोड़ने जैसा है। मौजूदा पृष्ठों के हजारों थोड़े अलग संस्करणों पर कंप्यूटर से अभ्यास करवाकर, इसने विकृत होने पर भी टेक्स्ट को पहचानना सीख लिया।

परिणाम: एक लगभग सटीक पाठक

टीम ने अपने सिस्टम का परीक्षण अन्य उपकरणों (जैसे गूगल के मानक OCR और अपने स्वयं के मॉडल के एक बुनियादी संस्करण) के विरुद्ध किया।

  • स्कोर: उनके सर्वश्रेष्ठ मॉडल ने केवल 4.9% वर्णों (characters) पर गलती की। इसका मतलब है कि यदि आप उसे 1,000 अक्षरों वाला एक पृष्ठ देते हैं, तो वह लगभग 951 को सही ढंग से पढ़ लेगा।
  • तुलना: मानक उपकरण बुरी तरह विफल रहे, अक्सर जटिल जुड़े हुए अक्षरों (संयुक्ताक्षर) को मिस कर देते हैं जो इस लिपि में आम हैं। उनका कस्टम मॉडल काफी बेहतर था।

कंप्यूटर कहाँ गलत हुआ

95% सफलता दर के बावजूद, कंप्यूटर पूर्ण नहीं है। शोधकर्ताओं ने त्रुटियों का विश्लेषण किया और पाया कि वे यादृच्छिक (random) नहीं थीं।

  • दृश्य जुड़वां (Visual Twins): कंप्यूटर अक्सर उन अक्षरों के बीच भ्रमित हो जाता है जो लिखावट में बहुत समान दिखते हैं (जैसे 'य' और 'प')। यह एक इंसान द्वारा हाथ से लिखे गए 'b' और 'd' में भ्रमित होने जैसा है।
  • लंबी जद्दोजहद: कंप्यूटर ने छोटे और मध्यम वाक्यों पर शानदार प्रदर्शन किया, लेकिन बहुत लंबी लाइनों (120 से अधिक वर्णों) पर लड़खड़ाने लगा। ऐसा लगता है कि कंप्यूटर "थक" जाता है या अपना स्थान खो देता है जब टेक्स्ट बहुत लंबा हो जाता है, संभवतः इसलिए क्योंकि प्रशिक्षण के दौरान उसने पर्याप्त लंबे उदाहरण नहीं देखे थे।

निष्कर्ष

शोधकर्ताओं ने एक वेब ऐप बनाया है जहाँ आप किसी पुरानी पांडुलिपि की फोटो अपलोड कर सकते हैं, और यह स्वचालित रूप से टेक्स्ट की पंक्तियों को खोजकर उन्हें आपके लिए टाइप कर देगा।

बड़ा सबक: प्राचीन, बिखरी हुई लिखावट की दुनिया में, डेटा ही सर्वोपरि है। आपको जरूरी नहीं कि एक बड़ा, अधिक जटिल कंप्यूटर दिमाग चाहिए; आपको बेहतर प्रशिक्षण डेटा, साफ लेबल और "बिखरे हुए" उदाहरणों के साथ बहुत अधिक अभ्यास की आवश्यकता है। अपने प्रशिक्षण प्रक्रिया को सावधानीपूर्वक व्यवस्थित करके, उन्होंने एक कम-संसाधन वाली, कठिन भाषा को ऐसी चीज़ में बदल दिया जिसे कंप्यूटर उच्च सटीकता के साथ पढ़ सकता है, जिससे नेपाल के लिखित इतिहास को भविष्य के लिए संरक्षित करने में मदद मिल रही है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →