← नवीनतम पेपर
💻 computer science

Optical Character Recognition of Historical Moroccan Arabic Calligraphy Using Transformer-Based TrOCR

यह शोध पत्र एक ट्रांसफॉर्मर-आधारित TrOCR ढांचे का प्रस्ताव करता है जो ऐतिहासिक मोरक्कन अरबी पांडुलिपियों से पूर्व-प्रसंस्कृत (preprocessed) पाठ पंक्तियों को सीधे पहचानकर कठिन वर्ण विभाजन (character segmentation) को दरकिनार कर देता है, जिससे डिजिटल विरासत संरक्षण के लिए जटिल, क्षयित सुलेख (degraded calligraphy) का प्रभावी प्रतिलेखन प्राप्त होता है।

मूल लेखक: Adnane Mehdaoui, Khadija El Maaroufi

प्रकाशित 2026-09-15
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adnane Mehdaoui, Khadija El Maaroufi

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

सदियों से, लिखित शब्द मानव स्मृति का प्राथमिक वाहक रहा है, जिसने सभ्यताओं के कानूनों, कहानियों और वैज्ञानिक खोजों को समय के पार पहुँचाया है। फिर भी, जैसे-जैसे कागज पुराना होता है और स्याही फीकी पड़ती है, ये दस्तावेज़ अक्सर आधुनिक आंखों के लिए अपठनीय हो जाते हैं, जो भौतिक क्षय और अपरिचित हस्तलिपि शैलियों की परतों के पीछे बंद हो जाते हैं। कंप्यूटर विज्ञान के क्षेत्र में, ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) नामक एक क्षेत्र में, शोधकर्ताओं ने मशीनों को लगभग पूर्ण सटीकता के साथ मुद्रित पाठ पढ़ने के लिए लंबे समय से प्रशिक्षित किया है। हालाँकि, जब वे मशीनें ऐतिहासिक पांडुलिपियों के अव्यवस्थित, प्रवाहमयी और अक्सर क्षतिग्रस्त पृष्ठों का सामना करती हैं, तो वे अक्सर लड़खड़ा जाती हैं। यह चुनौती विशेष रूप से अरबी सुलेख (कैलिग्राफी) के साथ तीव्र है, जहाँ एक ही शब्द के भीतर अक्षर अक्सर जटिल, घुमावदार श्रृंखलाओं में जुड़े होते हैं जो एक लेखक से दूसरे लेखक के बीच बहुत भिन्न होते हैं। मोरक्कन अरबी पांडुलिपियों की विशिष्ट और सांस्कृतिक रूप से समृद्ध परंपरा के लिए, जो 'मग़रिबी' (Maghribi) लिपि नामक एक विशिष्ट शैली में लिखी गई है, यह कार्य विशेष रूप रूप से कठिन रहा है क्योंकि अक्षर इस तरह से आपस में जुड़ते, ओवरलैप करते और बदलते हैं जो मानक पढ़ने वाले सॉफ़्टवेयर को भ्रमित कर देते हैं।

दो स्वतंत्र शोधकर्ताओं, अदनाने मेहदावी और खदीजा एल मारौफी ने एक नया दृष्टिकोण विकसित करके इस समस्या का समाधान किया है जो व्यक्तिगत अक्षरों को अलग करने की पारंपरिक आवश्यकता को दरकिनार करता है। एक शब्द को उसके घटक भागों में काटने की कोशिश करने के बजाय—एक ऐसा कार्य जो अक्सर तब विफल हो जाता है जब स्याही फैल जाती है या अक्षर मिल जाते हैं—उन्होंने एक आधुनिक कृत्रिम बुद्धिमत्ता प्रणाली को प्रशिक्षित किया कि वह पाठ की पूरी पंक्ति को एक एकल, जुड़ी हुई कहानी के रूप में देखे। 'ट्रांसफॉर्मर' (Transformer) नामक एक उन्नत कंप्यूटर मॉडल का उपयोग करके, जिसे एक साथ पूरे वाक्य के संदर्भ को समझने के लिए डिज़ाइन किया गया है, उन्होंने एक ऐसी प्रणाली बनाई जो इन कठिन ऐतिहासिक पृष्ठों को डिकोड करने में सक्षम है। उनका कार्य यह प्रदर्शित करता है कि सावधानीपूर्वक इमेज क्लीनिंग (छवि सफाई) को एक ऐसे मॉडल के साथ जोड़कर, जो पृथक आकृतियों के बजाय लेखन के प्रवाह से सीखता है, उन रहस्यों को उजागर करना संभव है जो मोरक्कन विरासत के रूप में प्रत्यक्ष रूप से छिपे हुए थे।

शोधकर्ताओं ने खुले स्रोत अभिलेखागारों से दो सौ पृष्ठों के संग्रह के साथ शुरुआत की, जो मोरक्को में पाई जाने वाली अद्वितीय मग़रिबी लिपि का प्रतिनिधित्व करते हैं। ये पृष्ठ निष्कलंक नहीं थे; वे प्राचीन दस्तावेजों की विशिष्ट समस्याओं, जैसे असमान प्रकाश व्यवस्था, फीकी पड़ती स्याही और समय के साथ मुड़े हुए कागज से ग्रस्त थे। इन छवियों को कंप्यूटर के लिए पठनीय बनाने के लिए, टीम ने डेटा को साफ करने और व्यवस्थित करने के लिए एक विशेष पाइपलाइन बनाई। उन्होंने कंट्रास्ट को समायोजित किया ताकि गहरा काला रंग पुराने कागज के मुकाबले स्पष्ट दिखाई दे सके और फिर एक स्मार्ट डिटेक्शन सिस्टम का उपयोग किया जिससे यह पता लगाया जा सके कि पाठ की प्रत्येक पंक्ति कहाँ शुरू होती है और कहाँ समाप्त होती है। यह चरण महत्वपूर्ण था क्योंकि ऐतिहासिक हस्तलिपि अक्सर तिरछी या बदलती रहती है, जिससे मानक उपकरणों के लिए यह बताना कठिन हो जाता है कि एक वाक्य कहाँ रुकता है और अगला कहाँ शुरू होता है। सिस्टम ने व्यक्तिगत पंक्तियों में विभाजित करने के लिए स्याही के अंतराल और घनत्व का स्वचालित रूप से विश्लेषण किया, जिससे छवियों का एक स्वच्छ सेट तैयार हुआ जो सीखने के अगले चरण के लिए तैयार था।

एक बार रेखाएं अलग हो जाने के बाद, शोधकर्ताओं ने 'TrOCR' नामक एक शक्तिशाली उपकरण का उपयोग किया, जिसका अर्थ है 'ट्रांसफॉर्मर-आधारित ऑप्टिकल कैरेक्टर रिकग्निशन'। पुराने सिस्टमों के विपरीत जो एक समय में एक अक्षर की पहचान करने की कोशिश करते थे, यह मॉडल पाठ की पूरी पंक्ति को एक साथ देखकर काम करता है। यह 'सेल्फ-अटेंशन' (self-attention) नामक एक तंत्र का उपयोग करता है, जो कंप्यूटर को पढ़ते समय छवि के विभिन्न हिस्सों के महत्व को तौलने की अनुमति देता है। उदाहरण के लिए, यदि कोई अक्षर थोड़ा विकृत है या उसका कोई बिंदु गायब है, तो मॉडल आसपास के अक्षरों और शब्द के समग्र आकार को देखकर अनुमान लगा सकता है कि वह गायब हिस्सा क्या होना चाहिए। संदर्भ को समझने की यह क्षमता अरबी के लिए अत्यंत महत्वपूर्ण है, जहाँ एक अक्षर का आकार इस बात पर निर्भर करता है कि वह शब्द के प्रारंभ, मध्य या अंत में है, और जहाँ अक्षर के ऊपर या नीचे छोटे बिंदु अर्थ को पूरी तरह से बदल सकते हैं।

इस मॉडल को मोरक्कन अरबी पढ़ना सिखाने के लिए, शोधकर्ताओं ने शून्य से शुरुआत नहीं की। उन्होंने 'ट्रांसफर लर्निंग' नामक एक तकनीक का उपयोग किया, जिसमें एक ऐसे मॉडल को लिया गया जिसे पहले से ही हजारों अंग्रेजी हस्तलिखित दस्तावेजों पर प्रशिक्षित किया गया था और उसे अरबी लिपि के अनुकूल बनाया गया। यह बिल्कुल वैसा ही है जैसे कोई व्यक्ति जिसने पहले से पियानो बजाना सीखा है, वह एक नया वाद्य यंत्र अधिक तेज़ी से सीख सकता है, क्योंकि वह लय और धुन के मूल सिद्धांतों को पहले से ही समझता है। मॉडल को फिर मोरक्कान डेटासेट पर 'फाइन-ट्यून' किया गया, जिससे उसने मग़रिबी लिपि के विशिष्ट घुमावों, जुड़ावों और शैलियों को पहचाना। टीम ने लगभग आठ हजार छवियों और उनके सही पाठ लिप्यंतरण (ट्रांसक्रिप्शन) के जोड़ों पर सिस्टम को प्रशिक्षित किया, जबकि परीक्षण के लिए दो हजार जोड़ों को अलग रखा ताकि यह देखा जा सके कि मॉडल उस सामग्री पर कैसा प्रदर्शन करता है जिसे उसने पहले कभी नहीं देखा था।

इस प्रशिक्षण के परिणामों को 'कैरेक्टर एरर रेट' (Character Error Rate) नामक एक मानक मीट्रिक का उपयोग करके मापा गया, जो यह गिनता है कि कंप्यूटर ने सही पाठ की तुलना में कितने अक्षर गलत पहचाने। परीक्षण सेट पर, मॉडल ने केवल पांच प्रतिशत से थोड़ा अधिक की त्रुटि दर हासिल की। इसका अर्थ है कि पाठ की एक पंक्ति के प्रत्येक सौ अक्षरों में से, सिस्टम ने नब्बे से अधिक अक्षरों की सही पहचान की। शोधकर्ताओं ने नोट किया कि प्रदर्शन प्रशिक्षण, सत्यापन और परीक्षण चरणों में सुसंगत रहा, जो यह सुझाव देता है कि मॉडल ने वास्तव में लिपि के पैटर्न को सीखा है, न कि केवल उन विशिष्ट पृष्ठों को रटा है जिन्हें उसे दिखाया गया था। ऐतिहासिक दस्तावेजों के लिए यह स्तर की सटीकता महत्वपूर्ण है, जहाँ हस्तलिपि की विविधता और क्षति की उपस्थिति पूर्ण पहचान के लिए एक बहुत ऊँचा मानक बनाती है।

इन सफलताओं के बावजूद, लेखक सावधानीपूर्वक यह स्पष्ट करते हैं कि यह कार्य प्राचीन पांडुलिपियों को पढ़ने की सभी समस्याओं का पूर्ण समाधान नहीं है। यह प्रणाली अभी भी 'डायक्रिटिकल मार्क्स' (diacritical marks) के साथ संघर्ष करती है, जो उच्चारण या अर्थ दर्शाने के लिए अक्षरों के ऊपर या नीचे स्थित छोटे बिंदु और रेखाएं होती हैं, जो अक्सर धुंधली या गायब होती हैं। यदि ये निशान गलत पढ़े जाते हैं, तो शब्द का अर्थ पूरी तरह से बदल सकता है। इसके अलावा, मॉडल को पाठ की उन पंक्तियों पर प्रशिक्षित किया गया था जिन्हें सावधानीपूर्वक निकाला गया था; यह अभी तक जटिल लेआउट वाले पूर्ण पृष्ठों को नहीं संभाल सकता है, जैसे कि हाशिये में लिखी गई टिप्पणियाँ या कई कॉलमों में चलता हुआ पाठ। शोधकर्ताओं ने यह भी रेखांकित किया कि एनोटेटेड (व्याख्यात्मक) डेटा की कमी एक बड़ी बाधा बनी हुई है, क्योंकि प्रशिक्षण सेट बनाने के लिए विशेषज्ञों द्वारा पाठ को मैन्युअल रूप से लिप्यंतरित करना पड़ता है, जो एक धीमी और कठिन प्रक्रिया है।

अध्ययन निष्कर्ष निकालता है कि हालांकि डीप लर्निंग ने बड़ी प्रगति की है, लेकिन यह अभी भी मानवीय विशेषज्ञता की आवश्यकता को प्रतिस्थापित नहीं कर सकता या पुराने कागज की हर भौतिक सीमा को पार नहीं कर सकता। हालाँकि, मेहदावी और एल मारौफी द्वारा अपनाया गया दृष्टिकोण एक मजबूत मार्ग प्रदान करता है। बुद्धिमान इमेज प्रीप्रोसेसिंग को एक ऐसे मॉडल के साथ जोड़कर, जो पूरी पंक्ति के संदर्भ को समझता है, उन्होंने एक ऐसा उपकरण बनाया है जो मोरक्कन ऐतिहासिक विरासत के डिजिटलीकरण को महत्वपूर्ण रूप से तेज कर सकता है। यह कार्य केवल संख्याओं की सूची नहीं बनाता है; यह एक व्यावहारिक ढांचा प्रदान करता है जो शोधकर्ताओं को सदियों के भाषाई और सांस्कृतिक ज्ञान तक पहुँचने और उसे संरक्षित करने की अनुमति देता है जो पहले पढ़ने में बहुत कठिन था। जैसे-जैसे यह क्षेत्र आगे बढ़ेगा, त्रुटियों को ठीक करने के लिए भाषा मॉडलों का एकीकरण और बेहतर डेटा ऑग्मेंटेशन तकनीकों का विकास इन प्रणालियों को और अधिक परिष्कृत कर सकता है, जिससे मग़रेब का लिखित इतिहास आधुनिक दुनिया के और करीब आ सकेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →