TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents
TongGuOCR एक नवीन लेआउट-जागरूक और टोकन-संवर्धित OCR फ्रेमवर्क है जिसे एक प्रीप्रोसेसिंग मॉड्यूल के माध्यम से सुसंगत पहचान ब्लॉकों के लिए और दुर्लभ पात्रों के लिए शब्दावली का विस्तार करने तथा स्थानिक संक्रमणों को मॉडल करने वाले एक टोकन-संवर्धित पहचान मॉड्यूल के माध्यम से चीनी ऐतिहासिक दस्तावेजों को सटीक रूप से ट्रांसक्राइब करने के लिए डिज़ाइन किया गया है, जिससे यह चुनौतीपूर्ण बेंचमार्क पर मौजूदा पारंपरिक और मल्टीमॉडल मॉडलों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक हज़ार साल पुरानी डायरी पढ़ने की कोशिश कर रहे हैं, लेकिन पन्ने धूल से ढके हुए हैं, स्याही फीकी पड़ गई है, और लिखावट इतनी अजीब है कि आपका सबसे बुद्धिमान मित्र भी यह नहीं समझ पा रहा है कि अक्षरों का क्या मतलब है। यह उन इतिहासकारों का दैनिक संघर्ष है जो चीनी ऐतिहासिक दस्तावेजों के रहस्यों को खोलने की कोशिश कर रहे हैं। सदियों से, ये बहुमूल्य ग्रंथ स्कैन की गई छवियों में फंसे हुए हैं—कागज की ऐसी तस्वीरें जिन्हें कंप्यूटर देख तो सकते हैं लेकिन इंसानों की तरह "पढ़" नहीं सकते। इन चित्रों को वापस खोज योग्य टेक्स्ट (searchable text) में बदलने के लिए, वैज्ञानिक 'ऑप्टिकल कैरेक्टर रिकग्निशन' (OCR) नामक तकनीक का उपयोग करते हैं। OCR को एक सुपर-फास्ट रोबोट लाइब्रेरियन के रूप में सोचें जो पन्ने की एक तस्वीर देखता है और उसमें दिखने वाले शब्दों को टाइप करता है। हालाँकि, जब वह रोबोट इन अजीब लेआउट, विचित्र प्रतीकों और उलझी हुई पैटर्नों वाली प्राचीन किताबों का सामना करता है, तो वह अक्सर रास्ता भटक जाता है, पंक्तियाँ छोड़ देता है, या निरर्थक शब्द (gibberish) टाइप करने लगता है।
यहीं पर शोधकर्ताओं की एक नई टीम TongGuOCR नामक एक चतुर समाधान के साथ सामने आती है। उन्होंने महसूस किया कि रोबोट को ये किताबें पढ़ने सिखाने का पुराना तरीका एक पूरी पिज्जा को एक ही बार में खाने की कोशिश करने जैसा था; यह बहुत बिखरा हुआ था और रोबोट बारीकियों को नहीं संभाल पा रहा था। इसके बजाय, उन्होंने एक ऐसा सिस्टम बनाया जो पहले पिज्जा को सटीक, प्रबंधनीय स्लाइस में काटता है (लेआउट-अवेयर प्रीप्रोसेसिंग) और फिर रोबोट को उन स्लाइसों पर मौजूद अजीब, दुर्लभ सामग्रियों को समझने के लिए एक विशेष नई भाषा सिखाता है (टोकन-ऑगमेंटेड रिकग्निशन)। इन दोनों तरकीबों को मिलाकर, उन्होंने एक ऐसा रोबोट बनाया जो केवल शब्दों का अनुमान नहीं लगाता, बल्कि प्राचीन पाठ के प्रवाह को समझता है, भले ही वह टेक्स्ट वर्टिकल कॉलम में लिखा हो या पन्ने पर बिखरा हुआ हो।
समस्या: क्यों प्राचीन किताबें रोबोट को विफल कर देती हैं
चीनी ऐतिहासिक दस्तावेज़ संस्कृति के खजाने की तरह हैं, लेकिन उन्हें पढ़ना कठिन है। इनमें अक्सर जटिल लेआउट होते हैं जहाँ टेक्स्ट वर्टिकल (लंबवत) रूप में चलता है, टिप्पणियाँ (छोटे नोट्स) लाइनों के बीच दबी होती हैं, और पढ़ने का क्रम हमेशा बाएं-से-दाएं या ऊपर-से-नीचे नहीं होता है। इसके अलावा, ये किताबें "दुर्लभ पात्रों" (rare characters) से भरी होती हैं—ऐसे प्राचीन प्रतीक जो आधुनिक शब्दकोशों में मौजूद नहीं हैं।
जब मानक AI मॉडल इन पन्नों को पढ़ने की कोशिश करते हैं, तो उन्हें तीन बड़ी समस्याओं का सामना करना पड़ता है:
- लेआउट का बिखराव: यदि रोबकर पूरे पन्ने को एक साथ देखता है, तो छवि धुंधली हो जाती है, और वह पास के शब्दों का संदर्भ खो देता है। यदि वह एक समय में एक पंक्ति देखता है, तो वह बड़े चित्र को खो देता है और भ्रमित हो जाता है कि आगे कहाँ जाना है।
- दुर्लभ पात्रों की समस्या: आधुनिक AI आज की भाषा पर प्रशिक्षित है। जब यह किसी प्राचीन, दुर्लभ पात्र को देखता है, तो यह अक्सर इसे छोटे, अर्थहीन टुकड़ों में तोड़ देता है (जैसे कि पूरे शब्द को पहचानने के बजाय व्यक्तिगत अक्षरों का अनुमान लगाकर स्पेलिंग करने की कोशिश करना)। यह पात्र को सही ढंग से पहचानने में मुश्किल पैदा करता है।
- "आगे कहाँ?" का भ्रम: एक पंक्ति पढ़ने के बाद, रोबोट को अक्सर यह समझ नहीं आता कि उसे नीचे वाली पंक्ति पढ़नी चाहिए, दाईं ओर वाली पंक्ति, या मार्जिन में दी गई कोई टिप्पणी। एक स्पष्ट मानचित्र के बिना, वह पंक्तियाँ छोड़ देता है या उन्हें गलत क्रम में पढ़ता है।
समाधान: TongGuOCR का दो-चरणीय जादू
साउथ चाइना यूनिवर्सिटी ऑफ टेक्नोलॉजी और हुवावेई के शोधकर्ताओं ने TongGuOCR प्रस्तावित किया है, जो विशेष रूप से इन प्राचीन पहेलियों को सुलझाने के लिए बनाया गया एक फ्रेमवर्क है। उन्होंने केवल अधिक कंप्यूटिंग पावर का उपयोग नहीं किया; उन्होंने यह बदल दिया कि रोबोट टेक्स्ट को कैसे देखता और समझता है।
चरण 1: स्मार्ट स्लाइसर (लेआउट-अवेयर प्रीप्रोसेसिंग)
कल्पना कीजिए कि आप एक घने, भीड़भाड़ वाले समाचार पत्र को पढ़ने की कोशिश कर रहे हैं। यदि आप पूरे पन्ने को एक साथ पढ़ने की कोशिश करेंगे, तो आपकी आँखें थक जाएँगी। यदि आप एक बार में एक शब्द पढ़ेंगे, तो आप अर्थ खो देंगे। TongGuOCR एक "स्मार्ट स्लर" का उपयोग करता है जो पन्ने को रिकग्निशन ब्लॉक्स में काटता है।
सीधी रेखाएँ काटने के बजाय, सिस्टम पन्ने को देखता है और टेक्स्ट की लगातार पंक्तियों को व्यवस्थित, सुसंगत समूहों में जोड़ता है। यह एक शेफ की तरह है जो सावधानी से केक को एकदम सही, खाने योग्य टुकड़ों में काटता है ताकि फ्रॉस्टिंग और केक एक साथ रहें, न कि केवल बेतरतीब ढंग से काट दे।
- यह कैसे काम करता है: सिस्टम टेक्स्ट की पंक्तियों को लेता है और उन्हें विजुअल रूप से सार्थक ब्लॉक्स में समूहित करता है। फिर यह इन ब्लॉक्स को ट्रिम करता है, जिससे पन्ने के वे हिस्से हट जाते हैं जो उस विशिष्ट खंड से संबंधित नहीं हैं।
- परिणाम: रोबोट को टेक्स्ट का एक साफ, केंद्रित चित्र मिलता है। यह स्थानीय संदर्भ को सुरक्षित रखता है (ताकि वह जान सके कि कौन से शब्द एक-दूसरे के पास हैं) बिना शेष पन्ने के शोर के।
चरण 2: विशेष अनुवादक (टोकन-ऑगमेंटेड रिकग्निशन)
एक बार जब टेक्स्ट को सटीक ब्लॉक्स में काट दिया जाता है, तो रोबोट को इसे पढ़ने की आवश्यकता होती है। यहाँ, TongGuOCR एक "विशेष अनुवादक" का उपयोग करता है जो प्राचीन टेक्स्ट को बेहतर ढंग से समझने में मदद करने के लिए दो नई भाषाओं का उपयोग करता है।
भाषा 1: दुर्लभ पात्रों का शब्दकोश।
आधुनिक AI टोकनाइज़र (वे उपकरण जो कंप्यूटर के पढ़ने के लिए टेक्स्ट को टुकड़ों में तोड़ते हैं) अक्सर दुर्लभ प्राचीन पात्रों को छोटे, भ्रमित करने वाले अंशों में विभाजित कर देते हैं। TongGuOcr इसे हर दुर्लभ पात्र को उसकी अपनी सिंगल-टोकन पहचान देकर ठीक करता है।- उपमा: कल्पना कीजिए कि आप एक नई भाषा सीख रहे हैं। हर बार एक कठिन शब्द को अक्षर-दर-अक्षर स्पेल करने के बजाय, आपको उस पूरे शब्द के साथ एक विशेष स्टिकर मिल जाता है। आप बस स्टिकर चिपकाते हैं, और काम हो जाता है। यह रोबोट को दुर्लभ पात्रों को बहुत तेज़ी से और अधिक सटीकता से पहचानने में मदद करता है।
भाषा 2: "आगे कहाँ?" का मानचित्र।
पढ़ने के क्रम के बारे में भ्रम को हल करने के लिए, सिस्टम पंक्तियों के बीच विशेष ट्रांजिशन टोकन डालता है। ये छोटे तीरों या संकेत चिन्हों की तरह हैं जो रोबोट को बताते हैं कि आगे कहाँ देखना है।- उपमा: यदि आप कॉमिक बुक पढ़ रहे हैं जहाँ पैनल इधर-उधर कूदते हैं, तो आपको एक गाइड की आवश्यकता होती है जो कहे, "इस पैनल के बाद, ऊपर दाईं ओर जाएँ।" TongGuOCR इस टेक्स्ट स्ट्रीम में इन डिजिटल संकेत चिन्हों (जैसे
<right|down>या<left|up>) को जोड़ता है। यह रोबोट की दृष्टि को सही पथ पर निर्देशित करता है, जिससे पंक्तियाँ छोड़ने या उन्हें उल्टा पढ़ने की संभावना कम हो जाती है।
- उपमा: यदि आप कॉमिक बुक पढ़ रहे हैं जहाँ पैनल इधर-उधर कूदते हैं, तो आपको एक गाइड की आवश्यकता होती है जो कहे, "इस पैनल के बाद, ऊपर दाईं ओर जाएँ।" TongGuOCR इस टेक्स्ट स्ट्रीम में इन डिजिटल संकेत चिन्हों (जैसे
परिणाम: प्राचीन टेक्स्ट के लिए एक नया रिकॉर्ड
टीम ने चीनी ऐतिहासिक दस्तावेजों के दो प्रमुख बेंचमार्क: MTHv2 और M5HisDoc पर TongGuOCR का परीक्षण किया। ये डेटासेट प्राचीन टेक्स्ट रिकग्निशन के "ओलंपिक्स" की तरह हैं, जो कठिन लेआउट और दुर्लभ पात्रों से भरे हुए हैं।
परिणाम प्रभावशाली थे। TongGuOCR ने न केवल अच्छा प्रदर्शन किया; इसने विशाल सामान्य-उद्देश्य वाले AI मॉडल और अन्य विशेष OCR टूल्स सहित मौजूदा सर्वोत्तम तरीकों को भी पीछे छोड़ दिया।
- चुनौतीपूर्ण M5HisDoc बेंचमार्क पर, TongGuOCR ने 93.76% की सटीकता दर (AR) प्राप्त की।
- इसने नॉर्मलाइज्ड एडिट डिस्टेंस (NED) को—जो कि रोबोट द्वारा की गई गलतियों का माप है—10.43 से घटाकर 6.15 कर दिया।
- सबसे महत्वपूर्ण बात, पढ़ने के प्रवाह के लिए, इसने रीडिंग ऑर्डर एडिट डिस्टेंस (RO-ED) को 7.53 से घटाकर 3.49 कर दिया। इसका मतलब है कि रोबोट टेक्स्ट के सही पथ का पालन करने में बहुत बेहतर था, और शायद ही कभी लाइन छोड़ता था या रास्ता भटकता था।
एक विजुअल तुलना में (पेपर के चित्र 4 में दिखाया गया है), जबकि अन्य मॉडल लाइनें छोड़ देते थे, गलत क्रम में पढ़ते थे, या दुर्लभ पात्रों को बिगाड़ देते थे, TongGuOCR ने सफलतापूर्वक प्रत्येक लक्षित पंक्ति को रिकवर किया और ऐतिहासिक पन्ने के प्राकृतिक पठन क्रम का पालन किया।
इसका क्या अर्थ है
पेपर सुझाव देता है कि प्राचीन ग्रंथों को प्रभावी ढंग से पढ़ने के लिए, हम केवल बड़े, अधिक शक्तिशाली AI मॉडल पर निर्भर नहीं रह सकते। हमें इस बात पर ध्यान देना होगा कि हम मॉडल को डेटा कैसे खिलाते हैं। पन्ने को तार्किक खंडों में तोड़कर (लेआउट-अवेयर प्रीप्रोसेसिंग) और मॉडल को बेहतर शब्दावली और पढ़ने के क्रम के लिए एक स्पष्ट मानचित्र देकर (टोकन-ऑगमेंटेड रिकग्निशन), हम इतिहास के उन रहस्यों को खोल सकते हैं जो पहले अपठनीय छवियों के पीछे बंद थे।
शोधकर्ता नोट करते हैं कि हालांकि उनका सिस्टम एक बड़ा कदम है, फिर भी यह अभी पूर्ण नहीं है। यह अपने प्रशिक्षण डेटा में पाए जाने वाले पात्रों पर निर्भर करता है, इसलिए यह पूरी तरह से अज्ञात या अनसुलझे प्रतीकों के साथ संघर्ष कर सकता है। हालाँकि, अधिकांश चीनी ऐतिहासिक दस्तावेजों के लिए, TongGuOCR अतीत के लिए एक शक्तिशाली नई कुंजी प्रदान करता है, जो स्थिर छवियों को जीवित, खोजने योग्य टेक्स्ट में बदल देता है जिसे इतिहासकार और जिज्ञासु मन एक्सप्लोर कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।