← नवीनतम पेपर
💻 computer science

TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents

TongGuOCR एक नवीन लेआउट-जागरूक और टोकन-संवर्धित OCR फ्रेमवर्क है जिसे एक प्रीप्रोसेसिंग मॉड्यूल के माध्यम से सुसंगत पहचान ब्लॉकों के लिए और दुर्लभ पात्रों के लिए शब्दावली का विस्तार करने तथा स्थानिक संक्रमणों को मॉडल करने वाले एक टोकन-संवर्धित पहचान मॉड्यूल के माध्यम से चीनी ऐतिहासिक दस्तावेजों को सटीक रूप से ट्रांसक्राइब करने के लिए डिज़ाइन किया गया है, जिससे यह चुनौतीपूर्ण बेंचमार्क पर मौजूदा पारंपरिक और मल्टीमॉडल मॉडलों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

प्रकाशित 2026-08-07
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक हज़ार साल पुरानी डायरी पढ़ने की कोशिश कर रहे हैं, लेकिन पन्ने धूल से ढके हुए हैं, स्याही फीकी पड़ गई है, और लिखावट इतनी अजीब है कि आपका सबसे बुद्धिमान मित्र भी यह नहीं समझ पा रहा है कि अक्षरों का क्या मतलब है। यह उन इतिहासकारों का दैनिक संघर्ष है जो चीनी ऐतिहासिक दस्तावेजों के रहस्यों को खोलने की कोशिश कर रहे हैं। सदियों से, ये बहुमूल्य ग्रंथ स्कैन की गई छवियों में फंसे हुए हैं—कागज की ऐसी तस्वीरें जिन्हें कंप्यूटर देख तो सकते हैं लेकिन इंसानों की तरह "पढ़" नहीं सकते। इन चित्रों को वापस खोज योग्य टेक्स्ट (searchable text) में बदलने के लिए, वैज्ञानिक 'ऑप्टिकल कैरेक्टर रिकग्निशन' (OCR) नामक तकनीक का उपयोग करते हैं। OCR को एक सुपर-फास्ट रोबोट लाइब्रेरियन के रूप में सोचें जो पन्ने की एक तस्वीर देखता है और उसमें दिखने वाले शब्दों को टाइप करता है। हालाँकि, जब वह रोबोट इन अजीब लेआउट, विचित्र प्रतीकों और उलझी हुई पैटर्नों वाली प्राचीन किताबों का सामना करता है, तो वह अक्सर रास्ता भटक जाता है, पंक्तियाँ छोड़ देता है, या निरर्थक शब्द (gibberish) टाइप करने लगता है।

यहीं पर शोधकर्ताओं की एक नई टीम TongGuOCR नामक एक चतुर समाधान के साथ सामने आती है। उन्होंने महसूस किया कि रोबोट को ये किताबें पढ़ने सिखाने का पुराना तरीका एक पूरी पिज्जा को एक ही बार में खाने की कोशिश करने जैसा था; यह बहुत बिखरा हुआ था और रोबोट बारीकियों को नहीं संभाल पा रहा था। इसके बजाय, उन्होंने एक ऐसा सिस्टम बनाया जो पहले पिज्जा को सटीक, प्रबंधनीय स्लाइस में काटता है (लेआउट-अवेयर प्रीप्रोसेसिंग) और फिर रोबोट को उन स्लाइसों पर मौजूद अजीब, दुर्लभ सामग्रियों को समझने के लिए एक विशेष नई भाषा सिखाता है (टोकन-ऑगमेंटेड रिकग्निशन)। इन दोनों तरकीबों को मिलाकर, उन्होंने एक ऐसा रोबोट बनाया जो केवल शब्दों का अनुमान नहीं लगाता, बल्कि प्राचीन पाठ के प्रवाह को समझता है, भले ही वह टेक्स्ट वर्टिकल कॉलम में लिखा हो या पन्ने पर बिखरा हुआ हो।

समस्या: क्यों प्राचीन किताबें रोबोट को विफल कर देती हैं

चीनी ऐतिहासिक दस्तावेज़ संस्कृति के खजाने की तरह हैं, लेकिन उन्हें पढ़ना कठिन है। इनमें अक्सर जटिल लेआउट होते हैं जहाँ टेक्स्ट वर्टिकल (लंबवत) रूप में चलता है, टिप्पणियाँ (छोटे नोट्स) लाइनों के बीच दबी होती हैं, और पढ़ने का क्रम हमेशा बाएं-से-दाएं या ऊपर-से-नीचे नहीं होता है। इसके अलावा, ये किताबें "दुर्लभ पात्रों" (rare characters) से भरी होती हैं—ऐसे प्राचीन प्रतीक जो आधुनिक शब्दकोशों में मौजूद नहीं हैं।

जब मानक AI मॉडल इन पन्नों को पढ़ने की कोशिश करते हैं, तो उन्हें तीन बड़ी समस्याओं का सामना करना पड़ता है:

  1. लेआउट का बिखराव: यदि रोबकर पूरे पन्ने को एक साथ देखता है, तो छवि धुंधली हो जाती है, और वह पास के शब्दों का संदर्भ खो देता है। यदि वह एक समय में एक पंक्ति देखता है, तो वह बड़े चित्र को खो देता है और भ्रमित हो जाता है कि आगे कहाँ जाना है।
  2. दुर्लभ पात्रों की समस्या: आधुनिक AI आज की भाषा पर प्रशिक्षित है। जब यह किसी प्राचीन, दुर्लभ पात्र को देखता है, तो यह अक्सर इसे छोटे, अर्थहीन टुकड़ों में तोड़ देता है (जैसे कि पूरे शब्द को पहचानने के बजाय व्यक्तिगत अक्षरों का अनुमान लगाकर स्पेलिंग करने की कोशिश करना)। यह पात्र को सही ढंग से पहचानने में मुश्किल पैदा करता है।
  3. "आगे कहाँ?" का भ्रम: एक पंक्ति पढ़ने के बाद, रोबोट को अक्सर यह समझ नहीं आता कि उसे नीचे वाली पंक्ति पढ़नी चाहिए, दाईं ओर वाली पंक्ति, या मार्जिन में दी गई कोई टिप्पणी। एक स्पष्ट मानचित्र के बिना, वह पंक्तियाँ छोड़ देता है या उन्हें गलत क्रम में पढ़ता है।

समाधान: TongGuOCR का दो-चरणीय जादू

साउथ चाइना यूनिवर्सिटी ऑफ टेक्नोलॉजी और हुवावेई के शोधकर्ताओं ने TongGuOCR प्रस्तावित किया है, जो विशेष रूप से इन प्राचीन पहेलियों को सुलझाने के लिए बनाया गया एक फ्रेमवर्क है। उन्होंने केवल अधिक कंप्यूटिंग पावर का उपयोग नहीं किया; उन्होंने यह बदल दिया कि रोबोट टेक्स्ट को कैसे देखता और समझता है।

चरण 1: स्मार्ट स्लाइसर (लेआउट-अवेयर प्रीप्रोसेसिंग)

कल्पना कीजिए कि आप एक घने, भीड़भाड़ वाले समाचार पत्र को पढ़ने की कोशिश कर रहे हैं। यदि आप पूरे पन्ने को एक साथ पढ़ने की कोशिश करेंगे, तो आपकी आँखें थक जाएँगी। यदि आप एक बार में एक शब्द पढ़ेंगे, तो आप अर्थ खो देंगे। TongGuOCR एक "स्मार्ट स्लर" का उपयोग करता है जो पन्ने को रिकग्निशन ब्लॉक्स में काटता है।

सीधी रेखाएँ काटने के बजाय, सिस्टम पन्ने को देखता है और टेक्स्ट की लगातार पंक्तियों को व्यवस्थित, सुसंगत समूहों में जोड़ता है। यह एक शेफ की तरह है जो सावधानी से केक को एकदम सही, खाने योग्य टुकड़ों में काटता है ताकि फ्रॉस्टिंग और केक एक साथ रहें, न कि केवल बेतरतीब ढंग से काट दे।

  • यह कैसे काम करता है: सिस्टम टेक्स्ट की पंक्तियों को लेता है और उन्हें विजुअल रूप से सार्थक ब्लॉक्स में समूहित करता है। फिर यह इन ब्लॉक्स को ट्रिम करता है, जिससे पन्ने के वे हिस्से हट जाते हैं जो उस विशिष्ट खंड से संबंधित नहीं हैं।
  • परिणाम: रोबोट को टेक्स्ट का एक साफ, केंद्रित चित्र मिलता है। यह स्थानीय संदर्भ को सुरक्षित रखता है (ताकि वह जान सके कि कौन से शब्द एक-दूसरे के पास हैं) बिना शेष पन्ने के शोर के।

चरण 2: विशेष अनुवादक (टोकन-ऑगमेंटेड रिकग्निशन)

एक बार जब टेक्स्ट को सटीक ब्लॉक्स में काट दिया जाता है, तो रोबोट को इसे पढ़ने की आवश्यकता होती है। यहाँ, TongGuOCR एक "विशेष अनुवादक" का उपयोग करता है जो प्राचीन टेक्स्ट को बेहतर ढंग से समझने में मदद करने के लिए दो नई भाषाओं का उपयोग करता है।

  • भाषा 1: दुर्लभ पात्रों का शब्दकोश।
    आधुनिक AI टोकनाइज़र (वे उपकरण जो कंप्यूटर के पढ़ने के लिए टेक्स्ट को टुकड़ों में तोड़ते हैं) अक्सर दुर्लभ प्राचीन पात्रों को छोटे, भ्रमित करने वाले अंशों में विभाजित कर देते हैं। TongGuOcr इसे हर दुर्लभ पात्र को उसकी अपनी सिंगल-टोकन पहचान देकर ठीक करता है।

    • उपमा: कल्पना कीजिए कि आप एक नई भाषा सीख रहे हैं। हर बार एक कठिन शब्द को अक्षर-दर-अक्षर स्पेल करने के बजाय, आपको उस पूरे शब्द के साथ एक विशेष स्टिकर मिल जाता है। आप बस स्टिकर चिपकाते हैं, और काम हो जाता है। यह रोबोट को दुर्लभ पात्रों को बहुत तेज़ी से और अधिक सटीकता से पहचानने में मदद करता है।
  • भाषा 2: "आगे कहाँ?" का मानचित्र।
    पढ़ने के क्रम के बारे में भ्रम को हल करने के लिए, सिस्टम पंक्तियों के बीच विशेष ट्रांजिशन टोकन डालता है। ये छोटे तीरों या संकेत चिन्हों की तरह हैं जो रोबोट को बताते हैं कि आगे कहाँ देखना है।

    • उपमा: यदि आप कॉमिक बुक पढ़ रहे हैं जहाँ पैनल इधर-उधर कूदते हैं, तो आपको एक गाइड की आवश्यकता होती है जो कहे, "इस पैनल के बाद, ऊपर दाईं ओर जाएँ।" TongGuOCR इस टेक्स्ट स्ट्रीम में इन डिजिटल संकेत चिन्हों (जैसे <right|down> या <left|up>) को जोड़ता है। यह रोबोट की दृष्टि को सही पथ पर निर्देशित करता है, जिससे पंक्तियाँ छोड़ने या उन्हें उल्टा पढ़ने की संभावना कम हो जाती है।

परिणाम: प्राचीन टेक्स्ट के लिए एक नया रिकॉर्ड

टीम ने चीनी ऐतिहासिक दस्तावेजों के दो प्रमुख बेंचमार्क: MTHv2 और M5HisDoc पर TongGuOCR का परीक्षण किया। ये डेटासेट प्राचीन टेक्स्ट रिकग्निशन के "ओलंपिक्स" की तरह हैं, जो कठिन लेआउट और दुर्लभ पात्रों से भरे हुए हैं।

परिणाम प्रभावशाली थे। TongGuOCR ने न केवल अच्छा प्रदर्शन किया; इसने विशाल सामान्य-उद्देश्य वाले AI मॉडल और अन्य विशेष OCR टूल्स सहित मौजूदा सर्वोत्तम तरीकों को भी पीछे छोड़ दिया।

  • चुनौतीपूर्ण M5HisDoc बेंचमार्क पर, TongGuOCR ने 93.76% की सटीकता दर (AR) प्राप्त की।
  • इसने नॉर्मलाइज्ड एडिट डिस्टेंस (NED) को—जो कि रोबोट द्वारा की गई गलतियों का माप है—10.43 से घटाकर 6.15 कर दिया।
  • सबसे महत्वपूर्ण बात, पढ़ने के प्रवाह के लिए, इसने रीडिंग ऑर्डर एडिट डिस्टेंस (RO-ED) को 7.53 से घटाकर 3.49 कर दिया। इसका मतलब है कि रोबोट टेक्स्ट के सही पथ का पालन करने में बहुत बेहतर था, और शायद ही कभी लाइन छोड़ता था या रास्ता भटकता था।

एक विजुअल तुलना में (पेपर के चित्र 4 में दिखाया गया है), जबकि अन्य मॉडल लाइनें छोड़ देते थे, गलत क्रम में पढ़ते थे, या दुर्लभ पात्रों को बिगाड़ देते थे, TongGuOCR ने सफलतापूर्वक प्रत्येक लक्षित पंक्ति को रिकवर किया और ऐतिहासिक पन्ने के प्राकृतिक पठन क्रम का पालन किया।

इसका क्या अर्थ है

पेपर सुझाव देता है कि प्राचीन ग्रंथों को प्रभावी ढंग से पढ़ने के लिए, हम केवल बड़े, अधिक शक्तिशाली AI मॉडल पर निर्भर नहीं रह सकते। हमें इस बात पर ध्यान देना होगा कि हम मॉडल को डेटा कैसे खिलाते हैं। पन्ने को तार्किक खंडों में तोड़कर (लेआउट-अवेयर प्रीप्रोसेसिंग) और मॉडल को बेहतर शब्दावली और पढ़ने के क्रम के लिए एक स्पष्ट मानचित्र देकर (टोकन-ऑगमेंटेड रिकग्निशन), हम इतिहास के उन रहस्यों को खोल सकते हैं जो पहले अपठनीय छवियों के पीछे बंद थे।

शोधकर्ता नोट करते हैं कि हालांकि उनका सिस्टम एक बड़ा कदम है, फिर भी यह अभी पूर्ण नहीं है। यह अपने प्रशिक्षण डेटा में पाए जाने वाले पात्रों पर निर्भर करता है, इसलिए यह पूरी तरह से अज्ञात या अनसुलझे प्रतीकों के साथ संघर्ष कर सकता है। हालाँकि, अधिकांश चीनी ऐतिहासिक दस्तावेजों के लिए, TongGuOCR अतीत के लिए एक शक्तिशाली नई कुंजी प्रदान करता है, जो स्थिर छवियों को जीवित, खोजने योग्य टेक्स्ट में बदल देता है जिसे इतिहासकार और जिज्ञासु मन एक्सप्लोर कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →