FP-THD: Full page transcription of historical documents
यह शोध पत्र FP-THD प्रस्तुत करता है, जो एक पाइपलाइन है जो लेआउट विश्लेषण को एक विस्तारित टेक्स्ट लाइन रिकग्निशन मॉडल के साथ जोड़ता है ताकि हस्तलिखित, मुद्रित और बहुभाषी स्वरूपों में उनके मूल पात्रों, प्रतीकों और लेआउट को संरक्षित करते हुए 15वीं और 16वीं शताब्दी के लैटिन ऐतिहासिक दस्तावेज़ों को कुशलतापूर्वक ट्रांसक्राइब किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक टाइम मशीन है जो एक धूल भरी, 500 साल पुरानी मध्यकालीन लैटिन में लिखी किताब के अंदर ज़ूम कर सकती है। पन्ने मुड़े हुए हैं, स्याही फीकी पड़ गई है, और लिखावट लूप्स, टेढ़े-मेढ़े घुमावों और अजीब प्रतीकों का एक जंगली मिश्रण है जो आज के अक्षरों से बिल्कुल अलग दिखता है। यदि आप एक आधुनिक कंप्यूटर का उपयोग करके इसे पढ़ने की कोशिश करते हैं, तो यह एक रोबोट से उस गुप्त कोड को समझने के लिए कहने जैसा है जिसे उसे कभी सिखाया ही नहीं गया। यह एक लंबे "s" (जो "f" जैसा दिखता है) को "f" में बदल सकता है, या दो अक्षरों को आपस में जोड़कर आधुनिक "ae" बना सकता है, जिससे ऐतिहासिक स्वरूप पूरी तरह से बिगड़ जाता है।
यहाँ FP-THD है, एक नया डिजिटल पाइपलाइन जिसे शोधकर्ताओं की एक टीम द्वारा परम "समय-यात्रा करने वाले लाइब्रेरियन" के रूप में डिजाइन किया गया है। उनका लक्ष्य केवल शब्दों को पढ़ना नहीं था, बल्कि मूल पृष्ठ के सटीक स्वरूप और अहसास को संरक्षित करना था, जिसमें वे पेचीदा संक्षिप्त रूप (abbreviations) और विशेष प्रतीक भी शामिल हैं जिन पर इतिहासकार भरोसा करते हैं।
दो-चरणीय नृत्य: रेखाओं को खोजना, फिर उन्हें पढ़ना
लेखकों ने महसूस किया कि एक पूरे बिखरे हुए पन्ने को एक साथ पढ़ने की कोशिश करना एक पूरी पिज्जा को एक ही बार में खाने की कोशिश करने जैसा है। इसके बजाय, उन्होंने एक पाइपलाइन बनाई जो दो अलग-अलग चरणों में काम करती है, जैसे विशेषज्ञों की एक टीम।
चरण 1: लेआउट जासूस (ParseNet)
सबसे पहले, सिस्टम ParseNet नामक एक टूल का उपयोग एक लेआउट जासूस के रूप में करता है। यह पूरे पेज की इमेज को स्कैन करता है और टेक्स्ट की हर एक लाइन के चारों ओर अदृश्य बॉक्स बनाता है, यह पता लगाता है कि पैराग्राफ कहाँ शुरू होते हैं और कहाँ समाप्त होते हैं, भले ही लाइनें घुमावदार या झुकी हुई हों। यह एक रोबोटिक लाइब्रेरियन की तरह है जो सावधानी से हर वाक्य की रूपरेखा को ट्रेस करता है और उन्हें साफ, सीधी पट्टियों के रूप में काट देता है। यह चरण एक मानचित्र (PAGE XML नामक प्रारूप में) तैयार करता है जो कंप्यूटर को बताता है कि उसे ठीक कहाँ देखना है।
चरण 2: सुपर-रीडर (Masked Autoencoder)
एक बार जब लाइनें काट दी जाती हैं और सीधी कर दी जाती हैं, तो उन्हें दूसरे विशेषज्ञ को सौंप दिया जाता है: एक Masked Autoencoder जो विजन ट्रांसफार्मर (Vision Transformer) द्वारा संचालित है। इस मॉडल को एक सुपर-स्मार्ट छात्र के रूप में सोचें जिसने "खाली स्थान भरने" (fill in the blanks) का खेल खेलकर पढ़ना सीखा है।
यहाँ खेल कैसे काम करता है: कंप्यूटर टेक्स्ट की एक लाइन लेता है, उसके यादृच्छिक (random) हिस्सों को ढक देता है (जैसे कुछ शब्दों पर स्टिकी नोट लगा देना), और फिर आसपास के संकेतों के आधार पर अनुमान लगाने की कोशिश करता है कि नीचे क्या है। इस खेल का लाखों बार विभिन्न प्रकार के लेखन पर अभ्यास करके, मॉडल न केवल आधुनिक अक्षरों को, बल्कि उन अजीब मध्यकालीन प्रतीकों, लिगेचर्स (जैसे "æ"), और टिल्ड्स (~) को भी पहचानना सीख जाता है जो गायब अक्षरों को दर्शाते हैं।
बड़ा परीक्षण: हस्तलिखित बनाम मुद्रित
टीम ने केवल इसे बनाया ही नहीं; उन्होंने इसे तीन अलग-अलग "ट्रेनिंग कैंपों" (डेटासेट) के साथ परख भी डाला:
- रोड्रिगो (हस्तलिखित): 1545 के पुराने स्पेनिश हस्तलेखन के 853 पृष्ठों का संग्रह।
- बेंथम (हस्तलिखित): दार्शनिक जेरेमी बेंथम के प्रसिद्ध पत्र, जो हर तरह की बिखरी हुई लिखावट शैलियों के लिए जाने जाते हैं।
- मोलिनो (मुद्रित): एक बिल्कुल नया डेटासेट जिसे टीम ने स्वयं बनाया है, जिसमें 1s और 1600 के दशक के मुद्रित कानूनी ग्रंथों के 143 पृष्ठ शामिल हैं, जो लैटिन संक्षिप्त रूपों से भरे हुए हैं।
परिणाम: यह कितना प्रभावी रहा?
पेपर दिखाता है कि यह दृष्टिकोण आश्चर्यजनक रूप से प्रभावी है, विशेष रूप से अन्य उपकरणों की तुलना में।
- रोड्रिगो हस्तलेखन के लिए: मॉडल ने बैच साइज 128 के साथ कैरेक्टर एरर रेट (CER) 1.30% और वर्ड एरर रेट (WER) 6.97% प्राप्त किया। इसका मतलब है कि इसने लगभग हर एक अक्षर को सही पहचाना! यह उन अन्य हाई-टेक मॉडलों से बेहतर है जो गलतियों को सुधारने के लिए अतिरिक्त, जटिल चरणों का उपयोग करते हैं।
- बेंथम हस्तलेखन के लिए: इसने CER 4.46% और WER 7.68% प्राप्त किया। हालांकि यह रोड्रिगो के परिणामों की तुलना में थोड़ा अधिक है, लेखक बताते हैं कि इसने यह बिना किसी फैंसी पोस्ट-प्रोसेसिंग ट्रिक्स या बाहरी भाषा गाइडों के किया, जो दक्षता के मामले में एक बड़ी बात है।
- मोलिनो मुद्रित टेक्स्ट के लिए: यह असली आकर्षण था। टीम ने मोलिनो डेटासेट के 10 पृष्ठों पर अपने सिस्टम का परीक्षण किया और इसकी तुलना दो अन्य विधियों से की: Pero-OCR नामक एक लोकप्रिय ओपन-सोर्स टूल और बाइब्लियोटेका वर्टुलल डेल पैट्रिमोनियो डेल बर्ग्राफिको (BVPB) (जिसमें वाणिज्यिक सॉफ्टवेयर का उपयोग किया गया था) का ट्रांसक्रिप्शन।
- BVPB ट्रांसक्रिप्शन में CER 0.3379 और WER 0.6835 था।
- Pero-OCR में CER 0.0242 और WER 0.2106 था।
- FP-THD सबसे कम त्रुटियों के साथ आया: CER 0.0178 और WER 0.0450।
सरल भाषा में, नए सिस्टम ने वाणिज्यिक सॉफ्टवेयर और अन्य ओपन-सोर्स टूल की तुलना में कम गलतियाँ कीं, जिससे Pero-OCR की तुलना में शब्द-स्तर की त्रुटियां लगभग 80% और BVPB ट्रांसक्रिप्शन की तुलना में 90% से अधिक कम हो गईं। इसने उन महत्वपूर्ण मध्यकालीन टिल्ड्स और संक्षिप्त रूपों को बनाए रखने में भी बेहतर प्रदर्शन किया।
यह क्या नहीं कर सकता (अभी तक)
लेखक उनके जादू की सीमाओं के बारे में ईमानदार हैं। सिस्टम पेज के बीच के मुख्य टेक्स्ट को पढ़ने में बहुत अच्छा है, लेकिन यह कभी-कभी निम्नलिखित चीजों के साथ संघर्ष करता है:
- मार्जिनल नोट्स: पेज के हाशिए में लिखे छोटे नोट छूट सकते हैं या गलत तरीके से ट्रांसक्राइब किए जा सकते हैं।
- एकल शब्द: यदि किसी लाइन में केवल एक शब्द है, तो मॉडल भ्रमित हो सकता है क्योंकि इसे मुख्य रूप से लंबी लाइनों के लिए प्रशिक्षित किया गया था।
निष्कर्ष
यह पेपर यह दावा नहीं करता है कि इसने इतिहास को हमेशा के लिए पढ़ने की समस्या को हल कर दिया है। इसके बजाय, यह सुझाव देता है कि एक लेआउट जासूस और एक "खाली स्थान भरने" वाले रीडर को जोड़कर, हम एक ऐसा उपकरण बना सकते हैं जो अत्यधिक सटीक, मुफ्त और ऐतिहासिक दस्तावेजों की मूल शैली के प्रति सम्मानजनक हो। यह साबित करता है कि इसे समझने के लिए आपको पुराने लैटिन को आधुनिक टेक्स्ट में बदलने की आवश्यकता नहीं है; आप पुराने स्टाइल को बरकरार रख सकते हैं, और कंप्यूटर फिर भी इसे पढ़ सकता है।
टीम इसे अपने प्रशिक्षण डेटा में अधिक अलग शब्दों को जोड़कर और अंततः इस सिस्टम का उपयोग संक्षिप्त रूपों को स्वचालित रूप से विस्तारित करने और लैटिन से स्पेनिश में अनुवाद करने के लिए करके सुधारना जारी रखने की योजना बना रही है। लेकिन फिलहाल, उन्होंने दिखाया है कि सही पाइपलाइन के साथ, सबसे बिखरे हुए मध्यकालीन पृष्ठों को भी उनकी आत्मा खोए बिना साफ, डिजिटल टेक्स्ट में बदला जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।