Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers
यह शोध पत्र 'इंस्टीट्यूशनल न्यूजपेपर पाइपलाइन' को प्रस्तुत करता है, जो बोस्टन पब्लिक लाइब्रेरी के सहयोग से विकसित एक मॉड्यूलर और गणनात्मक रूप से कुशल प्रणाली है, जो ऐतिहासिक समाचार पत्रों के 1.4 मिलियन से अधिक स्कैन को सेगमेंटेशन, ओसीआर (OCR) और उन्नत पाठ विश्लेषण के एक बहु-चरणीय वर्कफ़्लो के माध्यम से 16.3 बिलियन उच्च-गुणवत्ता वाले टोकन वाले एक संरचित, ओपन डेटासेट में संसाधित करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
समाचार पत्र मानव जीवन का दैनिक रिकॉर्ड हैं, जो स्थानीय चुनावों से लेकर आटे की कीमत तक, और शोक संदेशों से लेकर नए आविष्कारों के विज्ञापनों तक सब कुछ दर्ज करते हैं। सदियों से, ये कहानियाँ नाजुक कागज पर संरक्षित रही हैं, लेकिन डिजिटल युग में, पुस्तकालयों ने इन्हें सुलभ बनाने के लिए लाखों पृष्ठों को स्कैन किया है। हालाँकि, समाचार पत्र के पृष्ठ की एक तस्वीर को उपयोगी, खोजने योग्य पाठ (टेक्स्ट) में बदलना आश्चर्यजनक रूप से कठिन है। ये पृष्ठ सघन और अव्यवस्थित होते हैं, जो पाठ के कॉलम, सजावटी सुर्खियों और विज्ञापनों से भरे होते हैं जो अक्सर एक-दूसरे में मिल जाते हैं। मानक कंप्यूटर प्रोग्राम, जो साफ दस्तावेजों पर अच्छी तरह काम करते हैं, इस अराजकता से भ्रमित हो जाते हैं, जिससे ऐसा पाठ उत्पन्न होता है जो त्रुटियों से भरा होता है या जिसमें पूरे खंड गायब होते हैं। यह शोधकर्ताओं और आर्टिफिशियल इंटेलिजेंस प्रणालियों के लिए एक बाधा पैदा करता है जो इतिहास से सीखना चाहते हैं, क्योंकि वे पृष्ठ पर लिखे गए को आसानी से पढ़ नहीं सकते।
हार्वर्ड लॉ स्कूल और बोस्टन पब्लिक लाइब्रेरी के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने का एक नया तरीका विकसित किया है। उन्होंने एक चरण-दर-चरण प्रणाली बनाई है जिसे एक एकल समाचार पत्र के पृष्ठ को उसके सबसे छोटे, सबसे तार्किक टुकड़ों में तोड़ने, प्रत्येक टुकड़े में पाठ को उच्च सटीकता के साथ पढ़ने और फिर सब कुछ व्यवस्थित करने के लिए डिज़ाइन किया गया है ताकि एक कंप्यूटर लेआउट और सामग्री को समझ सके। उनका लक्ष्य केवल पाठ को डिजिटाइज़ करना नहीं था, बल्कि एक स्वच्छ, संरचित डेटासेट बनाना था जो एक मिलियन से अधिक ऐतिहासिक समाचार पत्रों के स्कैन की वास्तविक सामग्री को प्रकट करे। प्रत्येक अलग पाठ ब्लॉक या छवि को एक अलग आइटम के रूप में मानकर, वे उन सामग्रियों से अरबों शब्द निकालने में सफल रहे जो पहले प्रभावी ढंग से उपयोग करने के लिए बहुत अधिक अव्यवस्थित थीं।
प्रक्रिया एक डिजिटल समाचार पत्र के पृष्ठ की छवि लेने और कंप्यूटर को इसे एक मानव पाठक की तरह देखने के लिए प्रशिक्षित करने से शुरू होती है। पूरे पृष्ठ को एक साथ पढ़ने के बजाय, प्रणाली पहले सामग्री के प्रत्येक विशिष्ट ब्लॉक की पहचान करती है, जैसे कि एक एकल लेख, एक तस्वीर, या एक विज्ञापन। शोधकर्ताओं ने कंप्यूटर मॉडल को हजारों उदाहरण दिखाकर इन ब्लॉकों, या "क्रॉप्स" को पहचानने के लिए प्रशिक्षित किया। इस मॉडल ने किनारों के आसपास के खाली सफेद स्थान और कॉलम के बीच की जटिल सीमाओं को अनदेखा करना सीखा, और केवल वास्तविक सामग्री पर ध्यान केंद्रित किया। परीक्षण किए जाने पर, यह सेगमेंटेशन टूल अत्यधिक प्रभावी साबित हुआ, जिसने 1.4 मिलियन से अधिक समाचार पत्र पृष्ठों में से 83 मिलियन से अधिक व्यक्तिगत ब्लॉकों को सफलतापूर्वक पहचाना। औसतन, प्रत्येक पृष्ठ को लगभग 56 अलग-अलग टुकड़ों में विभाजित किया गया, जिससे प्रणाली को अतीत के जटिल लेआउट को सटीकता के साथ संभालने में मदद मिली।
एक बार जब पृष्ठ को इन प्रबंधनीय टुकड़ों में विभाजित कर दिया जाता है, तो प्रणाली प्रत्येक के भीतर के पाठ को पढ़ती है। शोधकर्ताओं ने यह करने के लिए दो अलग-अलग विधियों का उपयोग किया, सर्वोत्तम परिणाम सुनिश्चित करने के लिए उन्हें साथ-साथ चलाया। पहली विधि एक पारंपरिक उपकरण का उपयोग करती है जिसका उपयोग दशकों से छवियों को डिजिटल अक्षरों में बदलने के लिए किया जाता रहा है। दूसरी विधि एक नए, अधिक उन्नत प्रकार के आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग करती है जो किसी छवि के संदर्भ को बेहतर ढंग से समझ सकता है। यह नया मॉडल विशेष रूप से उस पाठ को पढ़ने में अच्छा साबित हुआ जो क्षतिग्रस्त, फीका या सजावटी फोंट में लिखा गया था, जिसने पुराने उपकरण को भ्रमित कर दिया था। कई मामलों में, उन्नत मॉडल एक पृष्ठ के फटे हुए हिस्से में गायब अक्षरों का अनुमान भी लगा सका, जिससे अंतराल भर गए और एक पूर्ण वाक्य बन गया। दोनों विधियों के आउटपुट को जोड़कर, टीम ने पाठ का एक विशाल संग्रह तैयार किया, जो कुल 16.3 बिलियन टोकन है, जो हजारों पुस्तकों को भरने के लिए पर्याप्त है।
पाठ निकालने के बाद, प्रणाली यह समझने का काम करती है कि सामग्री का प्रत्येक हिस्सा वास्तव में क्या है। यह लाखों ब्लॉकों को श्रेणियों में वर्गीकृत करती है, समाचार लेखों, विज्ञापनों, तस्वीरों और कार्टूनों के बीच अंतर करती है। इसे सटीक रूप से करने के लिए, प्रणाली ब्लॉक के दृश्य स्वरूप और उसमें मौजूद शब्दों दोनों को देखती है। उदाहरण के लिए, एक ब्लॉक जो एक तस्वीर जैसा दिखता है लेकिन जिसमें कोई पाठ नहीं है, उसे छवि के रूप में पहचाना जाता है, जबकि एक ब्लॉक जिसमें एक सुर्खी और एक कहानी है, उसे समाचार के रूप में पहचाना जाता है। शोधकर्ताओं ने पाया कि विज्ञापनों ने इन ब्लॉकों की सबसे बड़ी संख्या बनाई, लेकिन वास्तविक समाचार कहानियों में अधिकांश शब्द थे। यह अंतर महत्वपूर्ण है क्योंकि यह शोधकर्ताओं को यह अध्ययन करने की अनुमति देता है कि समय के साथ समाचार पत्रों का दृश्य स्वरूप कैसे बदला, यह देखते हुए कि विज्ञापन तेजी से दृश्यमान होते गए और दशकों बीतने के साथ पृष्ठ पर अधिक स्थान लेने लगे।
प्रणाली पाठ को उसी क्रम में व्यवस्थित भी करती है जिस क्रम में एक मानव स्वाभाविक रूप से पढ़ता है। समाचार पत्रों में अक्सर ऐसे लेख होते हैं जो एक कॉलम में शुरू होते हैं और दूसरे में जारी रहते हैं, या कहानियाँ जो चित्रों द्वारा बाधित होती हैं। शोधकर्ताओं ने इन रास्तों का मानचित्र बनाने के लिए एक विधि विकसित की, यह निर्धारित करने के लिए कि कौन सा ब्लॉक अगला आता है और उसके बाद कौन सा आता है। हालांकि यह एक जटिल कार्य है, उनके दृष्टिकोण ने एक महत्वपूर्ण हिस्से के लिए पठन क्रम को सफलतापूर्वक पुनर्गठित किया, जो मैक्रो स्तर पर 72.1% और माइक्रो स्तर पर 80.8% की सटीकता प्राप्त करता है, जिससे पाठ शुरू से अंत तक तार्किक रूप से प्रवाहित होता है। यह चरण खंडित छवियों के संग्रह को एक सुसंगत वृत्तांत में बदल देता है जिसे आधुनिक दस्तावेज़ की तरह खोजा और विश्लेषित किया जा सकता है।
पाठ को पढ़ने और व्यवस्थित करने के अलावा, प्रणाली प्रत्येक ब्लॉक में उपयोगी जानकारी की परतें भी जोड़ती है। यह उपयोग की गई भाषा की पहचान करती है, यह पाते हुए कि जबकि अधिकांश संग्रह अंग्रेजी में है, इसमें यिडिश, जर्मन, स्वीडिश और फ्रेंच के महत्वपूर्ण हिस्से भी हैं, जो उस समय के विविध प्रवासी समुदायों को दर्शाते हैं। यह लोगों, स्थानों और संगठनों के नामों को खोजने के लिए पाठ को स्कैन करती है, बोस्टन और न्यूयॉर्क जैसे स्थानों या कांग्रेस जैसे संस्थानों के लाखों उल्लेखों को टैग करती है। इसके अलावा, प्रणाली प्रत्येक ब्लॉक को एक विषय असाइन करती है, कुछ को व्यावसायिक रिपोर्ट, अन्य को राजनीतिक समाचार और अन्य को वैज्ञानिक अपडेट के रूप में लेबल करती है। यह समृद्ध टैगिंग शोधकर्ताओं को विशिष्ट प्रश्न पूछने की अनुमति देती है, जैसे "विज्ञापनों की तुलना में विज्ञापनों में 'बोस्टन' शब्द कितनी बार उल्लेखित किया गया था?" या "1880 के दशक में कौन से विषय सबसे आम थे?"
पूरी प्रक्रिया को मानक कंप्यूटर हार्डवेयर पर चलाने के लिए पर्याप्त कुशल बनाया गया था, न कि इसके लिए विशाल, महंगे सुपरकंप्यूटरों की आवश्यकता थी। शोधकर्ताओं ने डेटा को बैचों में संसाधित किया, प्रत्येक चरण को अनुकूलित किया ताकि यह सुनिश्चित हो सके कि प्रणाली क्रैश हुए बिना या बहुत धीमी हुए बिना सामग्री की विशाल मात्रा को संभाल सके। किराए की कंप्यूटर शक्ति पर इस पाइपलाइन को चलाने की कुल लागत लगभग 25,000 डॉलर अनुमानित थी, जो सबसे उन्नत, महंगे मॉडलों का उपयोग करने की लागत का एक छोटा सा हिस्सा है। यह दक्षता का अर्थ है कि अन्य पुस्तकालय और संस्थान भी अपने ऐतिहासिक संग्रहों को अनलॉक करने के लिए समान उपकरणों का उपयोग कर सकते हैं।
इस कार्य का परिणाम एक विशाल, खुला डेटासेट है जिसमें न केवल पाठ, बल्कि 1795 से 1930 के बीच के एक मिलियन से अधिक समाचार पत्रों के संरचना और संदर्भ भी शामिल हैं। शोधकर्ताओं ने उपकरण, मॉडल और अंतिम डेटा जनता के लिए उपलब्ध करा दिया है, जिससे कोई भी नए तरीकों से इस इतिहास का पता लगा सकता है। हालांकि यह प्रणाली पूर्ण नहीं है और सबसे कठिन मामलों के लिए अभी भी मानवीय निरीक्षण की आवश्यकता है, यह ऐतिहासिक समाचार पत्रों को सुलभ बनाने की दिशा में एक महत्वपूर्ण छलांग का प्रतिनिधित्व करती है। अराजक, शोर वाले चित्रों को स्वच्छ, संरचित डेटा में बदलकर, टीम ने अतीत के लोगों के दैनिक जीवन में एक खिड़की खोल दी है, जो भविष्य के अनुसंधान के लिए एक आधार और आर्टिफिशियल इंटेलिजेंस के लिए मानव इतिहास से सीखने का एक नया तरीका प्रदान करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।