← नवीनतम पेपर
💻 computer science

ViHistScriptBench: Benchmarking Vietnamese Historical Script and Document–Type Classification in Low–Resource Settings

यह शोधपत्र ViHistScriptBench प्रस्तुत करता है, जो एक हल्का बेंचमार्क और मूल्यांकन पाइपलाइन है जिसे सीमित डेटा और जटिल सुलेख द्वारा उत्पन्न चुनौतियों को संबोधित करने के लिए एक क्यूरेटेड कॉर्पस, परिभाषित कार्यों और बेसलाइन मॉडल प्रदान करके वियतनामी ऐतिहासिक लिपियों और दस्तावेज़ प्रकारों के वर्गीकरण को आगे बढ़ाने के लिए डिज़ाइन किया गया है।

मूल लेखक: Nguyễn Tuệ An

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nguyễn Tuệ An

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास पुराने वियतनामी ग्रंथों से भरी एक विशाल, धूल भरी लाइब्रेरी है। कुछ किताबें प्राचीन चीनी अक्षरों में लिखी गई हैं, कुछ एक अनूठे वियतनामी लिपि में हैं जो चीनी जैसी दिखती है लेकिन ध्वनि वियतनामी है, और कुछ आज के आधुनिक लैटिन वर्णमाला वाले वियतनामी लेखन के शुरुआती प्रयास हैं।

समस्या यह है कि इन किताबों को पढ़ना कठिन है। स्याही फीकी पड़ गई है, कागज फट गया है, और लिखने की शैलियाँ बहुत अलग-अलग हैं। यदि आप इन किताबों को खोजना चाहते हैं या उन्हें डिजिटल टेक्स्ट में बदलना चाहते हैं, तो आपको एक कंप्यूटर प्रोग्राम (जिसे OCR कहा जाता है) की आवश्यकता होगी। लेकिन आज के अधिकांश कंप्यूटर प्रोग्राम ऐसे छात्रों की तरह हैं जिन्होंने केवल आधुनिक अंग्रेजी सीखी है; वे इन पुरानी, बिखरी हुई लिपियों को देखकर पूरी तरह भ्रमित हो जाते हैं।

यह शोध पत्र ViHistScriptBench नामक एक नया टूल पेश करता है। इसे एक अभ्यास परीक्षा (practice exam) के रूप में समझें जिसे विशेष रूप से कंप्यूटर को ये पुरानी वियतनामी किताबें पढ़ना सिखाने के लिए डिज़ाइन किया गया है।

यहाँ यह पेपर इसे सरल उपमाओं का उपयोग करके समझाता है:

1. कंप्यूटरों के लिए "जिम" (डेटासेट)

कंप्यूटर को इन लिपियों को पहचानना सिखाने के लिए, आपको बहुत सारे उदाहरणों की आवश्यकता होती है। लेखकों ने सार्वजनिक डिजिटल अभिलेखागारों (जैसे नेशनल लाइब्रेरी ऑफ वियतनाम) से 500 पृष्ठ एकत्र किए।

  • संग्रह (The Collection): उन्होंने ऐसे पृष्ठ चुने जो लेखन के विभिन्न "स्वाद" दिखाते हैं: शुद्ध चीनी अक्षर (Hán), शुद्ध वियतनामी लोगोग्राम (Nôm), दोनों का मिश्रण, और प्रारंभिक लैटिन-आधारित वियतनामी (Quốc Ngữ)।
  • लेबल (The Labels): उन्होंने केवल छवियों को ढेर में नहीं डाला। उन्होंने विशेषज्ञों को काम पर रखा ताकि वे हर पृष्ठ को लेबल कर सकें, कंप्यूटर को बता सकें: "यह एक हस्तलिखित पांडुलिपि है," "यह एक वुडब्लॉक प्रिंट है," या "इस पृष्ठ पर दो लिपियों का मिश्रण है।" यह एक शिक्षक की तरह है जो कागजों के ढेर को ग्रेड करता है और उनके पीछे नोट्स लिखता है।

2. तीन चुनौतियाँ (कार्य)

पेपर कंप्यूटर के खेलने के लिए तीन विशिष्ट खेल निर्धारित करता है:

  • खेल 1: स्क्रिप्ट डिटेक्टिव (Script Detective)। कंप्यूटर एक पूरे पृष्ठ को देखता है और अनुमान लगाता है: "क्या यह चीनी है, वियतनामी है, मिश्रण है, या प्रारंभिक लैटिन है?" यह एक मेनू को देखने और यह अनुमान लगाने जैसा है कि क्या वह फ्रेंच, इतालवी या दोनों का मिश्रण है।
  • खेल 2: मटेरियल इंस्पेक्टर (Material Inspector)। कंप्यूटर को अनुमान लगाना होगा कि पृष्ठ कैसे बनाया गया था। क्या इसे ब्रश से हाथ से लिखा गया था? क्या इसे लकड़ी में उकेरा गया और छापा गया था? या यह एक आधुनिक मुद्रित पुस्तक है? यह कंप्यूटर को यह समझने में मदद करता है कि उसे पृष्ठ की "बनावट" (texture) को कैसे संभालना है।
  • खेल 3: मिक्स-अप स्पॉटर (The Mix-Up Spotter)। कुछ पृष्ठों में एक लिपि में मुख्य कहानी होती है और हाशिए में दूसरी लिपि में छोटे नोट्स होते हैं। कंप्यूटर को यह पहचानना होगा कि क्या एक पृष्ठ "मिश्रित" है या "शुद्ध" है।

3. प्रतियोगी (मॉडल)

लेखकों ने यह देखने के लिए विभिन्न प्रकार के "छात्रों" (AI मॉडल) का परीक्षण किया कि कौन सबसे अच्छा सीखता है:

  • क्लासिक (CNNs): ये पारंपरिक छात्रों की तरह हैं जो छोटी बारीकियों (जैसे एक अकेले अक्षर के आकार) को पहचानने में अच्छे हैं, लेकिन कभी-कभी वे बड़ी तस्वीर को समझने में चूक जाते हैं।
  • आधुनिक (Vision Transformers): ये उन छात्रों की तरह हैं जो एक साथ पूरे पृष्ठ को देखते हैं, यह समझते हुए कि कॉलम के बीच संबंध कैसे हैं।
  • "जीरो-शॉट" सीखने वाले (CLIP): ये उन छात्रों की तरह हैं जिन्होंने इस विशिष्ट विषय का अध्ययन नहीं किया है, लेकिन वे सामान्य ज्ञान के आधार पर अनुमान लगाने में बहुत अच्छे हैं। वे केवल "चीनी अक्षरों वाले पृष्ठ" जैसे विवरण को पढ़कर अनुमान लगाने की कोशिश करते हैं।

4. परिणाम और संघर्ष

पेपर आधुनिक मॉडलों (Vision Transformers) के बारे में रिपोर्ट करता है जिन्होंने सबसे अच्छा प्रदर्शन किया, और लगभग 90% सटीकता प्राप्त की। यह एक पासिंग ग्रेड है, लेकिन पूर्ण नहीं।

वे कहाँ विफल हुए?
पेपर उन विशिष्ट "जालों" पर प्रकाश डालता है जिन्होंने कंप्यूटर को भ्रमित किया:

  • जुड़वाँ जाल (The Twin Trap): Hán और Nôm बहुत समान दिखते हैं। यह एक धुंधली फोटो से जुड़वां भाई और बहन के बीच अंतर करने की कोशिश करने जैसा है। कंप्यूटर अक्सर उन्हें आपस में मिला देते थे।
  • शोर का जाल (The Noise Trap): पुरानी किताबों में दाग, कीड़े के छेद और फीकी स्याही होती है। कंप्यूटर कभी-कभी एक कॉफी के दाग को अक्षर का हिस्सा समझ लेते थे।
  • दिशा का जाल (The Direction Trap): ये पुरानी किताबें लंबवत (ऊपर से नीचे) लिखी जाती हैं। क्षैतिज अंग्रेजी टेक्स्ट पढ़ने के आदी कंप्यूटर कभी-कभी लेआउट से भ्रमित हो जाते थे।
  • एक्सेंट का जाल (The Accent Trap): वियतनामी भाषा में अक्षर की ध्वनि बदलने के लिए कई छोटे निशान (diacritics) होते हैं। यदि स्याही फैल गई हो, तो कंप्यूटर यह नहीं बता पाता था कि वह निशान स्वर का चिह्न (tone accent) है या केवल गंदगी का एक कण।

5. यह क्यों महत्वपूर्ण है

लेखक यह वादा नहीं कर रहे हैं कि हम आज ही वियतनाम के पूरे इतिहास का अनुवाद कर सकते हैं। इसके बजाय, वे कह रहे हैं: "यह एक निष्पक्ष परीक्षण और एक शुरुआती रेखा है।"

इससे पहले, शोधकर्ता बिना किसी ट्रैक या स्टॉपवॉच के दौड़ने की कोशिश कर रहे थे। अब, ViTestScriptBench के साथ, उन सभी के पास समान 500 पृष्ठ और समान नियम हैं। यह वैज्ञानिकों को अपने उपकरणों की निष्पक्ष तुलना करने, यह देखने की अनुमति देता है कि वे वास्तव में कहाँ विफल होते हैं, और बेहतर "छात्र" बनाने में मदद करता है जो वियतनाम के लिखित इतिहास को संरक्षित करने और अनलॉक करने में मदद कर सकें।

संक्षेप में: उन्होंने एक अभ्यास परीक्षण बनाया है ताकि कंप्यूटर पुरानी, बिखरी हुई वियतनामी किताबों को पढ़ना सीख सकें, जो हमें ठीक से दिखा रहा है कि कंप्यूटर अभी भी कहाँ भ्रमित हो रहे हैं ताकि हम उन्हें बेहतर तरीके से सिखा सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →