← नवीनतम पेपर
💬 NLP

MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

यह शोध पत्र MUDIDI को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो विजन लैंग्वेज मॉडल्स (Vision Language Models) और लार्ज लैंग्वेज मॉडल्स (Large Language Models) का लाभ उठाकर बहुभाषी शब्दकोशों को प्रभावी ढंग से मशीन-पठनीय प्रारूपों में डिजिटाइज़ करता है, जिसे एक नए एनोटेटेड डेटासेट और जटिल लिपियों एवं लेआउट को संभालने में एलएलएम (LLMs) के बेहतर प्रदर्शन को प्रदर्शित करने वाले बेंचमार्क द्वारा समर्थित किया गया है।

मूल लेखक: David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास सैकड़ों अलग-अलग भाषाओं में लिखी पुरानी, धूल भरी डिक्शनरी (शब्दकोशों) का एक विशाल पुस्तकालय है। इनमें से कुछ अंग्रेजी में हैं, लेकिन कई दुर्लभ, लुप्तप्राय भाषाओं में हैं जिनके अनूठे लिपियाँ प्राचीन शिलालेखों या जटिल सुलेख (calligraphy) जैसी दिखती हैं। ये किताबें भाषाविदों और उन समुदायों के लिए खजाना हैं जो इन भाषाओं को बोलते हैं, लेकिन अभी वे "स्कैन मोड" में फंसी हुई हैं। वे केवल पन्नों की तस्वीरें मात्र हैं। आप उनमें शब्दों को खोज नहीं सकते, शब्दों को गिन नहीं सकते, और न ही उन्हें भाषा सिखाने या ट्रांसलेशन ऐप बनाने के लिए आसानी से उपयोग कर सकते हैं।

समस्या यह है कि ये डिक्शनरी अव्यवस्थित हैं। उनमें अजीब लेआउट, छोटे संक्षिप्त रूप (abbreviations) और ऐसे प्रतीक हैं जिनसे मानक कंप्यूटर स्कैनर (जैसे कि वे जिनका उपयोग आप रसीद स्कैन करने के लिए करते हैं) पूरी तरह भ्रमित हो जाते हैं।

इस शोध पत्र के लेखकों ने, MUDIDI, इस समस्या को हल करने के लिए एक नया "डिजिटल अनुवादक" बनाया है। इसे एक दो-चरणीय असेंबली लाइन की तरह समझें जो डिक्शनरी के पन्ने की तस्वीर को एक साफ, व्यवस्थित डिजिटल डेटाबेस में बदल देती है।

दो-चरणीय असेंबली लाइन

चरण 1: "सुपर-स्कैनर" (पन्ने को पढ़ना)
कल्पना कीजिए कि एक बहुत ही सावधान लाइब्रेरियन एक बिखरे हुए टेक्स्ट वाले पन्ने को देखता है और उसे बिल्कुल वैसा ही टाइप करने की कोशिश करता है जैसा वह दिखाई दे रहा है—बोल्ड शब्दों, इटैलिक्स और कॉलम के क्रम को सुरक्षित रखते हुए।

  • चुनौती: मानक स्कैनर अक्सर अक्षरों को छोड़ देते हैं या कॉलम के क्रम को मिला देते हैं।
  • समाधान: लेखकों ने विभिन्न "AI लाइब्रेरियन" (विशेष रूप से लार्ज लैंग्वेज मॉडल्स और विजन लैंग्वेज मॉडल्स) का परीक्षण किया। उन्होंने पाया कि स्मार्टेस्ट AI मॉडल (जैसे Gemini) सुपर-ह्यूमन लाइब्रेरियन की तरह हैं। वे जटिल लिपियों (जैसे प्राचीन क्यूनीफॉर्म या अरबी-आधारित लिपियों) को पढ़ सकते हैं और फॉर्मेटिंग को एकदम सटीक रख सकते हैं, जो पारंपरिक स्कैनिंग सॉफ्टवेयर से कहीं बेहतर है।
  • नुस्खा: कभी-कभी, AI को एक "चीट शीट" (उस विशिष्ट भाषा के लिए वैध अक्षरों की सूची) देने से उसे बेहतर पढ़ने में मदद मिलती है, लेकिन हमेशा नहीं। कभी-कभी, बस AI को तस्वीर देखने देना ही काफी होता है।

चरण 2: "ऑर्गनाइज़र" (प्रविष्टियों को व्यवस्थित करना)
एक बार जब टेक्स्ट टाइप हो जाता है, तो वह अभी भी केवल शब्दों की एक दीवार की तरह होता है। इसे व्यवस्थित डिब्बों में छाँटने की आवश्यकता है। एक डिक्शनरी प्रविष्टि (entry) केवल एक शब्द नहीं है; इसमें एक परिभाषा, एक भाग (संज्ञा/क्रिया) और उदाहरण व क्रॉस-रेफरेंस भी होते हैं।

  • चुनौती: AI को टेक्स्ट की उस दीवार को देखना होगा और कहना होगा, "ठीक है, यह बोल्ड शब्द हेडवर्ड (Headword) है, यह इटैलिक हिस्सा एक उदाहरण (Example) है, और यह प्रतीक क्रॉस-रेफरेंस (Cross-Reference) का अर्थ है।"
  • समाधान: AI को एक विशिष्ट नियम पुस्तिका (जिसे MDF स्कीमा कहा जाता है, जो डिक्शनरी के लिए एक मानक फाइलिंग सिस्टम की तरह है) दी जाती है। AI टेक्स्ट को व्यक्तिगत प्रविष्टियों में काटने और हर जानकारी को सही ढंग से टैग करने के बारे में सीखता है।
  • बढ़ावा: लेखकों ने पाया कि यदि वे AI को डिक्शनरी का परिचय पृष्ठ (introduction page) (जो बताता है कि किताब कैसे व्यवस्थित है) नियम पुस्तिका के साथ देते हैं, तो AI डेटा को छाँटने में बहुत बेहतर हो जाता है। यह एक नए कर्मचारी को फाइलिंग कैबिनेट व्यवस्थित करने के काम पर लगाने से पहले उसे 'एम्प्लॉई हैंडबुक' देने जैसा है।

उन्होंने क्या खोजा

  1. स्मार्ट AI पुराने स्कैनर्स को मात देता है: नए "जनरल-पर्पस" AI मॉडल इन ट्रिकी डिक्शनरी को पढ़ने में दशकों से उपयोग किए जा रहे विशेष स्कैनिंग सॉफ्टवेयर की तुलना में बहुत बेहतर हैं। वे अजीब फोंट और लेआउट को आसानी से संभाल लेते हैं।
  2. संदर्भ (Context) ही सब कुछ है: यदि आप चाहते हैं कि AI डिक्शनरी की प्रविष्टियों को सही ढंग से छाँटे, तो आपको उसे "संदर्भ" देना होगा। AI को डिक्शनरी का परिचय पृष्ठ दिखाने से उसे उस विशिष्ट पुस्तक के नियमों को समझने में मदद मिलती है, जिससे गलतियाँ बहुत कम हो जाती हैं।
  3. यह कठिन कार्यों के लिए भी काम करता है: यह सिस्टम ग्रीक और जापानी जैसी सामान्य भाषाओं से लेकर चुकची (Chukchi) और सीरियाक (Syriac) जैसी लुप्तप्राय भाषाओं तक, विविध प्रकार की भाषाओं पर काम करता है।

परिणाम: एक डिजिटल खजाना

लेखकों ने केवल एक टूल नहीं बनाया; उन्होंने एक टेस्ट किट भी बनाया। उन्होंने 3-0 अलग-अलग डिक्शनरी एकत्र कीं, मानव विशेषज्ञों से काम की जांच करवाई, और एक डेटासेट बनाया ताकि यह सिद्ध किया जा सके कि उनका सिस्टम काम करता है।

संक्षेप में: उन्होंने एक तरीका बनाया है जिससे आप एक धूल भरी, जटिल डिक्शनरी के पन्ने की तस्वीर ले सकते हैं और उसे एक साफ, खोजने योग्य (searchable), मशीन-पठनीय फाइल में बदल सकते हैं। यह समुदायों और शोधकर्ताओं को अंततः उन जानकारियों को अनलॉक करने की अनुमति देता है जो इन पुरानी किताबों में कैद हैं, जिससे उन भाषाओं को संरक्षित करने में मदद मिलती है जो अन्यथा लुप्त हो सकती हैं।

सावधानी: हालांकि AI अद्भुत है, लेकिन यह पूर्ण नहीं है। बहुत ही दुर्लभ लिपियों या अत्यंत अव्यवस्थित लेआउट के लिए, मानव विशेषज्ञों को अभी भी काम की दोबारा जांच करने की आवश्यकता होती है। लेकिन यह नया तरीका मानव के इस काम को पहले की तुलना में बहुत तेज़ और आसान बना देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →