← नवीनतम पेपर
💬 NLP

Automatic Part-of-Speech Tagging of Arabic-English Dictionary Senses through WordNet

यह शोध पत्र एक संसाधन-हल्के (resource-light) एल्गोरिदम का प्रस्ताव करता है जो अंग्रेजी अनुवाद समकक्षों और प्रिंसटन वर्डनेट का लाभ उठाकर अल-मौरिद अरबी-अंग्रेजी शब्दकोश में अर्थों (senses) को स्वचालित रूप से पद-व्याकरण (part-of-speech) टैग निर्दिष्ट करता है, जिससे बड़े एनोटेटेड कॉर्पोरा या व्यापक भाषाई विशेषज्ञता की आवश्यकता के बिना वर्डनेट-एलएमएफ (WordNet-LMF) प्रारूपों में द्विभाषी शब्दकोशों के एकीकरण को सुगम बनाया जा सके।

मूल लेखक: Diaa M. Fayed, Aly A. Fahmy, Mohsen A. Rashwan, Wafaa K. Fayed

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Diaa M. Fayed, Aly A. Fahmy, Mohsen A. Rashwan, Wafaa K. Fayed

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, पुराने ज़माने का द्विभाषी शब्दकोश (अरबी से अंग्रेजी) है जो अविश्वसनीय रूप से उपयोगी है लेकिन इसमें एक छिपा हुआ दोष है: यह आपको बताता है कि शब्दों का अर्थ क्या है, लेकिन यह यह नहीं बताता कि शब्द का प्रकार क्या है। क्या कोई विशिष्ट अरबी प्रविष्टि (entry) एक संज्ञा (noun - कोई चीज़) है, एक क्रिया (verb - एक कार्य) है, या एक विशेषण (adjective - एक विवरण) है? इस लेबल के बिना, कंप्यूटर टेक्स्ट को ठीक से समझने में संघर्ष करते हैं।

यह शोध पत्र इस समस्या को हल करने के लिए एक चतुर, कम लागत वाला समाधान प्रस्तुत करता है, जो अंग्रेजी भाषा से एक "चीट शीट" (cheat sheet) उधार लेकर बनाया गया है।

समस्या: बिना लेबल वाला शब्दकोश

सोचिए कि अल-मौरिद शब्दकोश (अध्ययन में उपयोग किया गया अरबी-अंग्रेजी शब्दकोश) एक पुस्तकालय की तरह है जहाँ हर किताब का शीर्षक तो है, लेकिन अलमारियाँ शैली (genre) के आधार पर व्यवस्थित नहीं हैं। आपके पास "Run" शीर्षक वाली एक किताब है, लेकिन कंप्यूटर को यह नहीं पता कि यह दौड़ने की क्रिया (एक क्रिया) है या कपड़े का एक प्रकार (एक संज्ञा)।

स्मार्ट कंप्यूटर टूल (जैसे अनुवाद सॉफ्टवेयर या खोज इंजन) बनाने के लिए, हमें आमतौर पर बड़ी मात्रा में पहले से लेबल किए गए डेटा या महंगे मानव विशेषज्ञों की आवश्यकता होती है जो हर एक शब्द को जाकर टैग कर सकें। यह लाखों किताबों को मैन्युअल रूप से छाँटने के लिए पुस्तकालयाध्यक्षों की एक टीम को काम पर रखने जैसा है। इसमें बहुत समय और पैसा लगता है, खासकर अरबी जैसी भाषाओं के लिए जिनके पास अंग्रेजी की तुलना में कम डिजिटल संसाधन हैं।

समाधान: "समूह सहमति" (Group Consensus) का तरीका

लेखकों ने एक "संसाधन-हल्का" (resource-light) दृष्टिकोण निकाला। अरबी शब्दों को टैग करने के लिए मनुष्यों को काम पर रखने के बजाय, उन्होंने उनके बगल में पहले से मौजूद अंग्रेजी अनुवादों का उपयोग एक मार्गदर्शक के रूप में किया।

यहाँ उन्होंने जिस सादृश्य (analogy) का उपयोग किया है:
कल्पना कीजिए कि आप एक रहस्यमय व्यक्ति (अरबी शब्द) के जॉब टाइटल का अनुमान लगाने की कोशिश कर रहे हैं। आप उनसे सीधे नहीं पूछ सकते, लेकिन आपके पास उनके अंग्रेजी सहयोगियों (Translation Equivalents या TEs) की एक सूची है जो उसी कार्यालय में काम करते हैं।

  1. अनुवाद टीम: एक अरबी प्रविष्टि के लिए, शब्दकोश तीन अंग्रेजी शब्द सूचीबद्ध कर सकता है: "sweat gland," "perspiratory," और "sudoriferous"।
  2. मास्टर लिस्ट से परामर्श: लेखकों ने एक प्रसिद्ध, पूर्व-व्यवस्थित अंग्रेजी डेटाबेस जिसे WordNet कहा जाता है (इसे "मास्टर लाइब्रेरियन" के रूप में सोचें जो पहले से ही हर शब्द के जॉब टाइटल को जानता है) की जाँच की।
  3. प्रतिच्छेदन (The Intersection - वेन आरेख):
    • "Sweat gland" को Noun (संज्ञा) के रूप में टैग किया गया है।
    • "Perspiratory" को Adjective (विशेषण) के रूप में टैग किया गया है।
    • "Sudoriferous" को Adjective (विशेषण) के रूप में टैग किया गया है।
    • रुको, यहाँ एक संघर्ष है! कंप्यूटर को यह तय करने की आवश्यकता है कि वास्तविक अरबी शब्द क्या है।
  4. विभेद (Disambiguation): एल्गोरिदम "साझा आधार" (common ground) की तलाश करता है। यदि अधिकांश अंग्रेजी सहयोगी Nouns हैं, तो अरhi शब्द संभवतः एक Noun है। यदि अंग्रेजी शब्द असहमत हैं, तो एल्गोरिदम उनके बीच सबसे बार-बार आने वाले लेबल को देखता है। यह एक समूह वोट की तरह है: यदि 4 में से 3 सहयोगी "Noun" कहते हैं, तो कंप्यूटर मान लेता है कि अरबी शब्द एक Noun है।

उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने अल-मौरिद शब्दकोश का एक विशिष्ट भाग (अरबी अक्षर "Ayn" से शुरू होने वाले शब्द) लिया और अपना एल्गोरिदम चलाया।

  • सेटअप: उन्होंने अंग्रेजी अनुवादों को टैग प्राप्त करने के लिए WordNet में डाला।
  • परिष्करण (Refinement): उन्हें एहसास हुआ कि कभी-कभी कंप्यूटर व्याकरण के छोटे विवरणों (जैसे "to run" बनाम "run") से भ्रमित हो जाता है। उन्होंने अतिरिक्त शब्दों (जैसे "to") को हटाने और बहुवचन रूपों को बेहतर ढंग से संभालने के लिए सिस्टम में सुधार किया।
  • परिणाम: जब तक उन्होंने अपने सुधार पूरे किए, उनका सिस्टम सही पार्ट ऑफ स्पीच का अनुमान लगाने में 93% सटीक था। यह उनके शुरुआती प्रयास से एक बड़ी छलांग है, जो केवल लगभग 71% सटीक था।

यह क्यों महत्वपूर्ण है

यह शोध पत्र तर्क देता है कि "कम-संसाधन" वाली भाषाओं (वे भाषाएँ जिनमें अभी डिजिटल उपकरण कम हैं) के लिए इन उपकरणों को बनाने के लिए आपको भाषाविदों की एक विशाल सेना या सुपर-कंप्यूटर की आवश्यकता नहीं है।

सिर्फ मौजूदा शब्दकोश में मौजूद अंग्रेजी अनुवादों का उपयोग करके और उन्हें एक मानक अंग्रेजी डेटाबेस के साथ क्रॉस-रेफरेंस करके, आप स्वचालित रूप से अरबी शब्दों को "टैग" कर सकते हैं। यह एक शहर के नक्शे का उपयोग करके उसके बगल वाले समान शहर में रास्ता खोजने जैसा है, जिससे आपको दूसरे शहर का नक्शा शून्य से बनाने में लगने वाले समय और पैसे की बचत होती है।

संक्षेप में: यह शोध पत्र दिखाता है कि अंग्रेजी अनुवादों को अरबी शब्दों की पहचान पर "वोट" देने देकर, हम बहुत कम लागत और उच्च सटीकता के साथ एक द्विभाषी शब्दकोश को स्वचालित रूप से व्यवस्थित कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →