← नवीनतम पेपर
💬 NLP

Creating a Hybrid Rule and Neural Network Based Semantic Tagger using Silver Standard Data: the PyMUSAS framework for Multilingual Semantic Annotation

यह शोध पत्र PyMUSAS फ्रेमवर्क प्रस्तुत करता है, जो पांच भाषाओं में USAS सिमेंटिक टैगिंग सिस्टम का सबसे बड़ा मूल्यांकन प्रस्तुत करता है और यह प्रदर्शित करता है कि कैसे एक नए निर्मित सिल्वर-स्टैंडर्ड डेटासेट पर प्रशिक्षित, नियम-आधारित विधियों और न्यूरल नेटवर्क को संयोजित करने वाला एक हाइब्रिड दृष्टिकोण, बहुभाषी सिमेंटिक एनोटेशन प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Andrew Moore, Paul Rayson, Dawn Archer, Tim Czerniak, Dawn Knight, Daisy Lal, Gearóid Ó Donnchadha, Mícheál Ó Meachair, Scott Piao, Elaine Uí Dhonnchadha, Johanna Vuorinen, Yan Yabo, Xiaobin Yang

प्रकाशित 2026-03-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrew Moore, Paul Rayson, Dawn Archer, Tim Czerniak, Dawn Knight, Daisy Lal, Gearóid Ó Donnchadha, Mícheál Ó Meachair, Scott Piao, Elaine Uí Dhonnchadha, Johanna Vuorinen, Yan Yabo, Xiaobin Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को वाक्य में शब्दों के "भाव" या "अर्थ" को समझना सिखाने की कोशिश कर रहे हैं, न कि केवल उनके शब्दकोश वाले अर्थ को। इसे वर्ड सेंस डिसएम्बिगुएशन (WSD) कहा जाता है। उदाहरण के लिए, क्या "bank" शब्द का अर्थ पैसा रखने की जगह है, या नदी का किनारा?

यह शोध पत्र एक विशिष्ट प्रणाली जिसे USAS कहा जाता है (जो शब्दों को "पेय पदार्थ", "वस्तुएं", या "भावनाएं" जैसे 232 व्यापक विषयों में वर्गीकृत करता है), के लिए एक सुपर-स्मार्ट अनुवादक बनाने के बारे में है। शोधकर्ता यह देखना चाहते थे कि क्या वे सबसे अच्छा टैगर बनाने के लिए पुराने नियमों को नए ज़माने की AI के साथ मिला सकते हैं।

यहाँ उन्होंने इसे कैसे किया, इसका विवरण कुछ रोज़मर्रा के उपमाओं (analogies) के साथ दिया गया है:

1. समस्या: "नियम पुस्तिका" बहुत छोटी है

वर्षों से, USAS प्रणाली एक सख्त लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह काम करती थी। यदि आप पूछते, "यह शब्द क्या है?" तो लाइब्रेरियन एक विशाल भौतिक नियम पुस्तिका (लेक्सिकन) की जाँच करता।

  • अच्छी खबर: जो शब्द उस किताब में हैं, उनके लिए लाइब्रेरियन बहुत सटीक है।
  • बुरी खबर: यदि शब्द किताब में नहीं है, तो लाइब्रेरियन अपने हाथ ऊपर उठा देता है और कहता है, "मुझे नहीं पता।" साथ ही, लाइब्रेरियन धीमा है और नई भाषाओं को आसानी से नहीं संभाल सकता।

शोधकर्ता इसे ठीक करना चाहते थे, लेकिन उनके पास एक समस्या थी: उनके पास पर्याप्त मानव शिक्षक नहीं थे। एक आधुनिक AI को प्रशिक्षित करने के लिए, आपको आमतौर पर हजारों ऐसे वाक्यों की आवश्यकता होती है जहाँ एक इंसान ने मैन्युअल रूप से सही अर्थ लिखा हो। लेकिन चीनी, आयरिश या वेल्श जैसी भाषाओं के लिए, वे "गोल्ड स्टैंडर्ड" डेटासेट मौजूद नहीं थे।

2. समाधान: "सिल्वर स्टैंडर्ड" (AI इंटर्न)

चूंकि उन्हें मानव शिक्षक नहीं मिल सके, इसलिए उन्होंने एक चतुर तरीका निकाला। उन्होंने पुराने, सख्त लाइब्रेरियन (नियम-आधारित प्रणाली) का उपयोग करके टेक्स्ट के एक विशाल ढेर (5 मिलियन शब्द!) को लेबल किया।

  • उपमा: कल्पना करें कि लाइब्रेरियन एक अनुभवी लेकिन थोड़े जंग लगे इंटर्न की तरह है। वे पूर्ण नहीं हैं, लेकिन वे तेज़ हैं और बहुत कुछ जानते हैं।
  • शोधकर्ताओं ने इस इंटर्न को विकिपीडिया लेखों का एक विशाल पुस्तकालय लेबल करने दिया। उन्होंने इसे "सिल्वर स्टैंडर्ड" डेटा कहा। यह एकदम सटीक (असली सोने की तरह) नहीं है, लेकिन एक नए छात्र को सिखाने के लिए पर्याप्त है।

3. नया छात्र: न्यूरल नेटवर्क

फिर उन्होंने इस "सिल्वर" डेटा को लिया और एक न्यूरल नेटवर्क (एक प्रकार का AI जो पैटर्न सीखता है, जैसे एक मस्तिष्क) को प्रशिक्षित किया।

  • उपमा: यह AI एक प्रतिभाशाली छात्र है जो इंटर्न के नोट्स पढ़ता है। वह केवल शब्दकोश को रटता नहीं है; वह संदर्भ (context) को समझता है। वह समझता है कि "bank" का अर्थ "पैसा" होता है जब उसके आसपास "ऋण (loan)" और "टेलर (teller)" जैसे शब्द होते हैं, भले ही उसने पहले कभी वह विशिष्ट वाक्यांश न देखा हो।

4. हाइब्रिड: "ड्रीम टीम"

शोधकर्ताओं ने केवल एक को नहीं चुना। उन्होंने एक हाइब्रिड मॉडल बनाया।

  • उपमा: इसे एक दो-सदस्यीय जासूसी टीम के रूप में सोचें।
    • जासूस A (नियम-आधारित लाइब्रेरियन): पहले नियम पुस्तिका की जाँच करता है। यदि शब्द सामान्य है और किताब में है, तो वे मामले को तुरंत सुलझा लेते हैं।
    • जासूस B (न्यूरल नेटवर्क): यदि जासूस A कहता है, "मुझे नहीं पता, यह शब्द मेरी किताब में नहीं है," तो जासूस B हस्तक्षेप करता है। AI अपने "मस्तिष्क" का उपयोग करके आसपास के संदर्भ के आधार पर अर्थ का अनुमान लगाता है।
  • परिणाम: आपको सामान्य शब्दों के लिए नियमों की गति और सटीकता मिलती है, साथ ही कठिन, अज्ञात शब्दों के लिए AI का लचीलापन भी मिलता है।

5. भव्य प्रयोग: पाँच भाषाएँ

टीम ने पाँच भाषाओं पर इसका परीक्षण किया: अंग्रेजी, चीनी, फिनिश, आयरिश और वेल्श।

  • आश्चर्य: चीनी जैसी भाषाओं के लिए, जहाँ "नियम पुस्तिका" बहुत कमजोर थी (लाइब्रेरियन बहुत कम जानता था), AI छात्र ने लाइब्रेरियन को पूरी तरह से पछाड़ दिया।
  • सबक: AI ने अंग्रेजी के "सिल्वर" डेटा से इतना कुछ सीखा कि वह चीनी, आयरिश और फिनिश में भी अर्थों का अनुमान लगा सका, भले ही उसे केवल अंग्रेजी में "सिखाया" गया था! यह एक ऐसे बहुभाषी (polyglot) की तरह है जिसने अंग्रेजी को इतनी अच्छी तरह सीखा कि वह अन्य भाषाओं के शब्दों के अर्थ केवल वाक्य संरचना को देखकर ही बता सकता है।

6. मुख्य निष्कर्ष (Takeaway)

शोधकर्ताओं ने सिद्ध किया कि:

  1. आपको महान AI को प्रशिक्षित करने के लिए पूर्ण मानव डेटा की आवश्यकता नहीं है; आप पुरानी प्रणालियों द्वारा उत्पन्न "पर्याप्त अच्छे" डेटा (सिल्वर स्टैंडर्ड) का उपयोग कर सकते हैं।
  2. हाइब्रिड मॉडल ही भविष्य हैं। कठोर नियमों को लचीले AI के साथ मिलाने से दोनों तरफ का सर्वश्रेष्ठ मिलता है।
  3. ओपन सोर्स महत्वपूर्ण है। उन्होंने अपना सारा कोड, डेटा और मॉडल मुफ्त में जारी किया, ताकि कोई भी इस "ड्रीम टीम" का उपयोग किसी भी भाषा में शब्दों को टैग करने के लिए कर सके।

संक्षेप में: उन्होंने एक पुराने, कठोर शब्दकोश को लिया, उसका उपयोग एक सुपर-स्मार्ट AI को प्रशिक्षित करने के लिए किया, और फिर उन्हें एक ऐसी टीम में बदल दिया जो अकेले किसी के भी मुकाबले भाषा को बेहतर ढंग से समझने में सक्षम है। उन्होंने यह पाँच अलग-अलग भाषाओं के लिए किया, यह साबित करते हुए कि AI कई भाषाएँ बोलने में सक्षम हो सकता है, भले ही उसने केवल एक भाषा का अध्ययन किया हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →