← नवीनतम पेपर
💬 NLP

A new semantically annotated corpus with syntactic-semantic and cross-lingual senses

यह शोध पत्र शब्द अर्थ स्पष्टीकरण (वर्ड सेंस डिस्एम्बिगुएशन) के लिए एक नया अर्थ-चिह्नित संग्रह प्रस्तुत करता है जिसमें 20 फ्रांसीसी बहुअर्थी क्रियाएं शामिल हैं, जहाँ प्रत्येक उदाहरण को इसके अंग्रेजी अनुवाद, एक लेक्सिकन-ग्रामर शब्दकोश प्रविष्टि, और इन दोनों स्रोतों को मिलाकर प्राप्त एक सूक्ष्म-स्तरीय अर्थ लेबल के साथ एनोटेट किया गया है।

मूल लेखक: Myriam Rakho, Eric Laporte, Matthieu Constant

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Myriam Rakho, Eric Laporte, Matthieu Constant

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मानव भाषा समझना सिखाने की कोशिश कर रहे हैं। सबसे बड़ी बाधा केवल शब्दों को जानना नहीं है; बल्कि यह जानना है कि शब्द का कौन सा अर्थ उपयोग किया जा रहा है। इसे "वर्ड सेंस डिसएम्बिग्यूएशन" (WSD) कहा जाता है।

एक शब्द जैसे फ्रांसीसी क्रिया "comprendre" (समझना) के बारे में सोचें। अंग्रेजी में, इसका आमतौर पर केवल "समझना" (understand) अर्थ होता है। लेकिन फ्रांसीसी में, इसका अर्थ "शामिल होना" (include) भी हो सकता है (जैसे एक पुस्तक में दस अध्याय comprise होते हैं) या "महसूस करना/जानना" (realize) भी हो सकता है (जैसे किसी स्थिति को समझना)। यदि रोबोट को यह नहीं पता कि comprendre के किस "स्वाद" (flavor) का उपयोग किया जा रहा है, तो वह भ्रमित हो जाएगा।

इस शोध पत्र के लेखक, मिरियम राखो, एरिक लैपोर्ट और मैथ्यू कॉन्स्टेंट ने रोबोट को इन विभिन्न स्वादों को सीखने में मदद करने के लिए एक विशेष प्रशिक्षण नियमावली (एक कॉर्पस) बनाई है। उन्होंने इसे कैसे किया, इसके लिए सरल उपमाओं का उपयोग किया गया है:

समस्या: दो खराब मानचित्र (Maps)

शोधकर्ताओं ने देखा कि रोबोट को सिखाने के पिछले प्रयासों में दो मुख्य समस्याएं थीं, जैसे किसी शहर में दो अलग-अलग, अपूर्ण मानचित्रों के साथ नेविगेट करने की कोशिश करना:

  1. "अनुवाद" वाला मानचित्र (The "Translation" Map): यह मानचित्र कहता है, "यदि आप यह फ्रांसीसी शब्द देखते हैं, तो देखें कि इसका अंग्रेजी में अनुवाद क्या है।"
    • दोष: कभी-कभी, दो बहुत अलग फ्रांसीसी स्थितियाँ बिल्कुल एक ही अंग्रेजी शब्द में अनुवादित होती हैं। यह ऐसा है जैसे कहना कि "मैं नीला महसूस कर रहा हूँ" (I'm feeling blue) और "मैं उदास महसूस कर रहा हूँ" (I'm feeling sad) एक ही हैं क्योंकि दोनों का अनुवाद "sad" होता है। रोबोट एक ही अंग्रेजी शब्द देखता है और सोचता है कि फ्रांसीसी स्थितियाँ समान हैं, भले ही वे पूरी तरह से अलग हों।
  2. "शब्दकोश" वाला मानचित्र (The "Dictionary" Map): यह मानचित्र कहता है, "अर्थ तय करने के लिए व्याकरण के नियमों और वाक्य संरचना को देखें।"
    • दोष: कभी-कभी, व्याकरण एक जैसा दिखता है, लेकिन संदर्भ के आधार पर अर्थ पूरी तरह से अलग होता है। यह एक शब्दकोश की तरह है जो कहता है कि "पहनना" (wear) शरीर पर कुछ पहनना है, लेकिन यह नहीं बताता कि जापानी में, आपको अपने सिर, पैरों या हाथ पर कुछ पहनने के लिए पांच अलग-अलग शब्दों की आवश्यकता होती है।

समाधान: एक हाइब्रिड "सुपर-मैप" (A Hybrid "Super-Map")

इसे ठीक करने के लिए, टीम ने 20 कठिन फ्रांसीसी क्रियाओं (जैसे comprendre, mettre, porter, आदि) के लिए एक नई, अधिक विस्तृत प्रशिक्षण नियमावली बनाई। उन्होंने केवल एक मानचित्र नहीं चुना; उन्होंने अपनी नियमावली के प्रत्येक वाक्य के लिए चार अलग-अलग स्तर के लेबल बनाए।

इसे एक फोटो को चार अलग-अलग प्रकार के मेटाडेटा के साथ टैग करने के रूप में सोचें:

  1. "अनुवाद" टैग (The "Translation" Tag): समानांतर वाक्य में वास्तव में उपयोग किया गया अंग्रेजी शब्द क्या है? (जैसे, "understand")।
  2. "व्याकरण" टैग (The "Grammar" Tag): फ्रांसीसी "लेक्सिकन-ग्रामर" शब्दकोश में विशिष्ट प्रविष्टि क्या है? यह एक तकनीकी आईडी कार्ड की तरह है जो क्रिया की संरचना का वर्णन करता है (जैसे, "V_12_17")।
  3. "सुपर-फाइन" टैग (The "Super-Fine" Tag): उन्होंने पहले दो टैगों को आपस में मिला दिया। इसलिए, केवल "understand" या केवल "V_12_17" होने के बजाय, टैग "V_12_17#understand" बन जाता है।
    • क्यों? यह "गोल्डीलॉक्स" ज़ोन (बीच का सही रास्ता) है। यह विशिष्ट व्याकरण नियमों और विशिष्ट अनुवाद दोनों को बनाए रखता है, जिससे उस वाक्य के उस सटीक क्षण के लिए एक अद्वितीय फिंगरप्रिंट बनता है।
  4. "क्लस्टर" टैग (The "Cluster" Tag): उन्होंने उन सभी "सुपर-फाइन" टैगों को लिया जो एक ही व्याकरण आईडी साझा करते हैं और उन्हें एक साथ समूहबद्ध किया।
    • क्यों? यह रोबोट को बड़ी तस्वीर देखने में मदद करता है। वह जानता है कि ये सभी अलग-अलग अनुवाद (understand, appreciate, realize, grasp) व्याकरण के नियमों के एक ही "परिवार" से संबंधित हैं।

उन्होंने इसे कैसे बनाया

उन्होंने केवल अनुमान नहीं लगाया। उन्होंने फ्रांसीसी और अंग्रेजी वाक्यों के एक विशाल संग्रह (EuroParl कॉर्पस से, जिसमें यूरोपीय संसद के भाषण शामिल हैं) का उपयोग किया।

  • चरण 1: उन्होंने फ्रांसीसी शब्दों को अंग्रेजी शब्दों से मिलाने के लिए एक कंप्यूटर टूल का उपयोग किया।
  • चरण 2: उन्होंने सुनिश्चित करने के लिए कि अनुवाद ठोस है, मिलान की दो बार जांच की (फ्रांसीसी-से-अंग्रेजी और अंग्रेजी-से-फ्रांसीसी)।
  • चरण 3: उन्होंने यह सुनिश्चित करने के लिए कि "व्याकरण टैग" सही हैं, काम की मैन्युअल रूप से जांच की।
  • चरण 4: उन्होंने डेटा को जोड़कर "सुपर-फाइन" और "क्लस्टर" टैग स्वचालित रूप से उत्पन्न किए।

परिणाम

इसका परिणाम 20 क्रियाओं के उदाहरणों वाला एक डेटासेट है। प्रत्येक उदाहरण के लिए, रोबोट के पास अर्थ देखने के चार अलग-अलग तरीके हैं।

पेपर में दी गई तालिका 2 इस डेटासेट के आकार को दर्शाती है। क्रिया comprendre के लिए, उनके पास 8,000 से अधिक उदाहरण हैं, जिन्हें 8 व्याकरण प्रकारों, 183 अनुवाद प्रकारों और 308 अद्वितीय "सुपर-फाइन" संयोजनों में विभाजित किया गया है।

मुख्य बात (The Bottom Line)

लेखक यह दावा नहीं कर रहे हैं कि उन्होंने रोबोट की भाषा समझने की समस्या को हमेशा के लिए हल कर दिया है। इसके बजाय, उन्होंने एक बेहतर प्रशिक्षण डेटासेट बनाया है। उनका तर्क है कि "अनुवाद" दृश्य और "व्याख्या" दृश्य को जोड़कर, वे कंप्यूटर को कठिन शब्दों के विभिन्न अर्थों के बीच अंतर करने के लिए सिखाने का एक अधिक सटीक तरीका बना सकते हैं। वे भविष्य में फ्रांसीसी संज्ञाओं और विशेषणों के लिए भी ऐसा ही करने की योजना बना रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →