← नवीनतम पेपर
💬 NLP

Beyond Subtokens: A Rich Character Embedding for Low-resource and Morphologically Complex Languages

यह शोध पत्र रिच कैरेक्टर एम्बेडिंग्स (RCE) का प्रस्ताव करता है, जो एक ट्रांसफॉर्मर-आधारित दृष्टिकोण है जो ऑर्थोग्राफिक और रूपात्मक बारीकियों को बेहतर ढंग से पकड़ने के लिए सीधे वर्ण स्ट्रिंग्स (character strings) से वर्ड वेक्टर्स उत्पन्न करता है, जो विभिन्न कार्यों में कम-संसाधन और रूपात्मक रूप से जटिल भाषाओं के लिए पारंपरिक सब-टोकन विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Felix Schneider, Maria Gogolev, Sven Sickert, Joachim Denzler

प्रकाशित 2026-02-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Felix Schneider, Maria Gogolev, Sven Sickert, Joachim Denzler

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मानव भाषा समझना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, यह करने का सबसे अच्छा तरीका रोबोट को एक विशाल शब्दकोश देना था। यदि रोबोट "quality" शब्द देखता, तो वह शब्दकोश में उसे ढूँढता और उसे एक विशिष्ट आईडी कार्ड प्राप्त होता। यदि वह "qualification" देखता, तो वह उसे भी ढूँढता और उसे एक अलग आईडी कार्ड प्राप्त होता।

समस्या क्या थी? रोबोट को पता ही नहीं था कि "quality" और "qualification" आपस में "चचेरे भाई" हैं। वे दिखने में समान हैं, सुनने में समान हैं, और उनका अर्थ भी समान है, लेकिन रोबोट के लिए, वे केवल दो पूरी तरह से असंबंधित अजनबी हैं क्योंकि उनके पास अलग-अलग आईडी कार्ड हैं। यह उन भाषाओं के लिए और भी बदतर हो जाता है जहाँ शब्द के अंत बहुत अधिक बदलते हैं (जैसे लैटिन या जर्मन) या उन भाषाओं के लिए जहाँ लोगों के पास रोबोट को प्रशिक्षित करने के लिए पर्याप्त किताबें नहीं हैं।

इस शोध पत्र के लेखक, फेलिक्स श्नाइडर और उनकी टीम कहते हैं: "शब्दकोश का उपयोग करना बंद करें। चलिए रोबोट को स्वयं अक्षरों को पढ़ना सिखाते हैं।"

यहाँ उनका समाधान दिया गया है, जिसे कुछ रोजमर्रा के उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "शब्दकोश" बनाम "लेगो सेट"

वर्तमान एआई मॉडल (जैसे चैटबॉट्स को चलाने वाले मॉडल) शब्दों को "सबटोकन्स" नामक टुकड़ों में तोड़ते हैं।

  • शब्दकोश दृष्टिकोण: कल्पना कीजिए कि आपके पास लेगो ब्रिक्स (Lego bricks) का एक डिब्बा है। यदि आप एक "कार" बनाना चाहते हैं, तो आप एक पहले से बने हुए "कार" ब्रिक को उठाते हैं। यदि आप एक "रेस कार" बनाना चाहते हैं, तो आप एक "रेस कार" ब्रिक उठाते हैं। रोबोट को पता ही नहीं चलता कि दोनों कारों के पहिए और चेसिस एक ही हैं।
  • छूटा हुआ संबंध: यदि आप किसी शब्द को गलत वर्तनी के साथ लिखते हैं (जैसे "this" के बजाय "tihs"), तो शब्दकोश दृष्टिकोण घबरा जाता है। उसके पास "tihs" के लिए कोई आईडी कार्ड नहीं है, इसलिए वह इसे निरर्थक मान लेता है।

2. समाधान: रिच कैरेक्टर एम्बेडिंग्स (RCE)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे रिच कैरेक्टर एम्बेडिंग्स (RCE) कहा जाता है। शब्दकोश में शब्दों को खोजने के बजाय, एआई शब्द को व्यक्तिगत अक्षरों की एक श्रृंखला के रूप में देखता है, ठीक वैसे ही जैसे आप पढ़ते समय देखते हैं।

उपमा: एक मास्टर शेफ
कल्पना कीजिए कि एक पारंपरिक एआई एक ऐसा शेफ है जो केवल पहले से पैक किए गए भोजन को बनाना जानता है। यदि आप उन्हें ऐसी कोई नई सामग्री देते हैं जिसे उन्होंने पहले कभी नहीं देखा, तो वे उसे पका नहीं सकते।

नया RCE AI एक मास्टर शेफ है जो सामग्रियों को खुद समझता है।

  • यदि आप उन्हें "tomato" देते हैं, तो वे जानते हैं कि यह लाल, रसीला और अम्लीय है।
  • यदि आप उन्हें "tomatoe" (एक टाइपो/गलत वर्तनी) देते हैं, तो वे फिर भी जानते हैं कि यह लाल, रसीला और अम्लीय है क्योंकि वे अक्षरों t-o-m-a-t-o को पहचानते हैं।
  • यदि आप उन्हें "tomatoes" (बहुवचन) देते हैं, तो वे जानते हैं कि यह वही फल है, बस इसकी मात्रा अधिक है।

एआई अपने अक्षरों के आधार पर शब्द के लिए एक "वेक्टर" (एक गणितीय मानचित्र) बनाता है। यह मानचित्र कैप्चर करता है:

  1. अर्थ: शब्द किस बारे में है।
  2. वर्तनी (Spelling): शब्द कैसा दिखता है।
  3. व्याकरण: शब्द कैसे बदलता है (जैसे बहुवचन के लिए "s" जोड़ना)।

3. यह "लो-रिसोर्स" भाषाओं के लिए गेम-चेंजर क्यों है?

कुछ भाषाएं, जैसे अंग्रेजी या स्पेनिश, में एआई को प्रशिक्षित करने के लिए लाखों किताबें और वेबसाइटें हैं। लेकिन उन भाषाओं का क्या जैसे फेरोसे (फेरो द्वीप समूह में बोली जाने वाली) या लैटिन (जो अब लगभग कोई नहीं बोलता)?

  • पुराना तरीका: आपको रोबोट को सिखाने के लिए एक विशाल पुस्तकालय की आवश्यकता होती है। यदि आपके पास केवल कुछ किताबें हैं, तो रोबमान उन शब्दों को भूल जाता है जिन्हें उसने पहले नहीं देखा है।
  • RCE तरीका: क्योंकि रोबोट अक्षरों से सीखता है, इसलिए वह एक बहुत छोटे पुस्तकालय से भी सीख सकता है। यदि वह फेरोसे में "hús" (घर) शब्द देखता है, और फिर बाद में "húsið" (वह घर) देखता है, तो उसे एहसास होता है, "आह, यह 'hús' है जिसके अंत में एक छोटा सा टैग लगा है।" उसे पैटर्न समझने के लिए दस लाख उदाहरणों की आवश्यकता नहीं है; उसे बस निर्माण खंडों (building blocks) को समझने की आवश्यकता है।

4. यह कैसे काम करता है (जादुई ट्रिक)

टीम ने एक विशेष "ट्रांसफॉर्मर" (एक प्रकार का एआई मस्तिष्क) बनाया है जो शब्दों को अक्षर-दर-अक्षर पढ़ता है।

  • यह "Token" जैसे शब्द को लेता है।
  • यह इसे तोड़ता है: T (कैपिटल), o, k, e, n
  • यह उन अक्षरों को एक एकल, समृद्ध संख्या-मानचित्र (number-map) में बदलने के लिए एक विशेष "जादुई लेंस" (एक न्यूरल नेटवर्क) का उपयोग करता है।
  • इस मानचित्र को फिर पुराने शब्दकोश लुकअप को बदलने के लिए किसी भी मौजूदा एआई मॉडल (जैसे BERT) में डाला जा सकता है।

5. परिणाम: क्या यह काम करता है?

टीम ने कई कठिन कार्यों पर इसका परीक्षण किया:

  • "अलग क्या है" परीक्षण (The "Odd One Out" Test): उन्होंने एआई को bus, car, plane, और apple जैसे शब्दों की एक सूची दी। एआई को यह पहचानना था कि "apple" इसमें फिट नहीं बैठता। नया तरीका पुराने शब्दकोश तरीकों की तुलना में बहुत बेहतर था, विशेष रूप से उन भाषाओं के लिए जिनमें कम उदाहरण उपलब्ध हैं।
  • व्याकरण अनुमान: उन्होंने एआई से लैटिन शब्द के व्याकरणिक रूप का अनुमान लगाने के लिए कहा। चूंकि एआई समझता है कि व्याकरण बनाने के लिए अक्षर कैसे बदलते हैं, इसलिए उसने उन शब्दों के लिए भी सही अनुमान लगाया जिन्हें उसने पहले कभी नहीं देखा था।
  • रूपकों (Metaphors) का पता लगाना: उन्होंने परीक्षण किया कि क्या एआई काव्य संबंधी युक्तियों (जैसे "सूरज मुस्कुरा रहा है") को पकड़ सकता है। नया तरीका इन छिपे हुए अर्थों को खोजने में उत्कृष्ट था।

निष्कर्ष

यह शोध पत्र एआई को केवल शब्दों को नहीं, बल्कि अक्षरों को देखकर भाषा समझने का तरीका सिखाता है।

इसे एक बच्चे को पढ़ना सिखाने जैसा समझें।

  • पुराना तरीका: शब्दकोश के हर एक शब्द को रटना। यदि आप कोई ऐसा शब्द देखते हैं जिसे आप नहीं जानते, तो आप फंस जाते हैं।
  • नया तरीका (RCE): वर्णमाला सीखना और यह सीखना कि अक्षर कैसे मिलते हैं। यदि आप एक नया शब्द देखते हैं, तो आप उसे बोलकर (sound out) पढ़ सकते हैं और उन अक्षरों के आधार पर अनुमान लगा सकते हैं जिन्हें आप पहले से जानते हैं।

यह एआई को बहुत अधिक स्मार्ट, लचीला और उन भाषाओं को समझने में सक्षम बनाता है जिनके पास विशाल डेटा लाइब्रेरी नहीं है। यह एक ऐसे एआई की ओर एक कदम है जो वास्तव में एक इंसान की तरह "पढ़ता" है, न कि केवल एक रोबोट की तरह "खोजता" है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →