← नवीनतम पेपर
💬 NLP

What Language is This? Ask Your Tokenizer

यह शोध पत्र UniLID को प्रस्तुत करता है, जो UnigramLM टोकनाइज़ेशन पर आधारित एक डेटा- और कंप्यूट-कुशल भाषा पहचान विधि है, जो मानक बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त करती है और नई भाषाओं के लिए मॉडल को पुन: प्रशिक्षित किए बिना कम-संसाधन और सूक्ष्म-स्तर की बोलियों वाले परिवेश में सटीकता में महत्वपूर्ण सुधार करती है।

मूल लेखक: Clara Meister, Ahmetcan Yavuz, Pietro Lesci, Tiago Pimentel

प्रकाशित 2026-02-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Clara Meister, Ahmetcan Yavuz, Pietro Lesci, Tiago Pimentel

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जिसका काम दुनिया भर के पत्रों के एक विशाल, अराजक ढेर को छाँटना है। इनमें से कुछ अंग्रेजी में लिखे गए हैं, कुछ स्पेनिश में, कुछ उन दुर्लभ बोलियों में हैं जो केवल कुछ हज़ार लोगों द्वारा बोली जाती हैं, और कुछ तो सिर्फ टेढ़े-मेढ़े निशान या कोड हैं। आपका काम यह पता लगाना है कि प्रत्येक पत्र किस भाषा में है ताकि आप उन्हें सही ढंग से फाइल कर सकें।

यही भाषा पहचान (Language Identification - LID) का काम है।

लंबे समय से, कंप्यूटर सामान्य भाषाओं (जैसे अंग्रेजी या फ्रेंच) के लिए काफी अच्छे रहे हैं, लेकिन वे तब भ्रमित हो जाते हैं जब अक्षर छोटे हों, भाषा दुर्लभ हो, या कोई बोली अपने पड़ोसी भाषा के समान हो (जैसे सर्बियाई और क्रोएशियाई के बीच अंतर करना)।

आपके द्वारा साझा किया गया शोध पत्र इस समस्या को हल करने के लिए एक नया, चतुर उपकरण पेश करता है जिसे UniLID कहा जाता है। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:

पुराना तरीका: "एक-सा-सबके-लिए" स्टैम्प (The "One-Size-Fits-All" Stamp)

कल्प laना कीजिए कि पुराने कंप्यूटर सिस्टम (जैसे fastText) एक ऐसे लाइब्रेरियन की तरह हैं जो हर पत्र को पढ़ने से पहले उसे टुकड़ों में काटने के लिए एक एकल, विशाल स्टैम्प का उपयोग करता है।

  • यदि पत्र में "hello" लिखा है, तो स्टैम्प इसे "he" और "llo" में काट देता है।
  • यह हर भाषा के लिए, चाहे शब्द वास्तव में कैसे भी बने हों, बिल्कुल एक ही तरीके से ऐसा करता है।
  • समस्या: यह बड़े, आम भाषाओं के लिए ठीक काम करता है। लेकिन दुर्लभ भाषाओं या कठिन बोलियों के लिए, यह "एक-सा-सबके-लिए" वाला स्टैम्प शब्दों को अजीब, अप्राकृतिक जगहों पर काट देता है। यह एक नाजुक सुशी रोल को भारी छुरी से काटने जैसा है; आप उसकी संरचना को बिगाड़ देते हैं, और कंप्यूटर भ्रमित हो जाता है।

नया तरीका: "कस्टम टेलर" (The "Custom Tailor" - UniLID)

इस पेपर के लेखक कहते हैं: "क्यों एक स्टैम्प सबके लिए इस्तेमाल करें? आइए हर भाषा को अपना कस्टम टेलर दें।"

उनका नया तरीका, UniLID, इस प्रकार काम करता है:

  1. साझा शब्दकोश (The Shared Dictionary): कल्पना कीजिए कि सभी भाषाओं के पास लेगो ब्रिक्स (Lego bricks) का एक ही विशाल डिब्बा है (शब्दावली)। हर किसी के पास वही लाल, नीले और हरे रंग के ब्रिक्स उपलब्ध हैं।
  2. कस्टम ब्लूप्रिंट (The Custom Blueprint): एक स्टैम्प का उपयोग करने के बजाय, UniLID प्रत्येक भाषा के लिए एक अद्वितीय ब्लूप्रिंट सीखता है।
    • अंग्रेजी के लिए, ब्लूप्रिंट कहता है: "जब आप इन ब्रिक्स को देखें, तो उन्हें इस तरह से एक साथ जोड़ें।"
    • एक दुर्लभ बोली के लिए, ब्लूप्रिंट कहता है: "आपके विशिष्ट ब्रिक्स के लिए, उन्हें अलग तरह से एक साथ जोड़ें।"
  3. अनुमान लगाने का खेल (The Guessing Game): जब एक नया पत्र आता है, तो कंप्यूटर पूछता है: "यदि मैं अंग्रेजी ब्लूप्रिंट का उपयोग करूं, तो ब्रिक्स कितनी अच्छी तरह फिट बैठते हैं? यदि मैं स्पेनिश ब्लूप्रिंट का उपयोग करूं, तो वे कितनी अच्छी तरह फिट बैठते हैं?"
    • यह उस ब्लूप्रिंट को चुनता है जहाँ ब्रिक्स सबसे स्वाभाविक और सहज रूप से फिट बैठते हैं।
    • यदि अंग्रेजी ब्लूप्रिंट शब्द को एक बिखरे हुए मलबे जैसा बना देता है, लेकिन स्पेनिश ब्लूप्रिंट उसे एक आदर्श वाक्य जैसा बनाता है, तो कंप्यूटर जानता है: "आह, यह स्पेनिश होना चाहिए!"

यह एक बड़ी बात क्यों है?

1. यह एक "लो-रिसोर्स" सुपरहीरो है
आमतौर पर, कंप्यूटर को नया भाषा सिखाने के लिए आपको हजारों उदाहरणों की आवश्यकता होती है (जैसे किसी बच्चे को बिल्ली की 1,000 तस्वीरें दिखाना)।

  • पुराना तरीका: "स्टैम्प" सीखने के लिए हजारों उदाहरणों की आवश्यकता होती है।
  • UniLID: इतना स्मार्ट है कि यह केवल पाँच उदाहरणों के साथ एक नई भाषा सीख सकता है। यह एक जासूस की तरह है जो केवल पाँच पत्र देखकर संदिग्ध की लिखावट को पहचान सकता है। यह उन भाषाओं के लिए बहुत बड़ा बदलाव है जिनके पास ऑनलाइन बहुत अधिक डेटा नहीं है।

2. यह "जुड़वाओं" को बेहतर ढंग से संभालता है
कुछ भाषाएं जुड़वाओं की तरह होती हैं; वे लगभग एक जैसी दिखती और सुनाई देती हैं। पुराने सिस्टम अक्सर उनमें भ्रमित हो जाते हैं। क्योंकि UniLID यह सीखता है कि प्रत्येक भाषा शब्दों को टुकड़ों में कैसे तोड़ती है (उसका "सेगमेंटेशन"), यह उन सूक्ष्म अंतरों को पकड़ सकता है जिन्हें पुराने "एक-स्टैम्प" वाले सिस्टम मिस कर देते हैं।

3. यह तेज़ और सस्ता है
भले ही यह अधिक स्मार्ट है, लेकिन इसे चलाने के लिए इसे सुपरकंप्यूटर की आवश्यकता नहीं है। यह अनुमान लगाने के लिए एक गणितीय ट्रिक (जिसे डायनेमिक प्रोग्रामिंग कहा जाता है) का उपयोग करता है, जिससे यह बहुत तेज़ी से, लगभग पुराने तरीकों के समान गति से काम करता है।

निचोड़ (The Bottom Line)

UniLID को एक कुंद, सामान्य उपकरण से सटीक उपकरणों के सेट में अपग्रेड करने के रूप में देखें। यह महसूस करता है कि प्रत्येक भाषा की अपनी एक "लय" और "संरचना" होती है। उनकी अनूठी संरचनाओं का सम्मान करके, न कि उन्हें एक ही सांचे में जबरदस्ती ढालकर, यह भाषाओं को पहचानने में बहुत बेहतर हो जाता है, विशेष रूप से उन दुर्लभ, कठिन या छोटे रूपों के लिए जिनसे कंप्यूटर आमतौर पर संघर्ष करते हैं।

यह ऐसी बेहतर AI बनाने में मदद करता है जो केवल सबसे लोकप्रिय भाषाओं को ही नहीं, बल्कि पूरी दुनिया को समझती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →