← नवीनतम पेपर
💬 NLP

OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report

यह शोध पत्र OpenLID-v3 प्रस्तुत करता है, जो एक उन्नत भाषा पहचान प्रणाली है जो विस्तारित प्रशिक्षण डेटा, विलय किए गए भाषा समूहों और एक समर्पित शोर लेबल के माध्यम से निकट संबंधी भाषाओं के लिए सटीकता और शोर का पता लगाने की क्षमता में सुधार करती है, साथ ही एनसेंबल दृष्टिकोणों में परिशुद्धता (precision) और कवरेज के बीच के समझौते को भी रेखांकित करती है।

मूल लेखक: Mariia Fedorova, Nikolay Arefyev, Maja Buljan, Jindřich Helcl, Stephan Oepen, Egil Rønningstad, Yves Scherrer

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mariia Fedorova, Nikolay Arefyev, Maja Buljan, Jindřich Helcl, Stephan Oepen, Egil Rønningstad, Yves Scherrer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय चला रहे हैं जो इंटरनेट के हर कोने से किताबें इकट्ठा करता है। आपका लक्ष्य इन किताबों को उनकी लिखी गई भाषा के आधार पर सही अलमारियों में व्यवस्थित करना है। इस कार्य को भाषा पहचान (Language Identification - LID) कहा जाता है।

हालाँकि, इंटरनेट बहुत अव्यवस्थित है। यह छोटे, भ्रमित करने वाले अंशों, स्पेलिंग की गलतियों, कोड और लगभग एक जैसी लगने वाली भाषाओं से भरा हुआ है। मौजूदा उपकरण (जैसे OpenLID और GlotLID) ऐसे पुस्तकालयाध्यक्षों की तरह हैं जो स्पष्ट किताबों (जैसे अंग्रेजी या स्पेनिश) को छाँटने में तो अच्छे हैं, लेकिन जब दो भाषाएँ "कजिन" (जैसे बोस्नियाई और क्रोएशियाई) हों या कोई पेज केवल बड़बड़ाहट (gibberish) हो, तो वे भ्रमित हो जाते हैं।

यह पेपर ओस्लो विश्वविद्यालय की एक टीम द्वारा बनाए गए एक नए, उन्नत पुस्तकालयाध्यक्ष OpenLID-v3 के बारे में एक अनुभव रिपोर्ट है। उन्होंने इस प्रणाली को कैसे बेहतर बनाया, इसे सरल शब्दों में यहाँ समझाया गया है:

1. समस्या: "कचरे का डिब्बा" और "भ्रमित करने वाले कजिन"

उनके पिछले संस्करण (OpenLID-v2) को तीन मुख्य समस्याओं का सामना करना पड़ रहा था:

  • कचरे का डिब्बा: यदि पुस्तकालयाध्यक्ष को कुछ ऐसा दिखता जो वास्तविक भाषा नहीं थी (जैसे कंप्यूटर कोड या टूटा हुआ टेक्स्ट), तो उसके पास "भाषा नहीं है" नाम की कोई अलमारी नहीं थी। इसके बजाय, वह उस चीज़ को किसी भी रैंडम भाषा की अलमारी में डाल देता था, जिससे अक्सर एक विशिष्ट अलमारी (जैसे लिगुरियन) पर कचरा जमा हो जाता था क्योंकि वहां जगह बची होती थी।
  • लुप्त लिपि: सर्बियाई भाषा के लिए, पुस्तकालयाध्यक्ष केवल सिरिलिक (Cyrillic) वर्णमाला को जानता था। यदि कोई सर्बियाई को लैटिन अक्षरों में लिखता था (जो बहुत आम है), तो पुस्तकालयाध्यक्ष उसे वास्तव में क्रोएशियाई या बोस्नियाई समझ लेता था।
  • कजिन (Cousins): ऐसी भाषाएँ जो बहुत समान हैं (जैसे स्कैंडिनेवियाई भाषाएँ या उत्तरी इटली की रोमांस भाषाएँ), अक्सर आपस में मिल जाती थीं क्योंकि पुस्तकालयाध्यक्ष को सूक्ष्म अंतर सुनने के लिए पर्याप्त रूप से प्रशिक्षित नहीं किया गया था।

2. समाधान: OpenLID-v3

टीम ने इस समस्या को एक बेहतर प्रशिक्षण नियमावली और नए नियमों के साथ ठीक किया:

  • "कचरे" की अलमारी जोड़ना: उन्होंने "भाषा नहीं है" (not-a-language - zxx_Zxxx) नामक एक विशेष लेबल बनाया। अब, जब पुस्तकालयाध्यक्ष को कोड या बड़बड़ाहट दिखती है, तो वह उसे किसी वास्तविक भाषा के रूप में गलत लेबल करने के बजाय कचरे के डिब्बे में डाल सकता है।
  • नई लिपियों को सीखना: उन्होंने लैटिन वर्णमाला में लिखी गई सर्बियाई के लिए प्रशिक्षण डेटा जोड़ा, ताकि पुस्तकालयाध्यक्ष अंततः सर्बियाई और उसके कजिन्स के बीच अंतर कर सके।
  • भ्रमित करने वाले समूहों को मिलाना: भाषाओं के लिए जो इतनी समान हैं कि वे व्यावहारिक रूप से एक ही हैं (जैसे कुछ अरबी बोलियाँ या फारसी किस्में), अब पुस्तकालयाध्यक्ष उन्हें एक बड़े "मैक्रो लैंग्वेज" समूह के रूप में मानता है, बजाय इसके कि वह उस अंतर को बनाने की कोशिश करे जिसका डेटा में अस्तित्व ही नहीं है।
  • "डबल-चेक" टीम: उन्होंने एक रणनीति आजमाई जहाँ दो पुस्तकालयाध्यक्ष (OpenLID-v3 और GlotLID) एक ही किताब को देखते हैं। यदि वे दोनों भाषा पर सहमत होते हैं, तो टीम उसे स्वीकार करती है। यह "एन्सेम्बल" (ensemble) दृष्टिकोण छंटाई को अविश्वसनीय रूप से सटीक बनाता है, हालांकि इसका मतलब यह भी है कि उन्हें वे किताबें फेंकनी पड़ती हैं जिनके बारे में वे 100% सुनिश्चित नहीं थे।

3. टेस्ट ड्राइव

टीम ने केवल अनुमान नहीं लगाया; उन्होंने पुराने संस्करणों और प्रतिस्पर्धी (GlotLID) के विरुद्ध तीन प्रकार के टेस्ट ड्राइव का उपयोग करके OpenLID-v3 का परीक्षण किया:

  • साफ टेस्ट (The Clean Test): मानक, पूर्ण वाक्यों (जैसे मानवाधिकारों की सार्वभौमिक घोषणा) का उपयोग करके। यहाँ, सभी ने अच्छा प्रदर्शन किया।
  • "कजिन" टेस्ट: उन्होंने कठिन समूहों के लिए विशेष परीक्षण बनाए:
    • बोस्नियाई/क्रोएशियाई/सर्बियाई: उन्होंने पाया कि हालांकि नया मॉडल बेहतर था, फिर भी ये भाषाएँ पहचानना कठिन है, विशेष रूप से सोशल मीडिया पर जहाँ लोग व्याकरण और स्लैंग को मिला देते हैं।
    • इतालवी/फ्रेंच रोमांस: उन्होंने पाया कि कुछ "ऑक्सिटन" (Occitan) टेक्स्ट वास्तव में "फ्रैंकोप्रोवेनकल" (Francoprovençal) थे, और पुराने उपकरण उन्हें बार-बार लिगुरियन के रूप में गलत लेबल करते थे। नए उपकरणों ने इसे बेहतर ढंग से संभाला लेकिन सूक्ष्मताओं के साथ संघर्ष जारी रहा।
    • स्कैंडिनेवियाई: उन्होंने पाया कि नॉर्वेजियन (बोकल और न्युरस्क) और डेनिश/स्वीडिश आसानी से भ्रमित हो जाते हैं। नया मॉडल अंतर पहचानने में बेहतर था, लेकिन "डबल-चेक" टीम सबसे सटीक थी।

4. मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि OpenLID-v3 एक ठोस अपग्रेड है, विशेष रूप से अव्यवस्थित वेब डेटा को संभालने और बहुत समान भाषाओं के बीच अंतर करने के लिए।

  • सटीकता बनाम कवरेज (Precision vs. Coverage): "डबल-चेक" टीम (Ensemble) सबसे सटीक थी (सबसे कम गलतियाँ), लेकिन यह सबसे अधिक सतर्क भी थी। इसने कम संसाधन वाली भाषाओं पर अनुमान लगाने से इनकार कर दिया, जिसका अर्थ है कि इसने कुल मिलाकर कम भाषाओं को कवर किया।
  • "कचरा" की समस्या: "भाषा नहीं है" लेबल करने की क्षमता एक बड़ी जीत है, जो कचरे को भाषा की अलमारियों को दूषित करने से रोकती है।
  • वेब की वास्तविकता: लेखकों का कहना है कि मानक परीक्षण (जैसे FLORES+) बहुत साफ-सुथरे हैं। वास्तविक वेब डेटा अव्यवस्थित, छोटा और अक्सर एक साथ कई भाषाओं में वैध होता है। इसे वास्तव में ठीक करने के लिए, हमें पूर्ण वाक्यों के बजाय इस अव्यवस्थित वास्तविकता को दर्शाने वाले अधिक प्रशिक्षण डेटा की आवश्यकता है।

संक्षेप में, OpenLID-v3 एक स्मार्ट, अधिक सतर्क पुस्तकालयाध्यक्ष है जो जानता है कि कब कहना है "मुझे नहीं पता" या "यह एक भाषा नहीं है," जिससे अंतिम संग्रह बहुत स्वच्छ होता है, भले ही इसमें छंटाई करने में थोड़ा अधिक समय लगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →