← नवीनतम पेपर
💬 NLP

FLEURS-Kobani: Extending the FLEURS Dataset for Northern Kurdish

यह शोध पत्र FLEURS-Kobani को प्रस्तुत करता है, जो 31 मूल भाषियों द्वारा रिकॉर्ड किए गए 5,162 सत्यापित कथनों से बना पहला सार्वजनिक उत्तरी कुर्दिश बेंचमार्क है, जो इस अल्प-संसाधन वाली भाषा के लिए स्वचालित भाषण पहचान और भाषण अनुवाद कार्यों के मूल्यांकन को सक्षम करने हेतु FLEURS डेटासेट का विस्तार करता है।

मूल लेखक: Daban Q. Jaff, Mohammad Mohammadamini

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daban Q. Jaff, Mohammad Mohammadamini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

भाषा तकनीक की दुनिया की कल्पना एक विशाल, उच्च-तकनीकी पुस्तकालय के रूप में करें। वर्षों से, इस पुस्तकालय को 100 से अधिक भाषाओं के लिए पुस्तकों (डेटा) से भरा गया है, जिससे कंप्यूटर यह सीख सके कि कैसे सुनना, बोलना और अनुवाद करना है। इस पुस्तकालय को FLEURS कहा जाता है। यह एक सार्वभौमिक प्रशिक्षण जिम की तरह है जहाँ AI मॉडल स्पीच रिकग्निशन या अनुवाद जैसे कार्यों के लिए खुद को फिट करने के लिए जाते हैं।

हालाँकि, इस पुस्तकालय में एक बड़ी कमी थी: उत्तरी कुर्दिश (जो तुर्की, सीरिया, इराक और ईरान में लाखों लोगों द्वारा बोली जाती है) के लिए कोई किताबें नहीं थीं। यह एक ऐसे जिम की तरह था जिसमें विशिष्ट लोगों के समूह के लिए एक नया, खाली वेट रैक रखा हो। डेटा के बिना, कंप्यूटर इस भाषा को प्रभावी ढंग से समझना या बोलना नहीं सीख सकते थे।

यह शोध पत्र FLEURS-Kobani पेश करता है, जो उस खाली रैक को भरने के लिए डिज़ाइन किया गया एक प्रोजेक्ट है।

🎙️ द रिकॉर्डिंग स्टूडियो: लाइब्रेरी का निर्माण

लेखकों ने केवल मौजूदा डेटा को कॉपी-पेस्ट नहीं किया; उन्होंने शून्य से एक नया संग्रह बनाया।

  • कलाकार: उन्होंने कोबानी विश्वविद्यालय (University of Kobani) से 31 मूल वक्ताओं (मुख्य रूप से महिलाएं, कुछ पुरुष) को भर्ती किया। उन्हें एक रेडियो नाटक के "अभिनेताओं" के रूप में समझें।
  • स्क्रिप्ट: उन्होंने एक मानक टेक्स्ट संग्रह (FLORES) से 2,000 अद्वितीय वाक्यों का उपयोग किया और अभिनेताओं से उन्हें ज़ोर से पढ़ने के लिए कहा।
  • रियलिटी चेक: रिकॉर्डिंग करना आसान नहीं था। इंटरनेट की अस्थिरता और व्यक्तिगत सेल फोन के उपयोग के कारण, ऑडियो की गुणवत्ता बहुत भिन्न थी। यह एक ऐसे कमरे में सिम्फनी रिकॉर्ड करने जैसा था जहाँ बिजली बार-बार झपक रही है और कुछ संगीतकार सस्ते माइक्रोफ़ोन का उपयोग कर रहे हैं।
  • सफाई: लगभग 8,000 रिकॉर्डिंग्स में से, उन्हें लगभग 35% को हटाना पड़ा क्योंकि उनमें बैकग्राउंड शोर था, शब्द कट गए थे, या लोग गलत वाक्य पढ़ रहे थे। शेष 5,162 साफ रिकॉर्डिंग्स (लगभग 18 घंटे का ऑडियो) नया डेटासेट बनीं।

🧪 द टेस्ट ड्राइव: AI को काम पर लगाना

एक बार जब "लाइब्रेरी" बन गई, तो लेखकों को यह देखने की आवश्यकता थी कि क्या यह वास्तव में कंप्यूटर को सीखने में मदद करती है। उन्होंने Whisper नामक एक प्रसिद्ध AI मॉडल (इसे एक बहुत ही स्मार्ट, लेकिन वर्तमान में अप्रशिक्षित छात्र के रूप में सोचें) का उपयोग किया और उसे अपने नए डेटा का उपयोग करके एक क्रैश कोर्स दिया।

उन्होंने तीन अलग-अलग प्रशिक्षण परिदृश्य चलाए:

  1. द सोलो स्टूडेंट: AI ने केवल नए कोबानी डेटा से सीखने की कोशिश की। इसने ठीक-ठाक प्रदर्शन किया, लेकिन संघर्ष भी किया।
  2. द ट्रांसफर स्टूडेंट: AI ने पहले एक अलग कुर्दिश डेटासेट (Common Voice) से सीखा और फिर कोबानी पर आया। यह बेहतर था।
  3. द टू-स्टेप डांस (विजेता): AI ने पहले Common Voice डेटा पर बुनियादी बातें सीखीं, फिर अपने कौशल को नए कोबानी डेटा पर परिष्कृत किया। यह सबसे अच्छा रहा। यह एक शांत अभ्यास ट्रैक पर गाड़ी चलाना सीखने के बाद व्यस्त हाईवे पर जाने जैसा है। परिणाम त्रुटियों में महत्वपूर्ण गिरावट थी, जिसका अर्थ है कि कंप्यूटर अंततः उत्तरी कुर्दिश भाषण को बहुत अधिक सटीकता से समझ सकता था।

🌍 द ट्रांसलेशन चैलेंज

टीम ने यह भी परीक्षण किया कि क्या AI उत्तरी कुर्दिश को सुन सकता है और तुरंत अंग्रेजी (और फ्रेंच या डच जैसी अन्य भाषाओं) में अनुवाद कर सकता है।

  • डायरेक्ट ट्रांसलेशन: AI ने सीधे कुर्दिश से अंग्रेजी में अनुवाद करने की कोशिश की। इसने एक अच्छा स्कोर प्राप्त किया, लेकिन पूर्ण नहीं।
  • द "पिवट" प्रॉब्लम: उन्होंने कुर्दिश से अंग्रेजी, और फिर अंग्रेजी से फ्रेंच (एक "पिवट" रणनीति) में अनुवाद करने का प्रयास किया। दिलचस्प बात यह है कि यह अंग्रेजी के करीब की भाषाओं (जैसे फ्रेंच या डच) के लिए अच्छा काम करता है, लेकिन कुर्दिश के भाषाई रूप से समान भाषाओं (जैसे मध्य कुर्दिश या फारसी) के लिए विफल रहा। यह एक चुटकुले का अनुवाद करने जैसा है: कभी-कभी एक सामान्य भाषा (अंग्रेजी) के माध्यम से अनुवाद करने पर, एक समान भाषा के लिए आवश्यक विशिष्ट सांस्कृतिक बारीकियां खो जाती हैं।

🚀 यह क्यों मायने रखता है

इस शोध पत्र से पहले, उत्तरी कुर्दिश स्पीच टेक्नोलॉजी की दुनिया में एक "घोस्ट लैंग्वेज" (भूतिया भाषा) थी—लाखों द्वारा बोली जाने वाली लेकिन कंप्यूटर के लिए अदृश्य।

  • पहला बेंचमार्क: यह पहली बार है जब किसी ने उत्तरी कुर्दिश स्पीच के लिए एक मानकीकृत "टेस्ट" बनाया है। यह अंततः उस समूह को ड्राइविंग लाइसेंस परीक्षा देने जैसा है जो पहले केवल अंदाज़ा लगा रहे थे।
  • ओपन सोर्स: डेटा अब कोई भी उपयोग करने के लिए स्वतंत्र है (एक क्रिएटिव कॉमन्स लाइसेंस के तहत), जिससे शोधकर्ताओं के लिए बेहतर उपकरण बनाने की बाधा कम हो जाती है।
  • भविष्य का विकास: लेखक स्वीकार करते हैं कि डेटा पूर्ण नहीं है (मुख्य रूप से महिला वक्ता, कुछ तकनीकी खामियां), लेकिन यह एक ठोस आधार है। यह कुर्दिश भाषा तकनीक के लिए एक नए भवन की पहली ईंट है।

संक्षेप में: लेखकों ने कंप्यूटरों के लिए उत्तरी कुर्दिश सीखने के लिए एक नया, विशेष प्रशिक्षण मैदान बनाया। इस डेटा को रिकॉर्ड करके, साफ करके और परीक्षण करके, उन्होंने AI को उस भाषा को समझने और बोलने का मौका दिया है जिसे पहले बातचीत से बाहर छोड़ दिया गया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →