← नवीनतम पेपर
💬 NLP

5-Dialects-BN: Unmasking the Impact of Transliteration on Bangla Dialectal LLMs

यह शोध पत्र 5-Dialects-BN को प्रस्तुत करता है, जो पांच प्रमुख बांग्ला क्षेत्रीय विविधताओं के लिए विषयपरकता (subjectivity) लेबल के साथ रोमनकृत लिप्यंतरण (Romanized transliteration) को बोली संबंधी, मानक और अंग्रेजी ग्रंथों के साथ संरेखित करने वाला पहला बहु-एनोटेशन बेंचमार्क है, जिसका उद्देश्य संसाधन अंतराल को पाटना और बोली-जागरूक लार्ज लैंग्वेज मॉडल्स का सिद्धांतपूर्ण मूल्यांकन सक्षम करना है।

मूल लेखक: Md Mahir Jawad, Galib Mahmud Jim, Rafid Ahmed, Mir Sazzat Hossain, Md Fahim, Md Farhad Alam Bhuiyan

प्रकाशित 2026-09-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Mahir Jawad, Galib Mahmud Jim, Rafid Ahmed, Mir Sazzat Hossain, Md Fahim, Md Farhad Alam Bhuiyan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

भाषा कोई एक एकल, ठोस खंड नहीं है; यह एक जीवंत परिदृश्य है जो लोगों के विभिन्न क्षेत्रों में जाने के साथ बदलता और परिवर्तित होता रहता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, लार्ज लैंग्वेज मॉडल्स टेक्स्ट को समझने और उत्पन्न करने में अविश्वसनीय रूप से कुशल हो गए हैं, लेकिन उन्होंने मुख्य रूप से भाषाओं के एक बहुत ही विशिष्ट, औपचारिक संस्करण से सीखा है। जब ये डिजिटल मस्तिष्क वास्तविक जीवन में लोगों द्वारा अपने स्थानीय मोहल्लों में वास्तव में बोले जाने वाले अनौपचारिक और जीवंत तरीके का सामना करते हैं, तो वे अक्सर लड़खड़ा जाते हैं। यह विशेष रूप से बंगाली के मामले में सच है, जो बांग्लादेश और भारत के विभिन्न हिस्सों में करोड़ों लोगों द्वारा बोली जाने वाली भाषा है। जबकि भाषा का मानक, औपचारिक संस्करण अच्छी तरह से प्रलेखित है, चटगाँव, सिलहट और बरिशाल जैसे शहरों में बोली जाने वाली कई क्षेत्रीय बोलियों को तकनीक के लिए काफी हद तक अदृश्य रखा गया है। इस क्षेत्र के लोग अक्सर अपनी स्थानीय बोली और अंग्रेजी अक्षरों के मिश्रण में टाइप करते हैं, जिसे लिप्यंतरण (ट्रांसलिटेरेशन) कहा जाता है, जिससे एक अनूठी डिजिटल आवाज़ बनती है जिसे मौजूदा सिस्टम समझने में संघर्ष करते हैं।

शोधकर्ताओं की एक टीम ने 5-DIALECTS-BN नामक एक नया संसाधन बनाकर इस अनछुए क्षेत्र का मानचित्रण करने का लक्ष्य रखा। उन्होंने सोशल मीडिया और ऑनलाइन फ़ोरम से 6,000 वास्तविक वाक्य एकत्र किए, जो पाँच विशिष्ट क्षेत्रीय बोलियों: चटगाँव, बरिशाल, नोआखाली, सिलहट और रंगपुर में लोगों के बोलने के स्वाभाविक तरीके को दर्शाते हैं। प्रत्येक वाक्य के लिए, उन्होंने केवल शब्दों को रिकॉर्ड नहीं किया; बल्कि उन्होंने एक ही विचार को व्यक्त करने के विभिन्न तरीकों के बीच एक पूर्ण सेतु का निर्माण किया। प्रत्येक प्रविष्टि में मूल पाठ स्थानीय बोली में, अंग्रेजी अक्षरों में लिखा गया एक संस्करण (लिप्यंतरण), मानक बंगाली में एक अनुवाद, अंग्रेजी में एक अनुवाद, और एक लेबल शामिल है जो यह दर्शाता है कि वाक्य व्यक्तिगत राय व्यक्त करता है या एक साधारण तथ्य। यह सावधानीपूर्वक, मानव-सत्यापित कार्य यह सुनिश्चित करता है कि डेटा भाषा की वास्तविक बारीकियों को दर्शाता है, जिसमें अनूठे स्लैंग शब्द से लेकर उच्चारण में सूक्ष्म बदलाव तक शामिल हैं जो वाक्य का अर्थ बदल देते हैं।

शोधकर्ताओं ने इस नए डेटासेट को परीक्षण के लिए रखा, जिसमें सात अलग-अलग लार्ज लैंग्वेज मॉडल्स को तीन विशिष्ट कार्य करने के लिए कहा गया: बोली का अंग्रेजी में अनुवाद करना, यह तय करना कि एक वाक्य राय है या तथ्य, और स्थानीय बोली को वापस मानक बंगाली में बदलना। उन्होंने मॉडल्स का कई तरीकों से परीक्षण किया, जिसमें उन्हें कोई उदाहरण न देना, उन्हें सीखने के लिए कुछ उदाहरण दिखाना, और एक ऐसी विधि का उपयोग करना शामिल था जहाँ मॉडल्स को उत्तर देने से पहले समस्या के बारे में चरण-दर-चरण "सोचने" की अनुमति दी गई थी। उन्होंने फाइन-ट्यूनिंग नामक एक तकनीक का भी प्रयास किया, जहाँ उन्होंने मॉडल्स को केवल कुछ उदाहरणों—प्रत्येक बोली के लिए 160 वाक्य—का उपयोग करके सिखाया, यह देखने के लिए कि क्या थोड़े से प्रत्यक्ष निर्देश से उन्हें बेहतर समझने में मदद मिल सकती है।

परिणामों ने इन शक्तिशाली मॉडल्स द्वारा भाषा को संभालने के तरीके में एक आश्चर्यजनक और महत्वपूर्ण खामी का खुलासा किया। शोधकर्ताओं ने पाया कि जब इनपुट टेक्स्ट अंग्रेजी अक्षरों (लिप्यंतरित) में लिखा गया था, तो मॉडल्स का प्रदर्शन सभी स्तरों पर काफी खराब रहा, चाहे मॉडल कितना भी स्मार्ट क्यों न हो या उन्हें कितने भी उदाहरण दिए गए हों। ऐसा इसलिए हुआ क्योंकि स्थानीय ध्वनियों को अंग्रेजी अक्षरों में बदलने की प्रक्रिया अक्सर महत्वपूर्ण जानकारी खो देती है। अंग्रेजी अक्षरों में लिखे जाने पर स्थानीय बोली की विभिन्न ध्वनियाँ एक जैसी दिख सकती हैं, जिससे भ्रम पैदा होता है जिसे मॉडल्स हल नहीं कर पाते। यह वैसा ही है जैसे कोई श्रोता एक दीवार के माध्यम से बातचीत को समझने की कोशिश कर रहा हो जो विशिष्ट आवृत्तियों को धीमा कर देती है; शब्द वहाँ हैं, लेकिन वे विशिष्ट गुण जो उन्हें स्पष्ट बनाते हैं, गायब हैं। यहाँ तक कि जब मॉडल्स को मदद के लिए थोड़ा सा प्रत्यक्ष प्रशिक्षण दिया गया, तब भी मूल लिपि और अंग्रेजी-अक्षर संस्करण के बीच का अंतर बना रहा, जिससे सिद्ध हुआ कि अंग्रेजी अक्षरों में अनुवाद के दौरान सूचना की हानि को पुनः प्राप्त करना कठिन है।

हालाँकि, अध्ययन ने आगे बढ़ने का एक स्पष्ट मार्ग भी प्रदान किया। जब शोधकर्ताओं ने प्रत्येक बोली के लिए केवल 160 उदाहरणों के साथ फाइन-ट्यूनिंग पद्धति का उपयोग किया, तो ओपन-सोर्स मॉडल्स में नाटकीय सुधार हुआ। वे यहाँ तक कि उन सबसे उन्नत, क्लोज्ड-सोर्स मॉडल्स को भी पीछे छोड़ने लगे जिन्होंने पहले कभी इस विशिष्ट डेटा को नहीं देखा था। यह सुझाव देता है कि इन बोलियों को समझने में सबसे बड़ी बाधा कंप्यूटिंग शक्ति या बुद्धिमत्ता की कमी नहीं है, बल्कि केवल विशिष्ट, संरेखित डेटा की कमी है। मॉडल्स इन बोलियों को सीखने में सक्षम हैं यदि उन्हें सही उदाहरण दिए जाएं। अध्ययन निष्कर्ष निकालता है कि जबकि वर्तमान तकनीक लिप्यंतरित टेक्स्ट की अस्पष्टता के साथ संघर्ष करती है, उच्च-गुणवत्ता वाले, मानव-सत्यापित उदाहरण प्रदान करने से यह अंतर भरा जा सकता है। यह कार्य ऐसे सिस्टम बनाने की नींव रखता है जो वास्तव में लोगों के दैनिक जीवन में संचार करने के विविध और समृद्ध तरीकों को समझ सकें, और औपचारिक मानक से आगे बढ़कर भाषा के पूर्ण स्पेक्ट्रम को अपना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →