← नवीनतम पेपर
💬 NLP

Diversidade linguística e inclusão digital: desafios para uma ia brasileira

समाजभाषावैज्ञानिक अंतर्दृष्टि का उपयोग करते हुए, यह शोध पत्र तर्क देता है कि जनरेटिव एआई (generative AI) मॉडलों का प्रभुत्व भाषाई विविधता के लिए खतरा पैदा करता है, जिससे एक स्व-सुदृढ़ीकरण चक्र निर्मित होता है जहाँ केवल अच्छी तरह से प्रलेखित भाषा रूपों को ही संरक्षित किया जाता है, जबकि प्रशिक्षण डेटा की कमी के कारण कम प्रतिनिधित्व वाले बोलियों को हाशिए पर धकेल दिया जाता है।

मूल लेखक: Raquel Meister Ko Freitag

प्रकाशित 2026-03-24
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Raquel Meister Ko Freitag

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) एक सुपर-लर्नर (अति-शिक्षार्थी) की तरह है जो यह समझने की कोशिश कर रहा है कि इंसान कैसे बोलते हैं। सीखने के लिए, इस छात्र को लाखों किताबें पढ़ने, हजारों बातचीत सुनने और अनगिनत वीडियो देखने की आवश्यकता है। सूचनाओं के इस संग्रह को "ट्रेनिंग डेटासेट" कहा जाता है।

यह शोध पत्र, जिसे राकेल मेस्टर को फ्रिटैग द्वारा लिखा गया है, तर्क देता है कि यदि हम एक वास्तविक ब्राज़ीलियाई AI बनाना चाहते हैं, तो हम वर्तमान में इस छात्र को बहुत सीमित आहार खिला रहे हैं। सरल शब्दों में इसका विवरण यहाँ दिया गया है:

1. समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) का मिथक

ब्राजील सरकार के पास एक राष्ट्रीय AI बनाने की योजना है जो देश की विविधता का प्रतिनिधित्व करे। हालाँकि, यहाँ एक बड़ी गलतफहमी है: ब्राजील केवल एक भाषा नहीं बोलता है।

  • मिथक: कई लोग सोचते हैं कि ब्राजील में हर कोई बिल्कुल एक जैसा "पुर्तगाली" बोलता है।
  • वास्तविकता: ब्राजील एक भाषाई संगम है। पुर्तगाली के अलावा, यहाँ हैं:
    • स्वदेशी भाषाएँ (मूल निवासियों द्वारा बोली जाने वाली)।
    • सांकेतिक भाषा (Libras) बधिर समुदाय के लिए।
    • प्रवासी भाषाएँ (जैसे कुछ क्षेत्रों में इतालवी या जर्मन बोलियाँ)।
    • क्रीओल भाषाएँ और पुर्तगाली की कई अलग-अलग बोलियाँ

उपमा: कल्पना कीजिए कि एक शेफ एक "ब्राज़ीलियाई दावत" पकाने की कोशिश कर रहा है। यदि शेफ केवल टमाटर खरीदता है और मिर्च, मक्का, कसावा और मसालों को अनदेखा कर देता है जो वास्तविक व्यंजन बनाते हैं, तो व्यंजन का स्वाद ब्राज़ील जैसा नहीं होगा। यह केवल एक सामान्य टमाटर सूप जैसा लगेगा। वर्तमान में, अधिकांश AI मॉडल केवल "टमाटर" (मानक पुर्तगाली) खा रहे हैं, बाकी सामग्रियों को अनदेखा कर रहे हैं।

2. खतरा: पूर्वाग्रह का "दुष्चक्र" (Vicious Circle)

जब AI को केवल "मानक" या "प्रतिष्ठित" पुर्तगाली (वह तरह जिसे समाचार कक्षों और विश्वविद्यालयों में बोला जाता है) पर प्रशिक्षित किया जाता है, तो वह यह सीख जाता है कि बोलने का यही एकमात्र सही तरीका है।

  • पूर्वाग्रह (Bias): AI यह सोचना शुरू कर देता है कि बोलने के अन्य तरीके (जैसे क्षेत्रीय स्लैंग, ग्रामीण बोलियाँ या स्वदेशी भाषाएँ) "गलत" या "टूटे हुए" हैं।
  • परिणाम: AI उन लोगों को अनदेखा करना या उनका अपमान करना शुरू कर देता है जो इन अन्य तरीकों से बोलते हैं।
  • दुष्चक्र: क्योंकि AI केवल "मानक" भाषा को समझता है, इसलिए वह केवल उसी भाषा में डेटा उत्पन्न करता है। यह मानक भाषा को और अधिक प्रभावशाली बनाता है, जबकि अन्य भाषाएँ डिजिटल दुनिया से लुप्त होती जाती हैं। यह एक ऐसी लाइब्रेरी की तरह है जो केवल एक ही शैली में लिखी गई किताबें खरीदती है; अंततः, लेखन की अन्य सभी शैलियाँ गायब हो जाती हैं क्योंकि कोई भी उन्हें लाइब्रेरी में नहीं ढूंढ पाता।

3. समाधान: एक "भाषाई भंडार" (Linguistic Pantry) बनाना

लेखक का सुझाव है कि इसे ठीक करने के लिए, हमें भाषा डेटा को एक साइड प्रोजेक्ट के रूप में मानना बंद करना चाहिए और इसे एक राष्ट्रीय खजाने के रूप में देखना चाहिए।

  • वर्तमान अव्यवस्था: अभी, ब्राजील के भाषाविदों ने इन विविध भाषाओं को रिकॉर्ड करने में 50 साल बिताए हैं। उनके पास हजारों घंटों का ऑडियो और टेक्स्ट है। लेकिन यह डेटा बिखरा हुआ है—विभिन्न विश्वविद्यालय की दराजों में, निजी फाइलों में बंद है, या ऐसे अस्त-व्यस्त प्रारूपों में संग्रहीत है जिन्हें कंप्यूटर आसानी से पढ़ नहीं सकते।
  • समाधान: हमें एक राष्ट्रीय रिपॉजिटरी (National Repository) (एक विशाल, व्यवस्थित डिजिटल भंडार) बनाने की आवश्यकता है।
    • इसे एक केंद्रीकृत पुस्तकालय के रूप में सोचें जहाँ प्रत्येक ब्राज़ीलियाई बोली, स्वदेशी भाषा और सांकेतिक भाषा को सावधानीपूर्वक सूचीबद्ध, साफ और AI डेवलपर्स के उपयोग के लिए उपलब्ध कराया जाए।
    • यह सुनिश्चित करता है कि जब AI "छात्र" सीखता है, तो उसे सभी ब्राज़ीलियाई आवाजों का एक संतुलित आहार मिले, न कि केवल शोर मचाने वालों का।

4. यह "संप्रभुता" के लिए क्यों महत्वपूर्ण है

शोध पत्र का तर्क है कि ब्राजील के पास वास्तविक डिजिटल संप्रभुता (अपनी तकनीक पर नियंत्रण) होने के लिए, AI को वास्तविक ब्राजील को प्रतिबिंबित करना चाहिए।

यदि AI केवल अभिजात वर्ग की भाषा बोलता है, तो यह लाखों नागरिकों को बाहर कर देता है। एक नैतिक AI में अमेज़न की एक दादी, उत्तर-पूर्व के एक मछुआरे, साओ पाउलो के एक बधिर व्यक्ति और एक स्वदेशी भाषा बोलने वाले को समान सम्मान के साथ समझने की क्षमता होनी चाहिए।

संक्षेप में:
एक ऐसा ब्राज़ीलियाई AI बनाने के लिए जो सभी के लिए काम करे, हमें यह मानने का नाटक करना बंद करना होगा कि ब्राजील एक एकभाषी देश है। हमें अपने भाषाई पहेली के सभी बिखरे हुए टुकड़ों को इकट्ठा करना होगा और उन्हें AI को खिलाना होगा, ताकि वह केवल एक छोटे, विशेषाधिकार प्राप्त हिस्से की नहीं, बल्कि पूरे राष्ट्र की भाषा बोलना सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →