← नवीनतम पेपर
💬 NLP

SAFARI: A Community-Engaged Approach and Dataset of Stereotype Resources in the Sub-Saharan African Context

यह शोध पत्र SAFARI को प्रस्तुत करता है, जो एक समुदाय-संलग्न बहुभाषी डेटासेट है जिसमें घाना, केन्या, नाइजीरिया और दक्षिण अफ्रीका की 16 भाषाओं में 6,700 से अधिक रूढ़ियाँ (stereotypes) शामिल हैं, जिसे सांस्कृतिक रूप से संवेदनशील, मूल-भाषा सर्वेक्षण विधियों के माध्यम से जनरेटिव एआई सुरक्षा आकलन में उप-सहारा अफ्रीकी संदर्भों के कम प्रतिनिधित्व को संबोधित करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Aishwarya Verma, Laud Ammah, Olivia Nercy Ndlovu Lucas, Andrew Zaldivar, Vinodkumar Prabhakaran, Sunipa Dev

प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aishwarya Verma, Laud Ammah, Olivia Nercy Ndlovu Lucas, Andrew Zaldivar, Vinodkumar Prabhakaran, Sunipa Dev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए छात्र को दुनिया को समझना सिखा रहे हैं। आप उसे लोगों की कहानियों से भरी एक विशाल पाठ्यपुस्तक देते हैं। लेकिन यहाँ एक पेंच है: यह पाठ्यपुस्तक ज्यादातर न्यूयॉर्क, लंदन और मुंबई के लोगों द्वारा लिखी गई है। इसमें उन शहरों में जीवन के बारे में हजारों पन्ने हैं, लेकिन घाना, केन्या, नाइजीरिया और दक्षिण अफ्रीका में जीवन के बारे में केवल कुछ धुंधले, पुराने पन्ने ही हैं।

जब यह छात्र (एक आर्टिफिशियल इंटेलिजेंस) उन अफ्रीकी देशों के किसी व्यक्ति के बारे में बात करने की कोशिश करता है, तो वह अक्सर मनगढ़ंत बातें बनाने लगता है या हानिकारक, पुराने ज़माने के अफवाहों को दोहराने लगता है क्योंकि उसके पास वास्तविक, स्थानीय ज्ञान नहीं है।

यह शोध पत्र, जिसका शीर्षक SAFARI है, इस पाठ्यपुस्तक को ठीक करने के बारे में है।

समस्या: "अंध बिंदु" (The Blind Spot)

वर्तमान AI मॉडलों को एक ऐसे पर्यटक की तरह समझें जिसने केवल कुछ बड़े शहरों का दौरा किया है। यदि आप उनसे अफ्रीकी सवाना के एक गाँव के बारे में पूछते हैं, तो वे फिल्मों या पुरानी कहानियों के आधार पर अनुमान लगा सकते हैं। वे कह सकते हैं, "ओह, वहाँ हर कोई आलसी है," या "वे सभी अमीर हैं," या "वे जादू का अभ्यास करते हैं।" ये रूढ़ियाँ (Stereotypes) हैं—लोगों के बारे में अति-सरलीकृत, अक्सर अनुचित विचार।

जबकि शोधकर्ता अमेरिका और भारत के लिए इन रूढ़ियों की सूचियों को एकत्र कर रहे हैं, अफ्रीकी महाद्वीप की काफी हद तक अनदेखी की गई है। AI नाइजीरिया या दक्षिण अफ्रीका जैसी जगहों पर लोगों के सोचने के वास्तविक, जटिल और सूक्ष्म तरीके के प्रति "अंधा" है।

समाधान: SAFARI प्रोजेक्ट

लेखकों ने एक नया डेटासेट बनाया जिसे SAFARI (Sub-Saharan African Associations about Regionally-salient Identities) कहा जाता है।

केवल लोगों से कंप्यूटर पर फॉर्म भरने के लिए कहने के बजाय (जो कठिन है जब इंटरनेट धीमा हो या कीबोर्ड में स्थानीय भाषाओं के सही अक्षर न हों), उन्होंने कुछ अलग किया। उन्होंने रेडियो होस्ट की तरह काम किया।

  1. फोन कॉल पद्धति: उन्होंने स्थानीय भागीदारों को फोन पर लोगों को कॉल करने के लिए काम पर रखा।
  2. भाषा में बोलना: कॉल करने वालों ने केवल अंग्रेजी में नहीं, बल्कि उनकी मातृभाषा (जैसे स्वाहिली, योरूबा, या ज़ुलु) में बात की। यह महत्वपूर्ण है क्योंकि कुछ विचारों का अनुवाद करना कठिन होता है, और लोग अपनी मातृभाषा में खुद को बेहतर तरीके से व्यक्त करते हैं।
  3. "मौखिक परंपरा": अफ्रीका में कहानी सुनाने और मौखिक इतिहास की एक मजबूत परंपरा है। फोन का उपयोग करके, शोधकर्ताओं ने इस परंपरा का सम्मान किया, और शब्दों के बजाय रूढ़ियों के स्वर और भाव को भी पकड़ा।

उन्होंने क्या पाया?

उन्होंने चार देशों के 410 लोगों से बात की और अंग्रेजी में 3,500 से अधिक रूढ़ियाँ और 15 विभिन्न स्थानीय भाषाओं में 3,200 रूढ़ियाँ एकत्र कीं।

उन्होंने कुछ दिलचस्प पैटर्न खोजे, जैसे कि मानचित्र में छिपे खजानों की खोज करना:

  • जादू और अनुष्ठान: घाना और केन्या में, कई रूढ़ियाँ "जादू टोना" या "अनुष्ठानों" के इर्द-गिर्द घूमती हैं, जो अक्सर विशिष्ट जातीय समूहों को निशाना बनाती हैं।
  • पैसा और मामले: केन्या और नाइजीरिया में, "अमीर" होने या "दौलत दिखाने" के बारे में कई रूढ़ियाँ हैं।
  • नौकरियाँ: घाना में, पुलिस अधिकारियों या राजनेताओं के भ्रष्ट होने जैसे कुछ पेशों के बारे में लोगों की मजबूत राय है।
  • लिंग (Gender): लगभग 58% लिंग संबंधी रूढ़ियों ने महिलाओं को निशाना बनाया।

"अनुवाद" की चुनौती

एक पेचीदा हिस्सा था। शोधकर्ताओं को पहले जवाबों को अंग्रेजी में रिकॉर्ड करना पड़ा (क्योंकि उनके कंप्यूटर आसानी से उन सभी स्थानीय भाषाओं में टाइप नहीं कर सकते थे) और फिर विशेषज्ञों को उन्हें वापस स्थानीय भाषाओं में अनुवाद करने के लिए काम पर रखना पड़ा।

इसे ऐसे समझें: आप अपने दोस्त से उनकी मूल भाषा में एक सवाल पूछते हैं, उनका जवाब अंग्रेजी में लिखते हैं, और फिर एक अनुवादक को उसे वापस उनकी मूल भाषा में लिखने के लिए काम पर रखते हैं। आप थोड़ा सा "स्वाद" या विशिष्ट भावना खो सकते हैं, लेकिन कंप्यूटरों के समझने योग्य प्रारूप में डेटा प्राप्त करने का यही एकमात्र तरीका है। टीम बहुत सावधान रही ताकि मूल अर्थ यथावत बना रहे।

यह क्यों मायने रखता है?

शोधकर्ताओं ने इस नए डेटासेट का परीक्षण दुनिया के सबसे प्रसिद्ध AI मॉडलों (जैसे गूगल, OpenAI और Anthanthropic के मॉडल) के विरुद्ध किया।

परिणाम एक चेतावनी की तरह था।
यहाँ तक कि सबसे स्मार्ट AI भी अभी भी इन हानिकारक रूढ़ियों को दोहरा रहे थे। वास्तव में, AI स्थानीय भाषा में बोलने की तुलना में अंग्रेजी में बोलते समय इन रूढ़ियों को दोहराने की अधिक संभावना रखता था। ऐसा इसलिए है क्योंकि AI का "प्रशिक्षण डेटा" पश्चिमी अंग्रेजी पर बहुत भारी है, इसलिए वह स्थानीय संदर्भ को नहीं समझता है।

मुख्य निष्कर्ष

यह शोध पत्र केवल शब्दों की सूची के बारे में नहीं है; यह अनुसंधान करने के एक नए तरीके के बारे में है।

  • पुराना तरीका: "हम सभी को एक सर्वे लिंक भेजेंगे।" (विफल होता है यदि आपके पास अच्छा इंटरनेट न हो या अच्छा कीबोर्ड न हो)।
  • SAFARI तरीका: "हम आपको कॉल करेंगे, आपकी भाषा बोलेंगे, और आपकी कहानियाँ सुनेंगे।"

इस "सामुदायिक-संलग्न" दृष्टिकोण को बनाकर, लेखक यह कह रहे हैं: यदि आप चाहते हैं कि AI सभी के लिए सुरक्षित और निष्पक्ष हो, तो आप इसे केवल सिलिकॉन वैली की लैब में नहीं बना सकते। आपको समुदाय के पास जाना होगा, उन्हें सुनना होगा, और उनके साथ मिलकर उपकरण बनाने होंगे।

यह डेटासेट अब डेवलपर्स के लिए एक उपकरण है ताकि वे अपने AI मॉडलों को इन हानिकारक अफवाहों को दोहराना बंद करने और उप-सहारा अफ्रीका की वास्तविक, विविध और जटिल मानवीय कहानियों को समझना सिखा सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →