StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs
StereoTales एक बहुभाषी ढांचा और डेटासेट है जिसमें 10 भाषाओं में 650,000 से अधिक कहानियाँ शामिल हैं जो यह प्रकट करता है कि कैसे ओपन-एंडेड LLM जनरेशन, मॉडल के आकार की परवाह किए बिना, व्यवस्थित रूप से सांस्कृतिक रूप से अनुकूलित, हानिकारक रूढ़ियों (stereotypes) का उत्पादन करता है, जबकि यह पूर्वाग्रह के मानवीय और AI निर्णयों के बीच मजबूत संरेखण को प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास विभिन्न तकनीकी कंपनियों के 23 अलग-अलग "कहानीकार" (AI मॉडल) हैं। आप प्रत्येक से एक पात्र के बारे में एक छोटी कहानी लिखने के लिए कहते हैं, लेकिन आप उन्हें केवल उस पात्र के बारे में एक विशिष्ट विवरण देते हैं—जैसे "पात्र एक सेवानिवत्त शिक्षक है" या "पात्र एक युवा अप्रवासी है।"
शोध पत्र, StereoTales, यह देखने के लिए एक विशाल प्रयोग है कि उनके अन्य कहानीकार अपने आप में कौन से विवरण आविष्कार करते हैं। क्या वे अनजाने में हानिकारक रूढ़ियों (stereotypes) के साथ खाली जगहों को भर देते हैं?
यहाँ उनका निष्कर्ष दिया गया है, सरल उपमाओं का उपयोग करते हुए:
1. प्रयोग: एक "खाली स्थान भरने वाला" खेल
शोधकर्ताओं ने केवल AI से यह नहीं पूछा कि "क्या यह वाक्य पक्षपाती है?" (जो कि एक बहुविकल्पीय परीक्षा की तरह है)। इसके बजाय, उन्होंने AI को स्वतंत्र रूप से कहानियाँ लिखने दिया।
- सेटअप: उन्होंने 10 अलग-अलग भाषाओं (अंग्रेजी, फ्रेंच, अरबी, चीनी, आदि) में प्रॉम्प्ट बनाए और 79 अलग-अलग पात्र गुणों (आयु, पेशा, धर्म, आय, आदि) को कवर किया।
- मात्रा: उन्होंने 6,50,000 से अधिक कहानियाँ उत्पन्न कीं।
- लक्ष्य: यह देखना था कि क्या AI, जब उसे अपने हाल पर छोड़ दिया जाता है, तो वह स्वचालित रूप से कुछ समूहों को नकारात्मक गुणों से जोड़ देता है (जैसे, "अप्रवासी" को "गरीब" के साथ या "महिला" को "सेक्रेटरी" के साथ जोड़ना) बिना इसके कहे कि उसे ऐसा करना चाहिए।
2. निष्कर्ष #1: "बुरी आदतें" हर जगह हैं
उपमा: कल्पना कीजिए कि 23 अलग-अलग शेफों से भरा एक कमरा है। आप उन सभी से भोजन पकाने के लिए कहते हैं। आप उम्मीद कर सकते हैं कि "शानदार" शेफ एकदम सही होंगे और "साधारण" वाले गलतियाँ करेंगे।
वास्तविकता: शोध में पाया गया कि हर एक शेफ ने अपने व्यंजन में हानिकारक मसाले का एक चुटकी डाल दिया था, चाहे वे कितने भी प्रसिद्ध या महंगे क्यों न हों।
- सार्वभौमिक: सबसे बड़े, सबसे शक्तिशाली मॉडलों से लेकर छोटे, ओपन-सोर्स मॉडलों तक, उन सभी ने हानिकारक रूढ़ियाँ पैदा कीं।
- साझा: यह केवल एक "खराब सेब" की बात नहीं थी। वही हानिकारक जुड़ाव लगभग सभी अलग-अलग कंपनियों में दिखाई दिए। यह ऐसा है जैसे उन्होंने सभी एक ही बुरी आदतें सीखीं जो उन्हीं किताबों से आई हैं जिन पर उन्हें प्रशिक्षित किया गया था।
- आकार मायने नहीं रखता: AI को "स्मार्टर" या "बड़ा" बनाने से यह नहीं रुका। वास्तव में, सबसे सक्षम मॉडलों ने कभी-कभी कम के बजाय अधिक हानिकारक जुड़ाव पैदा किए।
3. निष्कर्ष #2: "सांस्कृतिक गिरगिट" प्रभाव
उपमा: एक गिरगिट की कल्पना करें जो न केवल उस शाखा के आधार पर अपना रंग बदलता है जिस पर वह बैठा है, बल्कि इस आधार पर भी कि आप उससे किस भाषा में बात कर रहे हैं।
वास्तविकता: AI केवल एक सेट पूर्वाग्रहों को अलग-अलग भाषाओं में अनुवादित नहीं करता है। इसके बजाय, यह उस भाषा की संस्कृति के अनुरूप अपने पूर्वाग्रहों को ढाल लेता है।
- स्थानीय रूढ़ियाँ: यदि आप अंग्रेजी में पूछते हैं, तो AI अमेरिका में आम किसी विशिष्ट समूह के बारे में रूढ़िबद्ध धारणा बना सकता है। यदि आप स्पेनिश में पूछते हैं, तो यह लैटिन अमेरिका में आम किसी अन्य समूह के बारे में रूढ़िबद्ध धारणा बना सकता है।
- खतरा: इसका मतलब है कि AI को केवल अंग्रेजी में परखना एक हरे पत्ते पर गिरगिट को देखने जैसा है। आप उसके अन्य रंगों को मिस कर देंगे जो वह लाल या नीले पत्तों पर दिखाता है। शोध पत्र का तर्क है कि एक AI अंग्रेजी में "सुरक्षित" दिख सकता है लेकिन दूसरी भाषा में स्विच करने पर बहुत पक्षपाती हो सकता है।
4. निष्कर्ष #3: AI खुद को परख सकता है (लेकिन वह थोड़ा अंधा है)
उपमा: शोधकर्ताओं ने AI से अपनी कहानियों को देखने और यह कहने के लिए कहा, "क्या यह हानिकारक है?" और इसकी तुलना 247 मानव न्यायाधीशों के पैनल से की।
वास्तविकता: AI और मनुष्य आम तौर पर सहमत थे (लगभग 62% संरेखण), लेकिन AI की कुछ ब्लाइंड स्पॉट (अंध बिंदु) भी थीं।
- कुछ चीजों पर अत्यधिक सावधानी: AI "लिंग" (Gender) और "यौन अभिविन्यास" (Sexual Orientation) के प्रति बहुत सख्त था। वह जानता था कि ये संवेदनशील विषय हैं और पक्षपाती होने से बचने की कोशिश करता था।
- अन्य चीजों पर ब्लाइंड स्पॉट: AI पैसे, शिक्षा, आयु और धर्म जैसी चीजों के बारे में आश्चर्यजनक रूप से उदार था। उसे यह नहीं लगा कि "गरीब लोगों" को "निरक्षरता" से जोड़ना उतना हानिकारक है जितना कि मनुष्यों को लगा।
- सीख: AI उन रूढ़ियों को पकड़ने में अच्छा है जिनके बारे में हम बात करते हैं (जैसे लिंग), लेकिन वह उन रूढ़ियों को मिस कर जाता है जिनके बारे में हम इतनी चर्चा नहीं करते (जैसे वर्ग या शिक्षा)।
5. बड़ी तस्वीर
शोध पत्र निष्कर्ष निकालता है कि हम केवल कुछ बहुविकल्पीय प्रश्नों और अंग्रेजी के माध्यम से यह जांच नहीं कर सकते कि AI "निष्पक्ष" है या नहीं।
- पूर्वाग्रह कहानियों में छिपे होते हैं: यह तब दिखाई देता है जब AI स्वतंत्र रूप से लिख रहा होता है, न कि केवल तब जब वह एक क्विज़ का उत्तर दे रहा होता है।
- पूर्वाग्रह सांस्कृतिक है: एक AI एक भाषा में सुरक्षित हो सकता है लेकिन दूसरी भाषा में खतरनाक हो सकता है।
- पूर्वाग्रह संरचनात्मक है: यह किसी एक मॉडल की खराबी नहीं है; यह इस बात की विशेषता है कि इन मॉडलों को कैसे बनाया और प्रशिक्षित किया गया है।
संक्षेप में: AI कहानीकार दर्पण की तरह हैं। यदि आप उनसे अंग्रेजी में बात करते हैं, तो वे आपको अमेरिकी पूर्वाग्रह दिखाते हैं। यदि आप उनसे अरबी या हिंदी में बात करते हैं, तो वे उन संस्कृतियों से जुड़े स्थानीय पूर्वाग्रह दिखाते हैं। और दुर्भाग्य से, लगभग हर दर्पण जो वे ऊपर उठाते हैं, वह कुछ हानिकारक रूढ़ियों को दर्शाता है, चाहे वह "स्मार्ट" दर्पण कितना भी होने का दावा क्यों न करे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।