Probing Social Identity Bias in Chinese LLMs with Gendered Pronouns and Social Groups
यह अध्ययन दस चीनी लार्ज लैंग्वेज मॉडल्स में मैंडरिन-विशिष्ट प्रॉम्प्ट्स का उपयोग करके 240 सामाजिक समूहों में इनग्रुप (अंतःसमूह) और आउटग्रुप (बाह्यसमूह) फ्रेमिंग की तुलना करते हुए सामाजिक पहचान संबंधी पूर्वाग्रहों का मूल्यांकन करता है, जो यह प्रकट करता है कि हालांकि इंस्ट्रक्शन ट्यूनिंग भावना संबंधी विषमताओं को कम करती है, विषाक्तता अंतराल बने रहते हैं और स्पष्ट रूप से स्त्रीलिंग बहुवचन सर्वनामों के उपयोग से और अधिक बढ़ जाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास बहुत बुद्धिमान, डिजिटल कहानीकार (लार्ज लैंग्वेज मॉडल्स, या LLMs) हैं जो चीनी भाषा बोलते हैं। इन मॉडलों ने इंटरनेट पर लिखी लगभग हर चीज़ को पढ़ा है, इसलिए वे दुनिया के बारे में बहुत कुछ जानते हैं। लेकिन, लोगों की तरह, उन्होंने अपने साथ कुछ छिपे हुए पूर्वाग्रह भी सीख लिए होंगे।
यह शोध पत्र एक जासूसी कहानी की तरह है जहाँ शोधकर्ता इन डिजिटल कहानीकारों को यह देखने के लिए एक परीक्षण में डालते हैं कि क्या वे "हम" के बजाय "वे" के साथ अलग व्यवहार करते हैं।
सेटअप: "हम" बनाम "वे"
शोधकर्ता यह देखना चाहते थे कि क्या मॉडल तब अधिक विनम्र होते हैं जब कहानी अंदर से सुनाई जाती है ("हम हैं..." - We are...) तुलना में जब कहानी बाहर से सुनाई जाती है ("वे हैं..." - They are...)।
इसे एक स्कूल के खेल के मैदान की तरह समझें। यदि कोई छात्र कहता है, "हम फुटबॉल टीम हैं," तो वह गर्वित और खुश लग सकता है। लेकिन यदि वह कहता है, "वे फुटबॉल टीम हैं" (प्रतिद्वंद्वी टीम के संदर्भ में), तो वह आलोचनात्मक या कठोर लग सकता है। शोधकर्ताओं ने पूछा: क्या ये AI मॉडल भी ऐसा ही करते हैं?
उन्होंने 10 अलग-अलग चीनी AI मॉडलों का परीक्षण 240 विभिन्न सामाजिक समूहों (जैसे विभिन्न आयु, व्यवसाय या पृष्ठभूमि के लोग) के साथ किया।
विशेष चीनी मोड़: "वह/वे" (He/She) सर्वनाम का अंतर
यहीं पर यह अध्ययन वास्तव में चतुर हो जाता है। अंग्रेजी में, "they" शब्द का उपयोग लिंग की परवाह किए बिना लोगों के समूह के लिए किया जाता है। लेकिन चीनी भाषा में, लेखन में एक दृश्य अंतर है:
- 他们 (Tāmen): एक मिश्रित समूह के लिए डिफ़ॉल्ट "वे"। यह एक "व्यक्ति" और एक "घोड़े" (एक तटस्थ प्रतीक) जैसा दिखता है।
- 她们 (Tāmen): एक पूरी तरह से महिला समूह के लिए विशिष्ट "वे"। यह एक "व्यक्ति" और एक "महिला" प्रतीक जैसा दिखता है।
शोधकर्ताओं ने इस अंतर का एक विशेष उपकरण के रूप में उपयोग किया। उन्होंने AI से समूहों के बारे में तटस्थ "वे" (他们) का उपयोग करके बात करने के लिए कहा और फिर महिला-विशिष्ट "वे" (她们) का उपयोग करके। वे यह देखना चाहते थे कि क्या AI केवल इसलिए अधिक कठोर हो गया क्योंकि समूह को स्पष्ट रूप से महिला के रूप में चिह्नित किया गया था।
उन्हें क्या मिला
1. "हम" बनाम "वे" का पूर्वाग्रह
खेल के मैदान वाले उदाहरण की तरह, AI मॉडल आमतौर पर "वे" समूहों की तुलना में "हम" समूहों को अधिक पसंद करते थे।
- जब AI ने "हम हैं..." कहा, तो प्रतिक्रियाएँ अधिक गर्मजोशी भरी और सकारात्मक थीं।
- जब AI ने "वे हैं..." कहा, तो प्रतिक्रियाएँ ठंडी और कभी-कभी शत्रुतापूर्ण भी थीं।
- पकड़: यह घृणा का कोई बड़ा विस्फोट नहीं था, बल्कि एक सूक्ष्म, निरंतर पैटर्न था। यह बाहरी लोगों के बारे में बात करते समय एक हल्की सी मुस्कान के बजाय एक हल्की सी त्योरियाँ चढ़ाने जैसा है।
2. "शिक्षक" बनाम "छात्र" (इंस्ट्रक्शन ट्यूनिंग)
शोधकर्ताओं ने दो प्रकार के मॉडलों का परीक्षण किया:
- बेस मॉडल्स (Base Models): ये कच्चे छात्रों की तरह हैं जिन्होंने बहुत कुछ पढ़ा है लेकिन उन्हें अभी तक विनम्र व्यवहार करना नहीं सिखाया गया है। ये मॉडल "वे" समूहों के प्रति अधिक कठोर होने की संभावना रखते थे।
- इंस्ट्रक्शन-ट्यून्ड मॉडल्स (Instruction-Tuned Models): ये उन छात्रों की तरह हैं जिन्हें शिक्षकों (इंसानों) द्वारा मददगार और सुरक्षित होने के लिए सिखाया गया है। ये मॉडल सभी के प्रति विनम्र होने में बेहतर थे। उन्होंने "मुस्कान बनाम त्योरियाँ" के अंतर को कम कर दिया।
- हालाँकि: यहाँ तक कि "अच्छे छात्र" (विनम्र वाले) में भी एक छिपी हुई समस्या थी। हालांकि उन्होंने अपनी टोन में कठोरता को कम कर दिया था, फिर भी वे "वे" समूहों के बारे में बात करते समय विषाक्तता (अभद्र या असुरक्षित भाषा) के संकेत दिखाते थे, खासकर यदि समूह को महिला के रूप में चिह्नित किया गया हो।
3. "महिला" दंड (The Female Penalty)
यह एक आश्चर्यजनक खोज थी। कई मॉडलों में, जब AI ने महिला-विशिष्ट सर्वनाम (她们) का उपयोग किया, तो प्रतिक्रियाएँ तटस्थ सर्वनाम (他们) की तुलना में वास्तव में अधिक विषाक्त (अधिक अभद्र या हानिकारक) थीं।
- ऐसा लगता है जैसे AI, विनम्र होने की कोशिश करते हुए भी, अवचेतन रूप से सोचता है, "ओह, यह समूह पूरी तरह से महिलाओं का है," और तुरंत अपने शब्दों में थोड़ा अधिक आलोचनात्मक या असुरक्षित हो जाता है। यह एक ऐसा पूर्वाग्रह है जो आप अंग्रेजी में नहीं देखेंगे क्योंकि अंग्रेजी में "वे" के लिए कोई दृश्य अंतर नहीं है।
4. वास्तविक जीवन की जाँच
शोधकर्ताओं ने मनुष्यों और AI के बीच वास्तविक बातचीत (एक सार्वजनिक डेटासेट से) को भी देखा। उन्होंने पाया कि वास्तविक जीवन में भी, AI "हम" के प्रति अधिक दयालु और "वे" के प्रति थोड़ा अधिक आलोचनात्मक रहने की प्रवृत्ति रखता है, जिससे पता चलता है कि यह केवल प्रयोगशाला का प्रयोग नहीं है—यह वास्तविक दुनिया में भी होता है।
मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि चीनी AI मॉडल तटस्थ रोबोट नहीं हैं। वे सामाजिक पूर्वाग्रह रखते हैं:
- वे "हम" को "वे" से ऊपर रखते हैं।
- वे "वे" के प्रति "हम" की तुलना में अधिक कठोर हो सकते हैं।
- उनमें महिलाओं के रूप में चिह्नित समूहों के प्रति एक विशिष्ट, छिपा हुआ पूर्वाग्रह है, जो तब भी दिखाई देता है जब AI विनम्र होने की कोशिश करता है।
शोधकर्ता कहते हैं कि इसे ठीक करने के लिए, हम केवल अंग्रेजी के नियमों का उपयोग नहीं कर सकते। हमें इन AI उपकरणों को सभी के लिए निष्पक्ष और सुरक्षित बनाने के लिए चीनी भाषा की विशिष्ट बारीकियों (जैसे उन सर्वनाम अंतरों) को समझने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।