← नवीनतम पेपर
🤖 AI

When LLMs Imagine People: A Human-Centered Persona Brainstorm Audit for Bias and Fairness in Creative Applications

यह शोध पत्र पर्सोना ब्रेनस्टॉर्म ऑडिट (PBA) प्रस्तुत करता है, जो नॉर्मलाइज्ड क्रैमर वी (normalized Cramér's V) का उपयोग करके ओपन-एंडेड एलएलएम-जनरेटेड (LLM-generated) पर्सोना में पूर्वाग्रह का पता लगाने की एक स्केलेबल विधि है, जो यह प्रकट करता है कि बड़े मॉडल बेहतर निष्पक्षता की गारंटी नहीं देते हैं और सिंगल-एक्सिस मूल्यांकन में इंटरसेक्शनल (intersectional) पूर्वाग्रह अक्सर छिपे रह जाते हैं।

मूल लेखक: Hongliu Cao, Eoin Thomas, Rodrigo Acuna Agost

प्रकाशित 2026-02-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongliu Cao, Eoin Thomas, Rodrigo Acuna Agost

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हायरिंग मैनेजर, एक गेम डिज़ाइनर, या एक लेखक हैं जो एक नई कहानी के लिए विविध पात्रों का समूह बनाना चाहते हैं। आप एक सुपर-स्मार्ट एआई असिस्टेंट से "20 अलग-अलग लोगों के बारे में विचार मंथन (brainstorm) करने" के लिए कहते हैं। आप जीवन के हर क्षेत्र से डॉक्टरों, कलाकारों, इंजीनियरों और शिक्षकों का मिश्रण होने की उम्मीद करते हैं।

लेकिन क्या होगा अगर एआई, बिना आपके ध्यान दिए, सभी डॉक्टरों को पुरुष बना देता है, सभी नर्सों को महिला बना देता है, और सभी इंजीनियरों को किसी विशिष्ट देश से बनाता है? वह बुरा बनने की कोशिश नहीं कर रहा है; वह बस उन पैटर्न को दोहरा रहा है जो उसने इंटरनेट से सीखे हैं।

यह पेपर एक नए टूल के बारे में है जिसे पर्सोना ब्रेनस्टॉर्म ऑडिट (PBA) कहा जाता है, जो इन एआई सहायकों के लिए एक "निष्पक्षता जासूस" (fairness detective) के रूप में कार्य करता है। यहाँ इसका सरल विवरण दिया गया:

1. समस्या: "इको चैंबर" प्रभाव

लार्ज लैंग्वेज मॉडल्स (LLMs) को एक विशाल स्पंज की तरह समझें जिसने इंटरनेट पर लिखी गई लगभग हर चीज़ को सोख लिया है। जब वे किसी व्यक्ति (एक "पर्सोना") को बनाने की कोशिश करते हैं, तो वे केवल कुछ नया आविष्कार नहीं करते; वे उस स्पंज से चीजें निकालते हैं। यदि स्पंज पुराने रूढ़िबद्ध विचारों (stereotypes) से भरा है (जैसे, "पुरुष गणित में अच्छे होते हैं," "महिलाएं देखभाल करने में अच्छी होती हैं"), तो एआई अनजाने में उन रूढ़ियों को वापस उगल देगा।

इसे जांचने के पुराने तरीके एक स्पंज को एक या दो बार दबाकर टेस्ट करने जैसे थे। उन्होंने कठोर, पूर्व-निर्धारित प्रश्न (जैसे, "क्या एक नर्स पुरुष है या महिला?") का उपयोग किया। पुराने परीक्षण एआई द्वारा रचनात्मक, खुले, और जटिल तरीके से पक्षपात दिखाने के तरीकों को पकड़ नहीं पाते थे।

2. समाधान: "निष्पक्षता जासूस" (PBA)

लेखकों ने एक नई विधि बनाई जिसे PBA कहा जाता है। एआई से क्विज़ पूछने के बजाय, वे कहते हैं: "हे एआई, कल्पना करो कि 20 अलग-अलग लोग हैं। मुझे उनके नाम, काम, शौक और पृष्ठभूमि बताओ।"

फिर, वे परिणामों को एक सांख्यिकीविद् (statistician) की तरह देखते हैं जो एक विशाल स्प्रेडशीट देख रहा हो। वे पूछते हैं:

  • "क्या 'स्मिथ' उपनाम वाले लोगों को हमेशा CEO बनाया जाता है?"
  • "क्या प्रोफाइल में 'लेस्बियन' होने पर उन्हें हमेशा कलाकार के रूप में दिखाया जाता है?"
  • "क्या 'ब्लैक' नामों को 'व्हाइट' नामों की तुलना में अधिक बार कम वेतन वाली नौकरियों में लगाया जाता है?"

वे इन पूर्वाग्रहों को एक गंभीरता स्कोर (severity score) देने के लिए एक विशेष गणितीय सूत्र (एक उन्नत "सहसंबंध मीटर") का उपयोग करते हैं। यह एक ट्रैफिक लाइट की तरह है:

  • 🟢 हरा: कम पूर्वाग्रह (एआई निष्पक्ष हो रहा है)।
  • 🟡 पीला: मध्यम पूर्वाग्रह (सावधान रहें)।
  • 🔴 लाल: उच्च पूर्वाग्रह (एआई भारी रूढ़िवादिता दिखा रहा है)।
  • गहरा लाल: बहुत उच्च पूर्वाग्रह (एआई बड़ी मुसीबत में है)।

3. सबसे बड़ा आश्चर्य: बड़ा होना हमेशा बेहतर नहीं होता

शोधकर्ताओं ने 12 अलग-अलग एआई मॉडल्स का परीक्षण किया (जिनमें नवीनतम, सबसे बड़े और सबसे महंगे मॉडल भी शामिल थे)। उन्हें उम्मीद थी कि जैसे-जैसे एआई स्मार्ट और नया होगा, वह अधिक निष्पक्ष होगा।

ट्विस्ट? जरूरी नहीं।

  • "नई कार की खुशबू" का मिथक: उन्होंने पाया कि नवीनतम, सबसे शक्तिशाली मॉडल (जैसे GPT-5 सीरीज़) कुछ मामलों में थोड़े पुराने मॉडल्स की तुलना में वास्तव में अधिक पक्षपाती थे।
  • "उतार-चढ़ाव" का रोलरकोस्टर: पूर्वाग्रह एक सीधी रेखा में नीचे नहीं जाता। यह ऊपर जाता है, फिर नीचे आता है, और फिर से बढ़ जाता है। यह एक डाइट की तरह है जहाँ आप वजन घटाते हैं, फिर वापस पाते हैं, फिर घटाते हैं। सिर्फ इसलिए कि कोई मॉडल "वर्जन 5.0" है, इसका मतलब यह नहीं है कि वह "फेयरनेस 5.0" है।
  • आकार मायने रखता है (लेकिन वैसे नहीं जैसा आप सोचते हैं): कभी-कभी, विशाल और जटिल मॉडल्स की तुलना में छोटे और सरल मॉडल्स वास्तव में अधिक निष्पक्ष थे।

4. छिपा हुआ खतरा: इंटरसेक्शनैलिटी (Intersectionality)

यह सबसे महत्वपूर्ण हिस्सा है। कल्पना कीजिए कि आप चेक करते हैं कि क्या एआई "महिलाओं" के प्रति निष्पक्ष है और आप पाते हैं कि यह ठीक है। फिर आप चेक करते हैं कि क्या यह "गे लोगों" के प्रति निष्पक्ष है और यह भी ठीक है। आप सोच सकते हैं, "फू, हम सुरक्षित हैं!"

लेकिन PBA टूल ने संयोजन (Intersectionality) को देखा। उन्होंने पाया कि जबकि एआई सामान्य तौर पर "महिलाओं" के साथ और सामान्य तौर पर "गे लोगों" के साथ ठीक हो सकता है, लेकिन जब वे आपस में मिलते हैं, तो यह बहुत अजीब हो जाता है।

  • उदाहरण: एआई "गे पुरुषों" और "विषमलैंगिक महिलाओं" के साथ निष्पक्ष हो सकता है, लेकिन जब वह एक "गे महिला" या "बायसेक्सुअल पुरुष" बनाता है, तो वह अचानक उन्हें बहुत विशिष्ट, अक्सर कम स्तर की नौकरियों में नियुक्त करने लगता है।
  • रूपक (Metaphor): यह चेक करने जैसा है कि क्या एक कार में अच्छे ब्रेक और अच्छे टायर हैं। व्यक्तिगत रूप से, वे ठीक हैं। लेकिन यदि आप फिसलन भरी सड़क (इंटरसेक्शनल पहचान) पर गाड़ी चलाते हैं, तो कार अभी भी दुर्घटनाग्रस्त हो सकती है क्योंकि संयोजन का परीक्षण नहीं किया गया था।

5. "मैजिक प्रॉम्प्ट" काम नहीं आया

शोधकर्ताओं ने एक सामान्य ट्रिक आजमाई: उन्होंने एआई को कहा, "कृपया विविधतापूर्ण बनें और रूढ़ियों से बचें!" (इसे "डिबायसिंग प्रॉम्प्ट" कहा जाता है)।

परिणाम? इसने शायद ही कुछ बदला। यह एक ऐसे व्यक्ति को बताने जैसा है जिसने जीवन भर जंक फूड खाया है, "बस एक सलाद खा लो," और यह उम्मीद करना कि वह तुरंत स्वास्थ्य के प्रति जागरूक हो जाएगा। एआई का आंतरिक "स्पंज" पुराने पैटर्न से इतना भरा हुआ था कि एक साधारण निर्देश उसे ठीक नहीं कर सका।

6. यह आपके लिए क्यों मायने रखता है

यदि आप कहानियाँ लिखने, वीडियो गेम डिजाइन करने, या यहाँ तक कि भर्ती सिमुलेशन में मदद करने के लिए एआई का उपयोग करते हैं, तो आप अनजाने में हानिकारक रूढ़ियों को फैला सकते हैं।

  • निर्माताओं के लिए: आप केवल नवीनतम एआई पर भरोसा नहीं कर सकते। आपको उसका ऑडिट करना होगा।
  • कंपनियों के लिए: आप यह मानकर नहीं चल सकते कि अधिक महंगा एआई मॉडल खरीदने का मतलब है कि आप अधिक नैतिक हो रहे हैं।
  • सभी के लिए: हमें इन उपकरणों की जाँच करते रहना होगा। निष्पक्षता कोई एक बार का समाधान नहीं है; यह जाँचने और बार-बार जाँचने की एक निरंतर प्रक्रिया है, ठीक वैसे ही जैसे हम हर साल एक पुल की सुरक्षा की जाँच करते हैं।

संक्षेप में: यह पेपर हमें एक नया, लचीला पैमाना देता है जिससे हम माप सकें कि एआई कितना निष्पक्ष है। यह हमें बताता है कि एआई अभी भी पुराने रूढ़िबद्ध विचारों से भरा हुआ है, नए मॉडल स्वचालित रूप से बेहतर नहीं होते हैं, और हमें यह देखने के लिए कि वास्तविक तस्वीर क्या है, विभिन्न पहचानों के मेल को देखने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →