Fairness in LLM-Generated Surveys
यह अध्ययन प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स सर्वेक्षण सिमुलेशन में महत्वपूर्ण भौगोलिक और सामाजिक-जनसांख्यिकीय पूर्वाग्रह प्रदर्शित करते हैं, जो प्रशिक्षण सेट की सीमाओं के कारण अमेरिकी डेटा पर बेहतर प्रदर्शन करते हैं, जबकि अमेरिका और चिली दोनों में राजनीतिक, नस्लीय और सांस्कृतिक चरों के बीच स्पष्ट निष्पक्षता असमानताएं दिखाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुपर-लर्नड रोबोट है जिसने इंटरनेट पर लगभग सब कुछ पढ़ लिया है। आप उस रोबोट से एक व्यक्ति होने का नाटक करने और राजनीति के बारे में सर्वेक्षण के सवालों के जवाब देने के लिए कहते हैं, जैसे कि "आप किसे वोट देंगे?" या "क्या आप गर्भपात का समर्थन करते हैं?"
इस शोध पत्र के शोधकर्ताओं ने यह देखना चाहा कि क्या यह रोबट वास्तव में विभिन्न प्रकार के लोगों और विभिन्न स्थानों के लोगों की नकल करने में अच्छा है। उन्होंने रोबोट को एक "डिजिटल सर्वे टेकर" (डिजिटल सर्वेक्षणकर्ता) की तरह माना ताकि यह देखा जा सके कि क्या यह वास्तविक मानव सर्वेक्षणों की जगह ले सकता है।
यहाँ जो उन्होंने पाया, उसकी कहानी सरल रूप में दी गई है:
1. "अमेरिकी" रोबोट
रोबोट के मस्तिष्क को एक पुस्तकालय के रूप में सोचें। समस्या यह है कि यह पुस्तकालय ज्यादातर संयुक्त राज्य अमेरिका में लिखी गई किताबों से भरा हुआ है। इस कारण से, रोबोट यह अनुमान लगाने में सुपरस्टार है कि अमेरिकी कैसे सोचते हैं, लेकिन वह चिली के लोगों के मामले में एक संघर्ष करने वाला छात्र है।
- परीक्षण: उन्होंने रोबोट से अमेरिका और चिली दोनों में चुनाव परिणामों और गर्भपात पर राय का अनुमान लगाने के लिए कहा।
- परिणाम: रोबोट ने ज्यादातर समय अमेरिकी उत्तर सही दिए। जब उसने चिली के उत्तरों का अनुमान लगाने की कोशिश की, तो उसने अधिक गलतियाँ कीं। यह एक ऐसे शेफ की तरह है जो अमेरिकी बर्गर बनाने में तो माहिर है लेकिन पारंपरिक चिली एम्पानाडा (empanadas) बनाने में गलती करता रहता है क्योंकि उसने कभी स्थानीय सामग्रियों का स्वाद नहीं चखा है।
2. "समूह" बनाम "व्यक्तिगत" का कमाल
शोधकर्ताओं ने गौर किया कि रोबोट अपनी गलतियाँ कैसे करता है।
- भीड़: यदि आप रोबोट के उत्तरों को एक पूरे समूह के रूप में देखते हैं, तो वह "बड़ी तस्वीर" का अनुमान लगाने में वास्तव में अच्छा है। वह आपको बता सकता है कि "लगभग 40% लोग उम्मीदवार A को वोट देंगे।" यह एक मौसम पूर्वानुमानकर्ता की तरह है जो किसी मौसम के सामान्य जलवायु की भविष्यवाणी करने में बहुत अच्छा है।
- व्यक्ति: हालाँकि, यदि आप रोबोट से यह अनुमान लगाने के लिए पूछते हैं कि एक विशिष्ट व्यक्ति क्या करेगा, तो वह अक्सर गलत हो जाता है। वह एक व्यक्ति की अनूठी विशेषताओं (quirks) को समझने में संघर्ष करता है। वह भीड़ के लिए अच्छा है, लेकिन व्यक्ति के लिए बुरा है।
3. रोबोट को कौन गलत समझता है? (पूर्वाग्रह/Bias)
रोबोट केवल चिली के मामले में ही बुरा नहीं है; वह चिली के भीतर विशेष प्रकार के लोगों के लिए भी बुरा है। शोधकर्ताओं ने पाया कि रोबोट के पास कुछ समूहों के लिए एक "ब्लाइंड स्पॉट" (अंध बिंदु) है:
- चिली में: रोबोट को महिलाओं, बुजुर्गों, धार्मिक लोगों, और कम शिक्षा वाले लोगों के साथ सबसे अधिक संघर्ष करना पड़ा। यह ऐसा था जैसे रोबोट के पास एक फ़िल्टर था जिसने इन आवाजों को स्पष्ट रूप से "सुनने" में बाधा डाली।
- अमेरिका में: रोबोट लिंग और आयु के संबंध में निष्पक्ष था, लेकिन उसे कम आय वाले लोगों के साथ समस्या थी। दिलचस्प बात यह है कि अमेरिका में, रोबोट मजबूत राजनीतिक विचारों (बहुत वामपंथी या बहुत दक्षिणपंथी) वाले लोगों की राय का अनुमान लगाने में वास्तव में बेहतर था।
4. "मिक्स-एंड-मैच" की समस्या
शोधकर्ताओं ने देखा कि क्या होता है जब ये समूह आपस में मिलते हैं। इसे "इंटरसेक्शनैलिटी" (intersectionality) कहा जाता है।
- चिली में सबसे खराब स्थिति: रोबोट सबसे कम सटीक था जब वह कम शिक्षित, धार्मिक, बुजुर्ग महिलाओं की राय का अनुमान लगाने की कोशिश कर रहा था। यह ऐसा था जैसे रोबोट इस विशिष्ट संयोजन को समझने में पूरी तरह से खो गया हो।
- अमेरिका का मोड़: अमेरिका में, रोबोट वामपंथी महिलाओं की राय का अनुमान लगाने में वास्तव में बेहतर था, लेकिन वह गैर-श्वेत महिलाओं के साथ संघर्ष करता था।
5. क्या "पढ़ाई" से मदद मिली? (फाइन-ट्यूनिंग)
शोधकर्ताओं ने रोबोट को अतिरिक्त होमवर्क (जिसे "फाइन-ट्यूनिंग" कहा जाता है) देकर चिली में उसके खराब ग्रेड को ठीक करने की कोशिश की। उन्होंने उसे विशेष रूप से चिली के लोगों के बारे में अधिक डेटा दिया।
- परिणाम: इसने थोड़ी मदद की, लेकिन अंतर को पाटने के लिए पर्याप्त नहीं थी। रोबोट अभी भी अमेरिकी शैली की सोच को प्राथमिकता देता था। यह एक ऐसे छात्र को स्पेनिश फ्लैशकार्ड देने जैसा है जो केवल अंग्रेजी बोलता है; वे कुछ शब्द सीख सकते हैं, लेकिन वे कभी भी मूल निवासी की तरह नहीं बोलेंगे।
मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हालांकि ये AI रोबोट सामान्य रुझानों को समझने के लिए शक्तिशाली उपकरण हैं, लेकिन ये अभी तक वास्तविक मानव सर्वेक्षणों को बदलने के लिए पर्याप्त निष्पक्ष और सटीक नहीं हैं, विशेष रूप से उन देशों या समूहों के लिए जो उनके प्रशिक्षण डेटा में अच्छी तरह से प्रतिनिधित्व नहीं किए गए हैं।
यदि हम इन रोबोटों का उपयोग समाज के बारे में निर्णय लेने के लिए करते हैं, तो हम महिलाओं, बुजुर्गों, गरीबों और गैर-अमेरिकी संस्कृतियों की आवाजों को अनदेखा करने का जोखिम उठाते हैं। इसे ठीक करने के लिए, हमें रोबोट को केवल अमेरिका के बारे में ही नहीं, बल्कि पूरी दुनिया के बारे में अधिक सिखाने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।