SubData: Bridging Heterogeneous Datasets to Enable Theory-Driven Evaluation of Political and Demographic Perspectives in LLMs
यह शोध पत्र SubData प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन लाइब्रेरी और सिद्धांत-आधारित ढांचा है जिसे विषम डेटासेट को मानकीकृत करने के लिए डिज़ाइन किया गया है ताकि यह मूल्यांकन किया जा सके कि विभिन्न रूप से संरेखित लार्ज लैंग्वेज मॉडल्स विशिष्ट जनसांख्यिकी को लक्षित करने वाली सामग्री को कितनी भिन्नता से वर्गीकृत करते हैं, जिससे इस प्रकार विभिन्न अध्ययनों में परिप्रेक्ष्य संरेखण के आकलन में आने वाली विसंगतियों को दूर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
बड़ी समस्या: अलग-अलग नियमपुस्तिकाओं की भरमार
कल्पना कीजिए कि आप यह आंकने की कोशिश कर रहे हैं कि अलग-अलग शेफ (लार्ज लैंग्वेज मॉडल्स, या LLMs) एक विशिष्ट व्यंजन बनाने में कितने कुशल हैं: घृणास्पद भाषण (hate speech) का पता लगाना।
समस्या यह है कि हर शेफ को अलग सामग्री और अलग नियमपुस्तिका का उपयोग करके प्रशिक्षित किया गया है। एक शेफ किसी विशेष अपमान को "नफरत" कह सकता है, जबकि दूसरा उसे केवल "अशिष्टता" कह सकता है। कुछ शेफ अश्वेत लोगों को लक्षित करने वाले अपमान को देखते हैं, जबकि अन्य मुस्लिमों को लक्षित करने वाले अपमान को देखते हैं। क्योंकि हर कोई अलग परिभाषाओं और अलग सामग्रियों का उपयोग कर रहा है, इसलिए उनकी निष्पक्ष तुलना करना असंभव है। आप यह नहीं कह सकते कि शेफ A, शेफ B से बेहतर है यदि वे अलग-अलग नियमों के साथ खाना बना रहे हैं।
समाधान: SUBDATA (एक सार्वभौमिक अनुवादक)
लेखकों ने SUBDATA नामक एक टूल बनाया है। इसे घृणास्पद भाषण डेटा के लिए एक सार्वभौमिक अनुवादक और एक मास्टर रेसिपी बुक के रूप में समझें।
- यह क्या करता है: यह दस अलग-अलग स्रोतों (जैसे अलग-अलग कैटलॉगिंग सिस्टम वाली विभिन्न लाइब्रेरी) से आए अव्यवस्थित और असंगत डेटा को लेता है और उन सभी को एक ही भाषा बोलने के लिए मजबूर करता है।
- यह कैसे काम करता है: यदि एक डेटासेट एक समूह को "यहूदी लोगों" कहता है और दूसरा उन्हें "यहूदी" कहता है, तो SUBDATA दोनों को एक ही लेबल
jewsपर मैप करता है। यदि एक डेटासेट "मेक्सिकन" को "नस्ल" के तहत रखता है और दूसरा "उत्पत्ति" के तहत, तो यह टूल इसे मानकीकृत (standardize) कर देता है ताकि शोधकर्ता सेब की तुलना सेब से (समान चीज़ों की तुलना) कर सकें। - परिणाम: दस अलग-अलग, भ्रमित करने वाले डेटा ढेरों के बजाय, अब शोधकर्ताओं के पास एक साफ, व्यवस्थित ढेर है जहाँ हर अपमान को लगातार टैग किया गया है।
प्रयोग: "राजनीतिक व्यक्तित्व" का परीक्षण
एक बार जब उनके पास यह साफ डेटा आ गया, तो लेखकों ने एक विशिष्ट विचार का परीक्षण करना चाहा: क्या LLMs अपने "राजनीतिक व्यक्तित्व" के आधार पर अपना निर्णय बदलते हैं?
कल्पना कीजिए कि आप एक रोबोट से एक अशिष्ट टिप्पणी के बारे में निर्णय लेने को कहते हैं।
- परिदृश्य A: आप रोबोट को कहते हैं, "एक डेमोक्रेट (Democrat) की तरह व्यवहार करो।"
- परिदृश्य B: आप उसी रोबोट को कहते हैं, "एक रिपब्लिकन (Republican) की तरह व्यवहार करो।"
लेखक यह देखना चाहते थे कि क्या रोबोट का "राजनीतिक व्यक्तित्व" विभिन्न समूहों (जैसे अश्वेत लोगों, महिलाओं या धार्मिक समूहों) को लक्षित करने वाले अपमान के प्रति उसके कठोर होने के तरीके को बदल देता है।
सिद्धांत बनाम वास्तविकता
सिद्धांत (परिकल्पना):
शोधकर्ताओं ने एक सामान्य विश्वास के साथ शुरुआत की: डेमोक्रेट आमतौर पर अल्पसंख्यक समूहों के प्रति अधिक सुरक्षात्मक होते हैं। इसलिए, उन्होंने परिकल्पना की कि एक "डेमोक्रेट-संरेखित" (Democrat-aligned) रोबोट, एक "रिपब्लिकन-संरेखित" रोबोट की तुलना में अल्पसंख्यकों के खिलाफ अधिक घृणास्पद सामग्री को चिह्नित करेगा।
प्रयोग:
उन्होंने तीन अलग-अलग AI मॉडल लिए और उन्हें "पर्सोना" (विशिष्ट राजनीतिक प्रकारों की तरह कार्य करने के निर्देश) दिए। फिर उन्होंने इन रोबोटों से उस मानकीकृत घृणास्पद भाषण डेटा को देखा और निर्णय लिया: "क्या यह घृणास्पद भाषण है?"
निष्कर्ष (परिणाम):
- "वामपंथी" हमेशा अधिक सख्त होते हैं: सभी मामलों में, "वामपंथी-झुकाव" वाले रोबट, "दक्षिणपंथी-झुकाव" वाले रोबोट की तुलना में सामग्री को घृणास्पद के रूप में चिह्नित करने की बहुत अधिक संभावना रखते थे।
- यह केवल अल्पसंख्यकों के बारे में नहीं है: दिलचस्प बात यह है कि "वामपंथी-झुकाव" वाले रोबोट केवल अल्पसंख्यकों के बारे में ही सख्त नहीं थे; वे श्वेत लोगों और पुरुषों सहित सभी के बारे में सख्त थे।
- "कठोरता का प्रभाव" (The Tightening Effect): लेखक सुझाव देते हैं कि इसका मतलब यह नहीं है कि वामपंथी चुनिंदा रूप से विशिष्ट समूहों की रक्षा कर रहे हैं। इसके बजाय, ऐसा लगता है कि "वामपंथी" व्यक्तित्व सामान्य रूप से "घृणा" के लिए मानक को ही कम कर देता है। यह एक सुरक्षा गार्ड की तरह है जो केवल विशिष्ट समूहों को रोकने के बजाय, दरवाजे पर हर किसी को रोकने का निर्णय लेता है।
- अलग-अलग रोबोट, अलग प्रतिक्रियाएं: कुछ AI मॉडल (जैसे Mistral) दिए गए पर्सोना के आधार पर अपने व्यवहार को बहुत बदल देते हैं। अन्य (जैसे Llama) अधिक जिद्दी थे और उन्होंने अपना निर्णय उतना नहीं बदला।
यह क्यों मायने रखता है
यह शोध पत्र एक नया AI बनाने के बारे में नहीं है जो घृणास्पद भाषण का पता लगा सके। इसके बजाय, यह यह मापने के लिए एक बेहतर पैमाना (रूलर) बनाने के बारे में है कि AI कैसे व्यवहार करता है।
- पहले: शोधकर्ता रबर के बने पैमाने (असंगत डेटा) से AI के पूर्वाग्रह को मापने की कोशिश कर रहे थे।
- अब: उनके पास स्टील का पैमाना (SUBDATA) है।
यह वैज्ञानिकों को अनुमान लगाने के बजाय नियंत्रित प्रयोग चलाने और यह देखने की अनुमति देता है कि राजनीतिक विचार AI के निर्णयों को वास्तव में कैसे प्रभावित करते हैं। लेखक आशा करते हैं कि यह टूल समुदाय को यह समझने में मदद करेगा कि AI मॉडल मानवीय दृष्टिकोण को कैसे दर्शाते हैं, बिना इस बात पर सहमत हुए कि क्या "अपमानजनक" है।
नैतिकता पर एक नोट
लेखक बहुत सावधानी से उल्लेख करते हैं कि उनके टूल में अपमानजनक सामग्री शामिल है। वे इस बात पर जोर देते हैं कि यह लाइब्रेरी अनुसंधान और समझ के लिए है, न कि नए घृणास्पद AI को प्रशिक्षित करने के लिए। वे अपने कार्य को इन मॉडलों के काम करने के तरीके पर रोशनी डालने के एक तरीके के रूप में देखते हैं ताकि हम उन्हें सुरक्षित और निष्पक्ष बना सकें, न कि लोगों को चोट पहुँचाने के नए तरीके बनाने के लिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।