← नवीनतम पेपर
💬 NLP

SubData: Bridging Heterogeneous Datasets to Enable Theory-Driven Evaluation of Political and Demographic Perspectives in LLMs

यह शोध पत्र SubData प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन लाइब्रेरी और सिद्धांत-आधारित ढांचा है जिसे विषम डेटासेट को मानकीकृत करने के लिए डिज़ाइन किया गया है ताकि यह मूल्यांकन किया जा सके कि विभिन्न रूप से संरेखित लार्ज लैंग्वेज मॉडल्स विशिष्ट जनसांख्यिकी को लक्षित करने वाली सामग्री को कितनी भिन्नता से वर्गीकृत करते हैं, जिससे इस प्रकार विभिन्न अध्ययनों में परिप्रेक्ष्य संरेखण के आकलन में आने वाली विसंगतियों को दूर किया जा सके।

मूल लेखक: Pietro Bernardelle, Leon Fröhling, Stefano Civelli, Gianluca Demartini

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pietro Bernardelle, Leon Fröhling, Stefano Civelli, Gianluca Demartini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: अलग-अलग नियमपुस्तिकाओं की भरमार

कल्पना कीजिए कि आप यह आंकने की कोशिश कर रहे हैं कि अलग-अलग शेफ (लार्ज लैंग्वेज मॉडल्स, या LLMs) एक विशिष्ट व्यंजन बनाने में कितने कुशल हैं: घृणास्पद भाषण (hate speech) का पता लगाना

समस्या यह है कि हर शेफ को अलग सामग्री और अलग नियमपुस्तिका का उपयोग करके प्रशिक्षित किया गया है। एक शेफ किसी विशेष अपमान को "नफरत" कह सकता है, जबकि दूसरा उसे केवल "अशिष्टता" कह सकता है। कुछ शेफ अश्वेत लोगों को लक्षित करने वाले अपमान को देखते हैं, जबकि अन्य मुस्लिमों को लक्षित करने वाले अपमान को देखते हैं। क्योंकि हर कोई अलग परिभाषाओं और अलग सामग्रियों का उपयोग कर रहा है, इसलिए उनकी निष्पक्ष तुलना करना असंभव है। आप यह नहीं कह सकते कि शेफ A, शेफ B से बेहतर है यदि वे अलग-अलग नियमों के साथ खाना बना रहे हैं।

समाधान: SUBDATA (एक सार्वभौमिक अनुवादक)

लेखकों ने SUBDATA नामक एक टूल बनाया है। इसे घृणास्पद भाषण डेटा के लिए एक सार्वभौमिक अनुवादक और एक मास्टर रेसिपी बुक के रूप में समझें।

  • यह क्या करता है: यह दस अलग-अलग स्रोतों (जैसे अलग-अलग कैटलॉगिंग सिस्टम वाली विभिन्न लाइब्रेरी) से आए अव्यवस्थित और असंगत डेटा को लेता है और उन सभी को एक ही भाषा बोलने के लिए मजबूर करता है।
  • यह कैसे काम करता है: यदि एक डेटासेट एक समूह को "यहूदी लोगों" कहता है और दूसरा उन्हें "यहूदी" कहता है, तो SUBDATA दोनों को एक ही लेबल jews पर मैप करता है। यदि एक डेटासेट "मेक्सिकन" को "नस्ल" के तहत रखता है और दूसरा "उत्पत्ति" के तहत, तो यह टूल इसे मानकीकृत (standardize) कर देता है ताकि शोधकर्ता सेब की तुलना सेब से (समान चीज़ों की तुलना) कर सकें।
  • परिणाम: दस अलग-अलग, भ्रमित करने वाले डेटा ढेरों के बजाय, अब शोधकर्ताओं के पास एक साफ, व्यवस्थित ढेर है जहाँ हर अपमान को लगातार टैग किया गया है।

प्रयोग: "राजनीतिक व्यक्तित्व" का परीक्षण

एक बार जब उनके पास यह साफ डेटा आ गया, तो लेखकों ने एक विशिष्ट विचार का परीक्षण करना चाहा: क्या LLMs अपने "राजनीतिक व्यक्तित्व" के आधार पर अपना निर्णय बदलते हैं?

कल्पना कीजिए कि आप एक रोबोट से एक अशिष्ट टिप्पणी के बारे में निर्णय लेने को कहते हैं।

  • परिदृश्य A: आप रोबोट को कहते हैं, "एक डेमोक्रेट (Democrat) की तरह व्यवहार करो।"
  • परिदृश्य B: आप उसी रोबोट को कहते हैं, "एक रिपब्लिकन (Republican) की तरह व्यवहार करो।"

लेखक यह देखना चाहते थे कि क्या रोबोट का "राजनीतिक व्यक्तित्व" विभिन्न समूहों (जैसे अश्वेत लोगों, महिलाओं या धार्मिक समूहों) को लक्षित करने वाले अपमान के प्रति उसके कठोर होने के तरीके को बदल देता है।

सिद्धांत बनाम वास्तविकता

सिद्धांत (परिकल्पना):
शोधकर्ताओं ने एक सामान्य विश्वास के साथ शुरुआत की: डेमोक्रेट आमतौर पर अल्पसंख्यक समूहों के प्रति अधिक सुरक्षात्मक होते हैं। इसलिए, उन्होंने परिकल्पना की कि एक "डेमोक्रेट-संरेखित" (Democrat-aligned) रोबोट, एक "रिपब्लिकन-संरेखित" रोबोट की तुलना में अल्पसंख्यकों के खिलाफ अधिक घृणास्पद सामग्री को चिह्नित करेगा।

प्रयोग:
उन्होंने तीन अलग-अलग AI मॉडल लिए और उन्हें "पर्सोना" (विशिष्ट राजनीतिक प्रकारों की तरह कार्य करने के निर्देश) दिए। फिर उन्होंने इन रोबोटों से उस मानकीकृत घृणास्पद भाषण डेटा को देखा और निर्णय लिया: "क्या यह घृणास्पद भाषण है?"

निष्कर्ष (परिणाम):

  1. "वामपंथी" हमेशा अधिक सख्त होते हैं: सभी मामलों में, "वामपंथी-झुकाव" वाले रोबट, "दक्षिणपंथी-झुकाव" वाले रोबोट की तुलना में सामग्री को घृणास्पद के रूप में चिह्नित करने की बहुत अधिक संभावना रखते थे।
  2. यह केवल अल्पसंख्यकों के बारे में नहीं है: दिलचस्प बात यह है कि "वामपंथी-झुकाव" वाले रोबोट केवल अल्पसंख्यकों के बारे में ही सख्त नहीं थे; वे श्वेत लोगों और पुरुषों सहित सभी के बारे में सख्त थे।
  3. "कठोरता का प्रभाव" (The Tightening Effect): लेखक सुझाव देते हैं कि इसका मतलब यह नहीं है कि वामपंथी चुनिंदा रूप से विशिष्ट समूहों की रक्षा कर रहे हैं। इसके बजाय, ऐसा लगता है कि "वामपंथी" व्यक्तित्व सामान्य रूप से "घृणा" के लिए मानक को ही कम कर देता है। यह एक सुरक्षा गार्ड की तरह है जो केवल विशिष्ट समूहों को रोकने के बजाय, दरवाजे पर हर किसी को रोकने का निर्णय लेता है।
  4. अलग-अलग रोबोट, अलग प्रतिक्रियाएं: कुछ AI मॉडल (जैसे Mistral) दिए गए पर्सोना के आधार पर अपने व्यवहार को बहुत बदल देते हैं। अन्य (जैसे Llama) अधिक जिद्दी थे और उन्होंने अपना निर्णय उतना नहीं बदला।

यह क्यों मायने रखता है

यह शोध पत्र एक नया AI बनाने के बारे में नहीं है जो घृणास्पद भाषण का पता लगा सके। इसके बजाय, यह यह मापने के लिए एक बेहतर पैमाना (रूलर) बनाने के बारे में है कि AI कैसे व्यवहार करता है।

  • पहले: शोधकर्ता रबर के बने पैमाने (असंगत डेटा) से AI के पूर्वाग्रह को मापने की कोशिश कर रहे थे।
  • अब: उनके पास स्टील का पैमाना (SUBDATA) है।

यह वैज्ञानिकों को अनुमान लगाने के बजाय नियंत्रित प्रयोग चलाने और यह देखने की अनुमति देता है कि राजनीतिक विचार AI के निर्णयों को वास्तव में कैसे प्रभावित करते हैं। लेखक आशा करते हैं कि यह टूल समुदाय को यह समझने में मदद करेगा कि AI मॉडल मानवीय दृष्टिकोण को कैसे दर्शाते हैं, बिना इस बात पर सहमत हुए कि क्या "अपमानजनक" है।

नैतिकता पर एक नोट

लेखक बहुत सावधानी से उल्लेख करते हैं कि उनके टूल में अपमानजनक सामग्री शामिल है। वे इस बात पर जोर देते हैं कि यह लाइब्रेरी अनुसंधान और समझ के लिए है, न कि नए घृणास्पद AI को प्रशिक्षित करने के लिए। वे अपने कार्य को इन मॉडलों के काम करने के तरीके पर रोशनी डालने के एक तरीके के रूप में देखते हैं ताकि हम उन्हें सुरक्षित और निष्पक्ष बना सकें, न कि लोगों को चोट पहुँचाने के नए तरीके बनाने के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →