What Is The Political Content in LLMs' Pre- and Post-Training Data?
यह शोध पत्र एलएलएम (LLM) प्रशिक्षण डेटा में राजनीतिक सामग्री की जांच करता है और पाता है कि प्री-ट्रेनिंग कॉर्पोरा व्यवस्थित रूप से वामपंथी दृष्टिकोणों की ओर झुके हुए हैं, जिसमें ये पूर्वाग्रह पोस्ट-ट्रेनिंग चरणों के माध्यम से बने रहते हैं और मॉडल के परिणामी राजनीतिक रुख के साथ दृढ़ता से सह-संबंधित होते हैं, जिससे मॉडल के व्यवहार को आकार देने में डेटा संरचना की महत्वपूर्ण भूमिका उजागर होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नया सहायक काम पर रख रहे हैं जो ईमेल लिखने, सवालों के जवाब देने और सलाह देने में आपकी मदद करेगा। आप उन्हें सिर्फ एक खाली नोटबुक नहीं थमा देते; बल्कि आप उन्हें पढ़ने के लिए किताबें, लेख और ब्लॉग पोस्टों का एक विशाल पुस्तकालय देते हैं। वे बोलना और सोचना सीखने के लिए इंटरनेट के टेराबाइट्स डेटा को "पढ़ते" हैं। यह बिल्कुल वैसा ही है जैसे चैटबॉट्स को चलाने वाले लार्ज लैंग्वेज मॉडल्स (LLMs) बनाए जाते हैं।
यह शोध पत्र एक सरल लेकिन महत्वपूर्ण प्रश्न पूछता है: हमने इन एआई सहायकों को किस तरह का पुस्तकालय दिया, और क्या वह पुस्तकालय उन्हें पक्षपाती बनाता है?
यहाँ उनके निष्कर्षों का विवरण दिया गया है, जिसे रोजमर्रा के उदाहरणों के साथ समझाया गया है।
1. "वामपंथी" पुस्तकालय (The "Left-Leaning" Library)
शोधकर्ताओं ने तीन अलग-अलग प्रसिद्ध एआई मॉडलों (OLMo, Falcon, और Pythia) को प्रशिक्षित करने के लिए उपयोग किए गए "पुस्तकों" (डेटा) का अध्ययन किया। वे जानना चाहते थे: क्या पुस्तकालय संतुलित है, या यह एक तरफ झुका हुआ है?
- निष्कर्ष: पुस्तकालय भारी रूप से वामपंथी (left-leaning) दृष्टिकोणों की ओर झुका हुआ है।
- उदाहरण: कल्पना कीजिए कि आप समाचार पत्रों का एक ढेर पढ़कर राजनीति के बारे में सीखने की कोशिश कर रहे हैं। यदि 80% अखबार The Guardian या HuffPost (वामपंथी) से हैं और केवल 10% National Review या The Telegraph (दक्षिणपंथी) से हैं, तो आप दुनिया का एक बहुत ही विशिष्ट संस्करण सीखेंगे।
- आंकड़े: उनके द्वारा विश्लेषण किए गए डेटा में, दक्षिणपंथी दस्तावेजों की तुलना में 2.3 से 12 गुना अधिक वामपंथी दस्तावेज़ थे। यह एक ऐसी डाइट की तरह है जहाँ आप केवल एक ही स्वाद की आइसक्रीम खाते हैं; अंततः, आप सोचने लगते हैं कि यही एकमात्र स्वाद मौजूद है।
2. किताबें कहाँ से आती हैं? (स्रोत)
शोधकर्ताओं ने यह भी देखा कि ये दस्तावेज़ कहाँ से आए थे।
- निष्कर्ष: वामपंथी टेक्स्ट मुख्य रूप से स्थापित समाचार संस्थानों (जैसे The New York Times या The Washington Post) से आए थे। दक्षिणपंथी टेक्स्ट मुख्य रूप से ब्लॉग, व्यक्तिगत वेबसाइटों और हाशिए के समुदायों (जैसे Townhall या FreeRepublic) से आए थे।
- उदाहरण: वामपंथी डेटा को पेशेवर पत्रकारों द्वारा आयोजित एक औपचारिक रात्रिभोज (formal dinner party) के रूप में सोचें। दक्षिणपंथी डेटा एक शोर-शराबे वाले बैकयार्ड बीबीक्यू (backyard BBQ) की तरह है जहाँ उत्साही लोग अपनी राय चिल्ला रहे हैं। एआई ने दोनों को "खाया", लेकिन औपचारिक रात्रिभोज ने बहुत अधिक भोजन प्रदान किया।
3. "इको चैंबर" का प्रभाव (The "Echo Chamber" Effect)
एक बड़ा सवाल यह था: यदि हम अलग-अलग एआई मॉडलों के लिए अलग-अलग पुस्तकालयों का उपयोग करते हैं, तो क्या उनके पास अलग-अलग पूर्वाग्रह होंगे?
- निष्कर्ष: आश्चर्यजनक रूप से, नहीं। भले ही शोधकर्ताओं ने अलग-अलग मॉडलों के लिए अलग-अलग डेटा स्रोतों और अलग-अलग फ़िल्टरिंग विधियों का उपयोग किया, लेकिन राजनीतिक पूर्वाग्रह लगभग एक जैसा ही था।
- उदाहरण: कल्पना कीजिए कि तीन अलग-अलग शेफ (अलग-अलग एआई मॉडल) सूप बनाने के लिए तीन अलग-अलग रेसिपी (अलग-अलग डेटासेट) का उपयोग कर रहे हैं। आप उम्मीद करेंगे कि उनका स्वाद अलग होगा। लेकिन इसके बजाय, उन सभी का स्वाद बिल्कुल एक जैसा था क्योंकि उन सभी ने एक ही मुख्य सामग्री का उपयोग किया था: इंटरनेट का एक विशाल, अनफ़िल्टर्ड ढेर जो स्वाभाविक रूप से वामपंथी है। "फ़िल्टरिंग" ने स्वाद को ज्यादा नहीं बदला।
4. "पहला निवाला" बनाम "मिठाई" (The "First Bite" vs. The "Dessert")
एआई प्रशिक्षण चरणों में होता है:
- प्री-ट्रेनिंग (Pre-training): मॉडल विशाल पुस्तकालय को पढ़ता है (मुख्य व्यंजन)।
- पोस्ट-ट्रेनिंग (Post-training): मनुष्य मॉडल को अधिक मददगार और विनम्र बनाने के लिए उसे तराशते हैं (मिठाई)।
- निष्कर्ष: राजनीतिक पूर्वाग्रह मुख्य व्यंजन (प्री-ट्रेनिंग) में रचा-बसा है। जब तक मनुष्य मॉडल को "मिठाई" (पोस्ट-ट्रेनिंग) के साथ ट्यून करने की कोशिश करते हैं, तब तक पूर्वाग्रह पहले से ही वहां मौजूद होता है। मिठाई ने स्वाद नहीं बदला; इसने केवल एआई को अपने मौजूदा विचारों के बारे में अधिक विनम्रता से बोलना सिखाया।
- उदाहरण: यदि आप एक बच्चे को 2 साल की उम्र में सिखाते हैं कि "आसमान हरा है" (प्री-ट्रेनिंग), और फिर 10 साल की उम्र में आप उसे "विनम्र और मददगार" होने के लिए कहते हैं (पोस्ट-ट्रेनिंग), तो वह अभी भी सोचेगा कि आसमान हरा है। वह बस इसके बारे में बहुत विनम्र होगा। पूर्वाग्रह जल्दी स्थापित हो गया और जम गया।
5. संबंध: डेटा = व्यवहार
अंत में, शोधकर्ताओं ने जांचा कि क्या एआई के वास्तविक उत्तर उसके द्वारा पढ़ी गई किताबों से मेल खाते हैं।
- निष्कर्ष: एक बहुत मजबूत मिलान (90% सहसंबंध) था। यदि प्रशिक्षण डेटा कहता था कि "जलवायु परिवर्तन तत्काल है," तो एआई कहता था "जलवायु परिवर्तन तत्काल है।" यदि डेटा कहता था कि "प्रवासन (Immigration) को प्रतिबंधित किया जाना चाहिए," तो एआई प्रतिबंधों के पक्ष में होने की अधिक संभावना रखता था (हालांकि डेटा मुख्य रूप रूप से प्रतिबंधों के विरुद्ध था, इसलिए एआई भी मुख्य रूप से उनके विरुद्ध था)।
- उदाहरण: एआई एक तोता है। उसकी अपनी कोई राय नहीं होती; वह बस उन पैटर्न को दोहराता है जो उसने सबसे अधिक बार सुने हैं। यदि कमरा वामपंथी विचारों को चिल्लाने वाले लोगों से भरा था, तो तोता वामपंथी सुनाई देगा।
मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हम केवल बाद में मॉडल को ट्यून करके एआई पूर्वाग्रह को ठीक नहीं कर सकते। पूर्वाग्रह सामग्री (ingredients) में है।
यदि हम चाहते हैं कि एआई वास्तव में संतुलित और निष्पक्ष हो, तो हमें एआई के पढ़ना शुरू करने से पहले पुस्तकालय को ठीक करना होगा। हमें यह सुनिश्चित करने की आवश्यकता है कि हम उसे जो "किताबें" खिला रहे हैं, वे वास्तविक विविध आवाजों का प्रतिनिधित्व करती हों, न कि केवल इंटरनेट पर सबसे तेज या सबसे आम आवाजों का।
संक्षेप में: एआई "बुरा" या "पक्षपाती" अपनी मर्जी से नहीं है। यह उस झुके हुए पुस्तकालय का प्रतिबिंब है जो हमने उसे दिया है। यदि पुस्तकालय असंतुलित है, तो प्रतिबिंब भी वैसा ही होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।