Political Neutrality as Balanced Approval: A Large-Scale Human Evaluation of AI Responses
यह शोध पत्र विरोधी राजनीतिक समूहों के बीच अनुमोदन को अधिकतम करने और संतुलित करने के आधार पर एआई (AI) राजनीतिक तटस्थता की एक नई परिभाषा प्रस्तुत करता है, 7,000 से अधिक प्रतिभागियों वाले एक बड़े पैमाने के मानव मूल्यांकन डेटासेट (PARETO) के माध्यम से इसे मान्य करता है, और यह प्रकट करता है कि हालांकि फ्रंटियर मॉडल उच्च क्रॉस-पार्टिसन अनुमोदन प्राप्त कर सकते हैं, उनके डिफ़ॉल्ट उत्तर अक्सर उदारवादी झुकाव प्रदर्शित करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक डिनर पार्टी होस्ट कर रहे हैं जहाँ दो मेहमान, जिन्हें हम "लेफ्टी" (Lefty) और "राइटी" (Righty) कह सकते हैं, गर्भपात या बंदूक नियंत्रण जैसे किसी विषय पर तीखी बहस कर रहे हैं। वे एक-दूसरे के ऊपर चिल्ला रहे हैं, और उनमें से कोई भी इस बात पर सहमत नहीं हो पा रहा है कि "सत्य" क्या है।
अब, कल्पना कीजिए कि आपने इन दोनों को परोसने के लिए एक स्मार्ट रोबोट वेटर (AI) को काम पर रखा है। आपका लक्ष्य किसी एक का पक्ष लेना या यह बताना नहीं है कि कौन सही है। आपका लक्ष्य एक ऐसा व्यंजन परोसना है जिसे लेफ्टी और राइटी दोनों ही स्वादिष्ट मानकर सहमत हो सकें, भले ही वे रेसिपी (विधि) पर अभी भी असहमत हों।
यह शोध पत्र उस स्मार्ट रोबोट वेटर को ठीक यही करने के लिए सिखाने के बारे में है।
बड़ी समस्या: "इनकार" का जाल (The "Refusal" Trap)
पहले, जब लोग इन रोबोटों से विवादास्पद सवाल पूछते थे, तो रोबोट अक्सर दो में से एक काम करते थे:
- वे एक पक्ष चुन लेते थे: वे लेफ्टी या राइटी की तरह व्यवहार करते थे, जिससे दूसरा व्यक्ति नाराज हो जाता था।
- वे उत्तर देने से मना कर देते थे: वे कहते थे, "मैं इस बारे में बात नहीं कर सकता," जिससे सभी को लगा कि उन्हें अनदेखा किया गया है।
शोधकर्ता जानना चाहते थे: क्या हम एक ऐसा AI बना सकते हैं जो इन कठिन सवालों के जवाब इस तरह दे कि दोनों पक्ष यह कह सकें, "ठीक है, मैं इस जवाब के साथ रह सकता हूँ"?
नया नुस्खा: "संतुलित अनुमोदन" (Balanced Approval)
लेखकों ने "तटस्थता" (neutrality) की एक नई परिभाषा दी। वे इसे "बैलेंस्ड अप्रूवल" (Balanced Approval) कहते हैं।
एक रस्सी पर चलने वाले (tightrope walker) के बारे में सोचिए।
- रस्सी: यह अधिकतम संभव खुशी की रेखा है।
- लक्ष्य: AI को उस रस्सी पर खड़ा होना चाहिए जहाँ लेफ्टी खुश हो और राइटी भी खुश हो।
- चुनौती: यदि AI बहुत अधिक बाईं ओर झुकता है, तो राइटी नाराज हो जाता है। यदि वह बहुत अधिक दाईं ओर झुकता है, तो लेफ्टी नाराज हो जाता है। "परफेक्ट" न्यूट्रल जवाब रस्सी का वह सटीक स्थान है जहाँ दोनों पक्ष समान रूप से संतुष्ट होते हैं।
शोधकर्ता इसे "पारेटो फ्रंटियर" (Pareto Frontier) कहते हैं। सरल भाषा में, यह "सबसे अच्छी डील" है जहाँ आप एक पक्ष को खुश करने के लिए दूसरे पक्ष को दुखी किए बिना बेहतर नहीं कर सकते।
प्रयोग: एक बड़ा स्वाद परीक्षण (A Massive Taste Test)
इसका परीक्षण करने के लिए, शोधकर्ताओं ने केवल रोबोट से अनुमान लगाने के लिए नहीं कहा। उन्होंने एक बड़ा स्वाद परीक्षण आयोजित किया:
- मेन्यू: उन्होंने 20 ज्वलंत विषयों (जैसे गर्भपात, बंदूक नियंत्रण और छात्र ऋण) को चुना।
- डाइनर्स (भोजन करने वाले): उन्होंने अमेरिका के 7,434 वास्तविक लोगों को शामिल किया।
- शेफ: उन्होंने 5 अलग-अलग शीर्ष-स्तरीय AI मॉडल (जैसे GPT, Claude और Gemini) का उपयोग किया।
- व्यंजन: हर सवाल के लिए, उन्होंने चार प्रकार के उत्तर बनाए:
- डिफ़ॉल्ट (Default): जो AI स्वाभाविक रूप से कहता है।
- "पक्ष में" वाला व्यंजन (The "For" Dish): एक उत्तर जो केवल एक पक्ष का तर्क देता है।
- "विपक्ष में" वाला व्यंजन (The "Against" Dish): एक उत्तर जो केवल दूसरे पक्ष का तर्क देता है।
- "संतुलित" व्यंजन (The "Balanced" Dish): एक विशेष उत्तर जो दोनों पक्षों के लिए एक छोटा पैराग्राफ देता है, और फिर उसे तटस्थ रूप से समाप्त करता है।
फिर उन्होंने डाइनर्स से पूछा: "आप इस उत्तर को कितना पसंद करते हैं?"
उन्हें क्या पता चला: आश्चर्यजनक परिणाम
1. "संतुलित व्यंजन" भीड़ का पसंदीदा था।
भले ही लेफ्टी और राइटी एक-दूसरे के विचारों से नफरत करते थे, लेकिन दोनों संतुलित उत्तर को पसंद करते थे।
- जादुई संख्या: संतुलित उत्तर को लगभग हर विषय पर दोनों पक्षों से उच्च अनुमोदन स्कोर (60% से ऊपर) मिला।
- समझौता (Trade-off): आप सोच सकते हैं, "यदि मैं चाहता हूँ कि मेरा पक्ष जीते, तो मैं संतुलित उत्तर से नफरत करूँगा।" लेकिन अध्ययन में पाया गया कि जब लोग "मेरा पक्ष जीतता है" वाले उत्तर से "संतुलित" उत्तर पर स्विच करते हैं, तो वे अपने अनुमोदन का केवल 10% ही खोते हैं। यह एक ऐसा AI बनाने के लिए एक छोटी कीमत है जो दूसरे पक्ष को चिल्लाने पर मजबूर न करे।
2. अधिकांश रोबोट गुप्त रूप से "लेफ्टी" हैं।
जब शोधकर्ताओं ने देखा कि रोबोट स्वाभाविक रूप से (बिना किसी विशेष निर्देश के) क्या कहते हैं, तो उनमें से अधिकांश (GPT, Claude, Gemini, Llama) उदारवादी/वामपंथी (liberal/left) पक्ष की ओर झुके हुए थे। उन्हें राइटी की तुलना में लेफ्टी से अधिक अनुमोदन मिला।
- अपवाद: एक रोबोट, ग्रोक (Grok), अलग था। वह बाईं ओर नहीं झुका; वह विषय के आधार पर कभी दाईं ओर, तो कभी बाईं ओर झुका।
3. गुस्से वाले सवाल पूछना कठिन है।
जब उपयोगकर्ताओं ने रोबोट से ऐसे सवाल पूछे जो पहले से ही गुस्से वाले या आवेशित थे (जैसे, "लिबरल्स इतने मूर्ख क्यों हैं?"), तो रोबोटों को कम अनुमोदन स्कोर मिले। जब सवाल खुद एक लड़ाई हो, तो तटस्थ रहना बहुत कठिन होता है।
4. "दोनों पक्षों" का मिथक।
कुछ लोगों को डर है कि "दोनों पक्ष" दिखाना नकली या कमजोर है। लेकिन अध्ययन ने दिखाया कि जब AI ने दोनों पक्षों के लिए मजबूत तर्क प्रस्तुत किए, तो लोगों को वास्तव में यह अधिक निष्पक्ष लगा। एकमात्र समय जब लोगों ने संतुलित उत्तर को नापसंद किया, जब उन्हें लगा कि AI "दिखावा" कर रहा है या उनकी विशिष्ट चिंताओं को अनदेखा कर रहा है।
निचोड़ (The Bottom Line)
यह शोध पत्र यह साबित करता है कि एक निष्पक्ष मध्यस्थ की तरह कार्य करने वाला AI बनाना संभव है। इसे ऐसा रोबोट होने की आवश्यकता नहीं है जो बोलने से मना कर दे, और न ही इसे ऐसा रोबोट होने की आवश्यकता है जो एक टीम चुन ले।
"बैलेंटेड अप्रूवल" (Balanced Approval) को लक्षित करके—उस उत्तर को खोजने के माध्यम से जो विरोधी पक्षों के अधिक से अधिक लोगों को सुना हुआ और सम्मानित महसूस कराता है—हम ऐसा AI बना सकते हैं जिस पर लोग भरोसा कर सकें, भले ही वे एक-दूसरे से असहमत हों। यह एक ऐसे रोबोट वेटर की तरह है जो पूरे परिवार को संतुष्ट करने वाला भोजन परोसने में सफल होता है, भले ही वे इस बात पर सहमत न हो सकें कि अगली चीज़ क्या ऑर्डर करनी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।