Moral Susceptibility and Robustness under Persona Role-Play in Large Language Models
यह शोध पत्र 'मोरल फाउंडेशन्स क्वेश्चननेयर' का उपयोग करके पर्सोना रोल-प्ले के तहत लार्ज लैंग्वेज मॉडल्स में नैतिक संवेदनशीलता और सुदृढ़ता को मापने के लिए एक बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि मॉडल परिवार मुख्य रूप से सुदृढ़ता निर्धारित करता है (जिसमें क्लॉड सबसे अधिक सुदृढ़ है) जबकि मॉडल का आकार संवेदनशीलता को प्रेरित करता है, और ये दोनों गुण सकारात्मक रूप से सह-संबंधित हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास बहुत बुद्धिमान, डिजिटल "अभिनेताओं" का एक समूह है (ये लार्ज लैंग्वेज मॉडल्स या LLMs हैं)। आमतौर पर, ये अभिनेता मददगार, विनम्र और तटस्थ होने की कोशिश करते हैं। लेकिन क्या होता है यदि आप उन्हें कहें, "ठीक है, आज तुम एक सहायक नहीं हो। आज, तुम एक चिड़चिड़े बूढ़े समुद्री डाकू (pirate) हो," या "आज, तुम एक सख्त स्कूल प्रिंसिपल हो"?
यह शोध पत्र एक सरल लेकिन गहरा प्रश्न पूछता है: जब एक AI अलग वेशभूषा धारण करता है, तो उसकी "सही और गलत" की समझ कितनी बदल जाती है?
इस उत्तर को खोजने के लिए, शोधकर्ताओं ने एक प्रसिद्ध मनोविज्ञान उपकरण, मोरल फाउंडेशन प्रश्नावली (MFQ) का उपयोग करके एक "नैतिक उपयुक्तता परीक्षण" (Moral Suitability Test) बनाया। सोचिए कि MFQ पांच मुख्य मूल्यों के बारे में एक व्यक्तित्व परीक्षण है:
- देखभाल/हानि (Care/Harm): क्या आप दूसरों को चोट पहुँचाने की परवाह करते हैं?
- निष्पक्षता (Fairness): क्या आप समान व्यवहार में विश्वास करते हैं?
- निष्ठा (Loyalty): क्या आप अपनी "टीम" के प्रति वफादार रहते हैं?
- अधिकार (Authority): क्या आप नियमों और नेताओं का सम्मान करते हैं?
- शुद्धता (Purity): क्या आप स्वच्छता या पवित्रता की परवाह करते हैं?
शोधकर्ताओं ने 15 अलग-अलग AI मॉडलों (जैसे Claude, Gemini, GPT-4, और Grok) का परीक्षण किया, उन्हें एक चरित्र (जैसे "निराश फैक्ट्री वर्कर" से लेकर "धार्मिक परिवार के सदस्य" तक) बनने को कहकर।
यहाँ दो मुख्य चीजें हैं जिन्हें मापा गया है, जिन्हें सरल उपमाओं के माध्यम से समझाया गया है:
1. नैतिक सुदृढ़ता (Moral Robustness): "स्थिर हाथ" का परीक्षण
यह क्या है: यदि आप एक ही चरित्र निभाते हुए एक ही AI से 10 बार एक ही नैतिक प्रश्न पूछते हैं, तो क्या वह हर बार एक ही उत्तर देता है?
- उच्च सुदृढ़ता (High Robustness): AI एक लाइटहाउस (प्रकाश स्तंभ) की तरह है। लहरें (रैंडम कंप्यूटर शोर) कितनी भी क्यों न टकराएं, रोशनी स्थिर रहती है। वह जानता है कि "कैप्टन जैक स्पैरो" चोरी के बारे में क्या मानता है, और वह उस विश्वास पर अडिग रहता है।
- कम सुदृढ़ता (Low Robustness): AI तूफान में एक विंड वेन (दिशा सूचक यंत्र) की तरह है। भले ही आप एक ही भूमिका निभाते हुए दो बार एक ही प्रश्न पूछें, यह अपने उत्तरों के बीच झूल सकता है। यह भ्रमित या अस्थिर है।
निष्कर्ष: AI किस "परिवार" से संबंधित है, यह यहाँ सबसे अधिक मायने रखता है। Claude मॉडल सबसे अधिक "स्थिर हाथ" (बहुत सुदृढ़) थे। Grok मॉडल सबसे अधिक "डगमगाते" हुए पाए गए। दिलचस्प बात यह है कि AI को "स्मार्ट" बनाने (बड़ा आकार देने) से वह अनिवार्य रूप से अधिक स्थिर नहीं हुआ।
2. नैतिक संवेदनशीलता (Moral Susceptibility): "गिरगिट" का परीक्षण
यह क्या है: यदि आप एक चरित्र को "पाइरेट" (समुद्री डाकू) से बदलकर "टीचर" (शिक्षक) कर देते हैं, तो AI का उत्तर कितना बदल जाता है?
- उच्च संवेदनशीलता (High Susceptibility): AI एक गिरगिट है। वह अपने परिवेश से मेल खाने के लिए तुरंत अपने रंग (नैतिक विचार) बदल लेता है। यदि आप उसे एक समुद्री डाकू बनने के लिए कहते हैं, तो अचानक उसे लगता है कि चोरी करना ठीक है। यदि आप उसे एक नन (Nun) बनने के लिए कहते हैं, तो अचानक उसे लगता है कि चोरी करना भयानक है। उसका कोई मूल स्वरूप नहीं है; वह केवल भूमिका की नकल करता है।
- कम संवेदनशीलता (Low Susceptibility): AI एक चट्टान की है। उसके पास एक मजबूत आंतरिक दिशा-सूचक यंत्र है। चाहे आप उसे एक समुद्री डाकू बनने को कहें या एक नन, उसके निष्पक्षता या हानि के बारे में मूल विचार काफी हद तक समान रहते हैं। वह कहता है, "मैं एक समुद्री डाकू की भूमिका निभा रहा हूँ, लेकिन फिर भी मुझे लगता है कि चोरी करना गलत है।"
निष्कर्ष: यहीं आकार मायने रखता है। बड़े, अधिक जटिल AI मॉडल वास्तव में अधिक संवेदनशील थे। वे बेहतर "अभिनय" करने और चरित्र के अनुरूप अपने नैतिक विचारों को बदलने में बेहतर थे। छोटे मॉडल अधिक जिद्दी थे और अपने मूल विचारों को बनाए रखते थे।
बड़ी आश्चर्यजनक बातें
- "अभिनय" का विरोधाभास (The "Acting" Paradox): वे मॉडल जो सुसंगत रहने में सबसे अच्छे थे (Robust), वे वे भी थे जो नया रोल मिलने पर सबसे अधिक बदले (Susceptible)। यह एक महान अभिनेता की तरह है जो अपने प्रदर्शन में बहुत सुसंगत है, लेकिन पूरी तरह से अलग लोगों में बदलने में भी बहुत कुशल है।
- "Grok" अपवाद: Grok मॉडल दोनों में सबसे खराब थे। वे एक ही भूमिका निभाते समय अस्थिर थे, और जब भूमिका बदली तो उनके विचार भी पूरी तरह बदल गए। वे सबसे अप्रत्याशित थे।
- "Claude" चैंपियन: Claude परिवार सबसे विश्वसनीय था। वे सबसे सुसंगत अभिनेता थे और भूमिका बदलने पर भी सबसे स्थिर रहे।
यह क्यों मायने रखता है?
कल्पना कीजिए कि आप दो लोगों के बीच संघर्ष को सुलझाने में मदद करने के लिए एक AI का उपयोग कर रहे हैं।
- यदि AI में कम सुदृढ़ता (low robustness) है, तो यह आपको हर बार अलग सलाह दे सकता है, जिससे यह बेकार हो जाता है।
- यदि AI में उच्च संवेदनशीलता (high susceptibility) है, तो यह उस "विलेन" के नैतिक विचारों को अपना सकता है जिसे आप उसे बता रहे हैं, जिससे वह बुरे व्यवहार को सही ठहरा सकता है क्योंकि चरित्र ने ऐसा कहा था।
संक्षेप में: यह शोध पत्र हमें मापने का एक नया तरीका देता है कि एक AI का विवेक कितना "स्थिर" और "लचीला" है। यह हमें बताता है कि जबकि AI मनुष्यों की तरह अभिनय करने में बेहतर हो रहा है, हमें सावधान रहने की जरूरत है कि वे इतना अच्छा नाटक न करने लगें कि वे अपने स्वयं के नैतिक दिशा-सूचक यंत्र को ही खो दें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।