Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress
यह शोध पत्र इस धारणा को चुनौती देता है कि सांस्कृतिक रूप से संरेखित फाइन-ट्यूनिंग राजनीतिक लचीलापन सुनिश्चित करती है, यह प्रदर्शित करते हुए कि एक नियंत्रित ऑडिट के माध्यम से ओपन-वेट एलएलएम (LLM) का रूसी दुष्प्रचार के प्रति प्रतिरोध उनके नाममात्र के सांस्कृतिक मूल के बजाय कॉर्पस संरचना और भाषा कवरेज द्वारा निर्धारित होता है, जो एक विरोधाभास को प्रकट करता है जहाँ यूक्रेनी-उन्मुख मॉडल रूसी-उन्मुख मॉडलों की तुलना में कम प्रतिरोधी हो सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, कोरी स्लेट जैसा रोबोट मस्तिष्क (बेस मॉडल) है। आप इसे विभिन्न देशों के लोगों से बात करने के लिए सिखाना चाहते हैं, इसलिए आप इसे विशेष रूप से यूक्रेनियन, रूसी या बुल्गारियाई लोगों के लिए लिखी गई किताबों और लेखों का एक "विशेष आहार" देते हैं। इस प्रक्रिया को फाइन-ट्यूनिंग (fine-tuning) कहा जाता है।
सामान्य धारणा यह है कि: यदि आप रोबोट को यूक्रेनी किताबें खिलाते हैं, तो वह एक वफादार यूक्रेनी रक्षक बन जाएगा। यदि आप उसे रूसी किताबें खिलाते हैं, तो वह एक रूसी समर्थक बन जाएगा।
इस शोध पत्र ने युद्ध के दौरान इस धारणा का परीक्षण किया। शोधकर्ताओं ने चार अलग-अलग रोबोट मस्तिष्क (एक तटस्थ, एक "यूक्रेनी", एक "रूसी", और एक "बुल्गारियाई") से युद्ध के बारे में दस अलग-अलग विवादास्पद कहानियों पर निर्णय लेने के लिए कहा। उन्होंने एक ही प्रश्न तीन भाषाओं में पूछे: अंग्रेजी, यूक्रेनी और रूसी।
यहाँ उन्होंने क्या पाया, जिसे सरल भाषा में समझाया गया है:
1. "ट्रोजन हॉर्स" का आश्चर्य
शोधकर्ता उम्मीद कर रहे थे कि "यूक्रेनी" रोबोट रूसी झूठ को दृढ़ता से खारिज करेगा और "रूसी" रोबोट उन पर विश्वास करेगा। वे पूरी तरह से गलत थे।
- "यूक्रेनी" रोबोट (लापा): जब रूसी में पूछा गया, तो यह रोबोट रूसी दुष्प्रचार (propaganda) को पकड़ने में वास्तव में सबसे कमजोर था। इसने अक्सर रूसी झूठ को ऐसे व्यवहार किया जैसे वे वैध, ईमानदार तर्क हों। यह एक यूक्रेनी गाइड की तरह था जो, रूसी बोलते समय, अचानक ऐसा लगने लगा जैसे वह दुश्मन से सहमत हो।
- "रूसी" रोबोट (साइगा): आश्चर्यजनक रूप से, जब रूसी में पूछा गया, तो यह रोबोट रूसी दुष्प्रचार को खारिज करने में सबसे मजबूत था। यह एक रूसी गाइड की तरह था जो, अपनी ही भाषा में बात करते समय, अपने ही सरकार के झूठ के खिलाफ सच्चाई की पुरजोर रक्षा करता है।
उपमा: कल्पना कीजिए कि आपने एक वीआईपी (VIP) के लिए एक बॉडीगार्ड किराए पर लिया है। आप उम्मीद करते हैं कि वीआईपी के परिवार द्वारा किराए पर लिया गया बॉडीगार्ड उनकी सबसे अच्छी रक्षा करेगा। लेकिन इस अध्ययन में, परिवार द्वारा किराए पर लिया गया बॉडीगार्ड (यूक्रेनी मॉडल) वास्तव में घुसपैठिए के लिए दरवाजा खोल देता है जब घुसपैठिया एक विशिष्ट भाषा बोलता है। वहीं, घुसपैठिए की ओर से किराए पर लिया गया बॉडीगार्ड (रूसी मॉडल) घुसपैठिए के बोलने पर दरवाजा बंद कर देता है।
2. "भाषा परिवर्तन" का प्रभाव (The "Language Switch" Effect)
उपयोगकर्ता जिस भाषा में बात करता है, वह रोबोट के मस्तिष्क के लिए एक रिमोट कंट्रोल स्विच की तरह काम करती है।
- जब "यूक्रेनी" रोबोट से अंग्रेजी में पूछा गया, तो वह ठीक था।
- जब यूक्रेनी में पूछा गया, तो यह थोड़ा और खराब हो गया।
- जब रूसी में पूछा गया, तो यह सबसे खराब स्थिति में था।
भाषा ने केवल यह नहीं बदला कि वह कैसे बोलता है; इसने यह भी बदल दिया कि वह क्या मानता है। शोधकर्ता इसे "हिडन एजेंट इफेक्ट" (Hidden Agent Effect) कहते हैं। यह ऐसा है जैसे रोबट के अंदर अलग-अलग व्यक्तित्व छिपे हुए हैं, और आप जिस भाषा का उपयोग करते हैं वह उस विशिष्ट व्यक्तित्व को अनलॉक करने वाली कुंजी है। इस मामले में, "यूक्रेनी" रोबोट से रूसी में बात करना एक ऐसे व्यक्तित्व को अनलॉक कर देता था जो सच्चाई के बारे में बहुत भ्रमित था।
3. "गंभीर बनाम अनौपचारिक" परीक्षण (The "Serious vs. Chatty" Test)
शोधकर्ताओं ने रोबोट से दो तरीकों से पूछा:
- "गंभीर" तरीका: "एक इतिहासकार की तरह व्यवहार करें। दोनों पक्षों के तर्कों की सूची दें और एक प्रतिशत स्कोर दें।"
- "अनौपचारिक" तरीका: "बस मुझे कुछ वाक्यों में बताएं कि आप क्या सोचते हैं।"
कभी-कभी, रोबोट को "गंभीर" और विश्लेणात्मक होने के लिए कहने से वह और भी अधिक भ्रमित और पक्षपाती हो जाता था। जब कठिन रूप से तर्कों के बारे में सोचने के लिए मजबूर किया गया, तो रूसी भाषा में "यूक्रेनी" रोबोट ने वास्तव में झूठ को अधिक महत्व दिया। जब वह अनौपचारिक रूप से बात कर रहा था, तो वह कभी-कभी अधिक सटीक था। यह एक छात्र की तरह है जो, जब औपचारिक निबंध लिखने के लिए कहा जाता है, तो नियमों में इतना उलझ जाता है कि वह गलती से गलत पक्ष के लिए तर्क देने लगता है, लेकिन जब वह दोस्त से सामान्य बातचीत करता है, तो वह सही होता है।
4. "कठोर तथ्य" का कवच (The "Hard Facts" Shield)
एक चीज़ थी जिसने सभी रोबोटों को उनके पक्षपात से बचाया: कठोर, प्रलेखित तथ्य।
जब प्रश्न क्रीमिया (जिसके स्पष्ट अंतर्राष्ट्रीय कानूनी दस्तावेज़ हैं) या अत्याचारों (जैसे बुचा नरसंहार, जिसके वीडियो और फोरेंसिक प्रमाण हैं) के बारे में था, तो सभी रोबोटों ने सच्चाई पर सहमति जताई, चाहे उनका "आहार" या भाषा कुछ भी हो।
उपमा: इन रोबोटों को एक घर के रूप में सोचें। "फाइन-ट्यूनिंग" (विशेष आहार) दीवारों को एक निश्चित रंग में पेंट करने जैसा है। लेकिन यदि आप कमरे के बीच में एक विशाल, अचल स्टील की तिजोरी रखते हैं (कठोर तथ्य), तो पेंट का रंग कोई मायने नहीं रखता। तिजोरी सुरक्षित रहती है। रोबोट केवल उन विषयों पर विचलित हो सकते थे जहाँ साक्ष्य की "स्टील की तिजोरी" मौजूद नहीं थी।
मुख्य निष्कर्ष (The Big Takeaway)
इस शोध पत्र का मुख्य सबक एक चेतावनी है: सिर्फ इसलिए कि एक रोबोट किसी देश के साथ "सांस्कृतिक रूप से संरेखित" (culturally aligned) है, इसका मतलब यह नहीं है कि वह उस देश की सच्चाई की रक्षा करेगा।
शोधकर्ताओं ने पाया कि रोबोट ने जो किताबें पढ़ीं उसका कंटेंट (corpus composition) और उससे बात करने के लिए उपयोग की जाने वाली भाषा उसके "राष्ट्रीयता" से कहीं अधिक महत्वपूर्ण थे।
सबसे बड़ा खतरा जरूरी नहीं कि दुश्मन द्वारा बनाया गया रोबोट हो। असली खतरा आपके अपने पक्ष द्वारा बनाया गया वह रोबोट है, जो उस विशिष्ट भाषा में बात करने पर अनजाने में दुश्मन के झूठ को दोहराने लगता है क्योंकि उसे उस विशेष भाषा में उनके खिलाफ तर्क करने के लिए पर्याप्त प्रशिक्षित नहीं किया गया था।
संक्षेप में: आप यह मानकर नहीं चल सकते कि एक "यूक्रेनी" रोबोट हमेशा यूक्रेनी सच्चाई ही बताएगा। यदि आप उससे रूसी में बात करते हैं, तो वह आपको आश्चर्यचकित कर सकता है कि वह झूठ से सहमत हो रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।